直招.cv

← 返回职位列表

字节跳动 社会招聘

AIOps开发工程师-基础设施

北京 ·经验不限·学历不限

北京

职位描述

1、构建全景网络可观测性平台:打造覆盖物理和虚拟网络的Streaming Telemetry数据管道,整合GNMI、NETCONF、IPFIX/NetFlow、SNMP等多源数据,为AIOps提供高质量、高时效性的数据基石; 2、研发智能诊断与根因分析系统:应用机器学习与深度学习算法,对海量网络指标、日志、事件进行异常检测、关联分析与智能降噪,快速定位从光模块、交换机硬件、协议邻居到应用层流量的全链路故障根因; 3、探索LLM与Agent的创新应用: 1)智能运维助理:构建基于RAG(检索增强生成)的运维对话机器人,使其能理解自然语言问题,自动查询知识库与监控数据,提供精准的故障排查指引和网络状态报告;2)自动化修复与智能Runbook:训练运维Agent,使其能够安全、可控地调用网络工具与API;基于对故障场景的理解,自主生成、推荐甚至执行修复方案与应急预案(Runbook); 4、建设容量与风险预测能力:基于历史数据和业务增长模型,预测网络容量瓶颈、高风险链路与“亚健康”设备,驱动主动扩容和预防性维护; 5、打造坚如磐石的工程体系:遵循最佳工程实践,设计和开发高可用、可扩展的AIOps平台与服务;保障从数据采集、模型训练、在线推理到自动化闭环全流程的稳定性和性能。 【任职要求】 1、扎实的计算机与网络基础:深刻理解数据中心网络架构(如Spine-Leaf Fabric),熟悉EVPN/VXLAN、BGP/OSPF等关键协议,并对Linux网络协议栈有深入的了解; 2、卓越的软件工程能力:精通Golang或Python,具备出色的编码和系统设计能力;熟悉微服务、容器化(Docker/Kubernetes)以及CI/CD等现代软件开发流程; 3、丰富的平台研发经验:在以下一个或多个领域有实践经验者优先: 1)大数据处理:熟悉Kafka、Flink、ClickHouse/TSDB等,有构建实时数据管道和分析系统的经验; 2)可观测性技术:熟悉Prometheus/OpenTelemetry、图数据库(如Neo4j),有告警与事件平台开发经验; 4、AIOps/ML/LLM的实践热情: 1)对应用机器学习(如异常检测、事件关联、根因分析)解决实际运维问题充满热情,有相关项目经验; 2)密切关注大模型与Agent技术发展,对LLM在运维领域的应用(如RAG、工具调用、安全评估)有思考或实践经验; 5、优秀的综合素质:具备强烈的技术好奇心、出色的问题分析与解决能力,以及良好的沟通协作精神;你能够将复杂的场景抽象为清晰的技术方案,并推动其落地。

官网发布:2026-03-17 · 最后确认在招:2026-09-03 19:35:21 · 来源平台:feishu