腾讯 社会招聘
AI ⽹络集合通信库运营⼯程师
北京 ·两年以上工作经验·学历不限
北京
薪资面议
前往 腾讯 官网投递
职位描述
1.通信库运营保障:负责集合通信库(如 NCCL 等)在⼤规模 AI 训练/推理集群中的部署、配置、升级与⽇常运营,确保通信服务的⾼可⽤性和性能达标;
2.性能监控与优化:建设通信性能监控体系,持续跟踪 AllReduce/AllGather/All-to-All 等关键通信算⼦的带宽和延迟指标,识别性能退化并驱动优化;
3.故障诊断与恢复:快速响应训练 hang、通信超时、性能下降等故障,具备从业务现象出发逐层定位到通信库、传输层、硬件层根因的能⼒,缩短 MTTR;
4.业务⽀撑协同:与上层训练/推理框架团队紧密协作,理解不同并⾏策略(TP/PP/DP/EP/CP)对通信的需求,提供通信层⾯的调优建议;
5.⼯具与⾃动化建设:参与或主导通信诊断⼯具、⾃动化巡检、异常检测等运营⼯具的开发,提升运营效率和故障⾃愈能⼒;
6.容量规划与技术演进:根据业务增⻓和新硬件(NVLink/InfiniBand/RoCE)的引⼊,参与集群通信架构规划和通信库版本选型评估。
【任职要求】
一.基本要求;
1.计算机科学、通信⼯程、电⼦⼯程或相关专业,本科及以上学历;
2.两年以上相关⼯作经验(集合通信库开发、HPC 通信优化、AI 基础设施运营等⽅向均可);
二、专业技能;
1.集合通信原理:深⼊理解集合通信算⼦(AllReduce、AllGather、ReduceScatter、All-to-All 等)的原理和实现算法(Ring、Tree、Double Binary Tree 等),了解算法选择对性能的影响;
2.通信库实践:熟悉 NCCL 架构(Channel、Protocol、Transport、Proxy 等核⼼模块),有 NCCL 调优、问题排查或⼆次开发经验者优先;了解 DeepEP、Gloo、MSCCL 等其他通信库者加分;
3.底层通信机制:理解 GPU 机内通信机制(NVLink、NVSwitch、PCIe P2P、DMA、GPU Direct RDMA),掌握RDMA 通信原理(InfiniBand 或 RoCEv2);
4.AI 训练业务理解:了解⼤模型训练的主流并⾏策略(数据并⾏、张量并⾏、流⽔线并⾏、专家并⾏等),能理解不同并⾏模式对通信的带宽和延迟需求;
5.系统与⼯具:熟悉 Linux 系统环境,能熟练使⽤ nvidia-smi、DCGM、nccl-tests、Nsight Systems 等诊断⼯具;
6.编程能⼒:熟练掌握Python/go/bash等之⼀,熟悉AI辅助编程⼯具,具备阅读和修改通信库源码的能⼒;有 CUDA编程经验者优先;
三、能⼒素质;
1.问题定位能⼒:具备从业务现象到底层硬件的全栈排查思维,能在⾼压下快速缩⼩问题范围;
2.协作沟通能⼒:能与训练⼯程师、⽹络⼯程师、硬件⼯程师⾼效协同,⽤业务语⾔翻译技术问题;
3.持续学习意愿:AI 基础设施技术迭代快,需要持续跟进新硬件、新通信库版本和新并⾏范式;
4.⼯程化思维:注重⾃动化、可观测性、标准化,推动运营向。
最后确认在招:2026-09-03 23:15:16 · 来源平台:tencent