直招.cv

← 返回职位列表

腾讯 社会招聘

AI ⽹络集合通信库运营⼯程师

北京 ·两年以上工作经验·学历不限

北京

职位描述

1.通信库运营保障:负责集合通信库(如 NCCL 等)在⼤规模 AI 训练/推理集群中的部署、配置、升级与⽇常运营,确保通信服务的⾼可⽤性和性能达标; 2.性能监控与优化:建设通信性能监控体系,持续跟踪 AllReduce/AllGather/All-to-All 等关键通信算⼦的带宽和延迟指标,识别性能退化并驱动优化; 3.故障诊断与恢复:快速响应训练 hang、通信超时、性能下降等故障,具备从业务现象出发逐层定位到通信库、传输层、硬件层根因的能⼒,缩短 MTTR; 4.业务⽀撑协同:与上层训练/推理框架团队紧密协作,理解不同并⾏策略(TP/PP/DP/EP/CP)对通信的需求,提供通信层⾯的调优建议; 5.⼯具与⾃动化建设:参与或主导通信诊断⼯具、⾃动化巡检、异常检测等运营⼯具的开发,提升运营效率和故障⾃愈能⼒; 6.容量规划与技术演进:根据业务增⻓和新硬件(NVLink/InfiniBand/RoCE)的引⼊,参与集群通信架构规划和通信库版本选型评估。 【任职要求】 一.基本要求; 1.计算机科学、通信⼯程、电⼦⼯程或相关专业,本科及以上学历; 2.两年以上相关⼯作经验(集合通信库开发、HPC 通信优化、AI 基础设施运营等⽅向均可); 二、专业技能; 1.集合通信原理:深⼊理解集合通信算⼦(AllReduce、AllGather、ReduceScatter、All-to-All 等)的原理和实现算法(Ring、Tree、Double Binary Tree 等),了解算法选择对性能的影响; 2.通信库实践:熟悉 NCCL 架构(Channel、Protocol、Transport、Proxy 等核⼼模块),有 NCCL 调优、问题排查或⼆次开发经验者优先;了解 DeepEP、Gloo、MSCCL 等其他通信库者加分; 3.底层通信机制:理解 GPU 机内通信机制(NVLink、NVSwitch、PCIe P2P、DMA、GPU Direct RDMA),掌握RDMA 通信原理(InfiniBand 或 RoCEv2); 4.AI 训练业务理解:了解⼤模型训练的主流并⾏策略(数据并⾏、张量并⾏、流⽔线并⾏、专家并⾏等),能理解不同并⾏模式对通信的带宽和延迟需求; 5.系统与⼯具:熟悉 Linux 系统环境,能熟练使⽤ nvidia-smi、DCGM、nccl-tests、Nsight Systems 等诊断⼯具; 6.编程能⼒:熟练掌握Python/go/bash等之⼀,熟悉AI辅助编程⼯具,具备阅读和修改通信库源码的能⼒;有 CUDA编程经验者优先; 三、能⼒素质; 1.问题定位能⼒:具备从业务现象到底层硬件的全栈排查思维,能在⾼压下快速缩⼩问题范围; 2.协作沟通能⼒:能与训练⼯程师、⽹络⼯程师、硬件⼯程师⾼效协同,⽤业务语⾔翻译技术问题; 3.持续学习意愿:AI 基础设施技术迭代快,需要持续跟进新硬件、新通信库版本和新并⾏范式; 4.⼯程化思维:注重⾃动化、可观测性、标准化,推动运营向。

最后确认在招:2026-09-03 23:15:16 · 来源平台:tencent