直招.cv

← 返回职位列表

阿里云智能 · 校园招聘

AI Infra高性能通信与传输系统-阿里星/A Star

杭州 ·经验不限·学历不限

北京·杭州

职位描述

大模型时代正在深刻重塑数据中心基础设施的技术栈。随着大语言模型参数规模从千亿级跃迁至万亿级(如 DeepSeek-V3 的 671B MoE 架构、GPT-4 级别模型),分布式训练与推理对底层通信系统的带宽、延迟和可扩展性提出了前所未有的要求。与此同时,MoE 专家并行引入的 All-to-Allv 通信模式、PD 分离推理架构中的分布式 KV Cache 跨节点存储与传输、以及集合通信库 NCCL 在超大规模集群下的通信优化,构成了 AI 基础设施领域最具挑战性的技术方向。 我们需要具有深厚理论功底和极强工程落地能力的博士人才,实现从通信库、通信算法到网络协议栈的全栈优化,为大模型训练和推理提供极致的通信性能,定义未来智算网络的行业标准。 【岗位职责】 您将作为核心骨干,深度参与以下一个或多个方向的研究与落地: 1.通信库算法设计与优化:针对大模型并行训练场景(Data/Tensor/Pipeline Parallelism),设计高效的集合通信原语(AllReduce, AllGather等)。 研究计算与通信重叠(Overlap)机制,开发自适应调度算法,最大化GPU/NPU利用率。 2.MoE 专家并行通信方案设计与实现:针对 MoE 架构的 All-to-All 通信瓶颈,设计和实现高效的 Dispatch/Combine 通信方案,研究通信-计算重叠、低 SM 占用通信 Kernel、不规则流量聚合调度等优化技术。 3.分布式 KV Cache 传输系统建设:面向 PD 分离推理架构,基于 RDMA 构建跨节点 KV Cache 高速迁移系统,结合流水线化的 KV Block 传输,研究 KV Cache 量化压缩与分层缓存(HBM → DRAM → NVMe)策略。 4.超节点混合通信调度:针对超节点架构,建立 Scale-up 域内与 RDMA 域间通信的协同调度模型,研究并行策略(数据并行、张量并行、流水线并行、专家并行)的通信建模与自动搜索,为上层训练/推理框架提供拓扑感知的通信决策支持。 【任职要求】 基本要求 1、获得计算机科学与技术、计算机网络、通信工程、电子工程等相关专业博士学位。 2、在顶级会议或期刊(如SIGCOMM, NSDI, ISCA,SC, HPCA, ATC, IEEE/ACM ToN等)以第一作者身份发表过高水平论文者优先。 核心技能(满足其一即可,多项兼备者极佳) 1、分布式系统经验,对RDMA网络、熟悉NCCL、RCCL、MPI等通信库源码,有大规模分布式训练系统优化经验者优先; 2、有过大模型训练稳定性相关开发或者运维经验者优先,如大模型训练的故障定位,性能定位经验; 3、对大模型训练和推理框架熟悉,有分布式训练推理集合通信性能优化经验,或者kv cache通信优化经验、或者计算通信overlapping经验者优先; 4、算法与仿真能力:具备极强的数学建模能力,熟练使用NS-3、Omnet++或自研仿真器进行网络性能评估。 综合素质 1、对AI基础设施领域充满热情,具备敏锐的技术洞察力,能够独立思考并定义前沿问题; 2、具备优秀的代码能力(C/C++/Go/Python),不仅限于理论研究,更渴望将算法落地到实际产品中; 3、良好的沟通协作能力,能够跨团队(算法、芯片、系统、业务)推动复杂项目进展。

最后确认在招:2026-09-01 19:06:52 · 来源平台:alibaba