直招.cv

← 返回职位列表

Token Foundry · 校园招聘

千问Qwen基础大模型训练调度与框架协同优化-阿里星

杭州 ·经验不限·学历不限

北京·杭州

职位描述

1.设计和开发面向大规模模型训练的任务智能调度系统,实现调度器与训练框架的深度协同,使资源分配能够感知并行策略拓扑、通信模式和显存需求,提升集群级训练效率和资源利用率; 2.负责大模型训练引擎与运行时系统的核心架构设计与研发,支持 PyTorch、Megatron-LM、DeepSpeed、FSDP、MoE 等主流训练框架在 Kubernetes 环境下的高性能运行;建设统一的训练任务生命周期管理、分布式启动、资源隔离与训练编排能力,支撑大规模预训练、SFT 与 RL 等场景。 3.研究和实现面向超大规模卡级大模型训练的高可用与弹性运行机制,构建支持节点故障感知、训练任务自动恢复、弹性扩缩容及并行拓扑动态重构的训练体系;优化分布式 checkpoint、故障恢复与重调度链路,降低大规模训练中的中断、重启与资源等待开销,提升长周期训练任务的稳定性、资源可用性与整体 Goodput。 4.研究和实现面向大规模训练任务的智能诊断与自动容错能力,建设覆盖 GPU、网络、NCCL、存储及训练框架的全链路监控与异常检测机制;支持断点续训、Pod 级快速拉起、节点自愈、训练任务局部恢复与动态降级,缩短故障定位与恢复时间,降低因异常导致的训练 Badput 与有效算力损耗。 5.探索前沿技术,对平台演进中的技术需求(如多阶段训练流水线编排、训练-推理混合调度、异构集群适配等)进行预研和设计。 【任职要求】 1.具备扎实的计算机基础知识和分布式系统研发经验,C++/Python 编程能力强,对操作系统原理、计算机网络、分布式一致性等系统领域知识有较好的理解和项目应用经验。 2.熟悉深度学习基本原理和主流深度学习框架(PyTorch),了解分布式训练的基本并行策略(DP/TP/PP/EP)和通信原语(NCCL、AllReduce、P2P)。 3.熟悉 Megatron-LM、DeepSpeed、TransformerEngine、DualPipe 等训练框架技术,并在研究或实习项目中有相应的实践经历。 4.具有很强的学习能力、复杂问题归纳梳理能力、沟通和团队协作能力,具备能够深度钻研技术的耐心。 加分项: 1.有很强的学术研究能力和优秀的学术成果(分布式系统/AI 系统/高性能计算领域顶会/顶刊论文); 2.熟悉集群调度系统(Kubernetes、YARN、自研调度器)的设计与实现; 3.有万卡级大模型训练实战经验,了解训练中的故障模式和稳定性优化; 4.作为核心贡献者参与开发或负责维护 AI 领域的流行开源项

最后确认在招:2026-09-01 19:06:52 · 来源平台:alibaba