Token Foundry · 校园招聘
千问Qwen训练算法-系统协同前沿技术研究-阿里星
杭州 ·经验不限·学历不限
北京·杭州·上海
职位描述
加入我们,你将以算法-系统协同设计(Algorithm-System Codesign) 为核心方法论,深度参与千问Qwen系列大模型预训练的核心算法与架构设计。当前千问Qwen正加速向极度稀疏Fine-Grained MoE与超长上下文高效训练方向演进,你将参与训练/推理效率友好的模型结构设计,定义训练稳定性与量化友好方案,参与Self-Evolving训练闭环的Infra设计建设,与Infra团队协同落地,在万卡规模下推动Scaling Efficiency的持续突破。
1. 万卡训练稳定性保障
(1)训练任务稳定性:深度参与万卡集群训练的系统级稳定性保障,从算法与框架层面设计容错策略,包括Checkpoint一致性保障、故障恢复后的训练状态对齐、并行拓扑变更下的梯度一致性维护。
(2)Loss稳定性:研究并干预训练过程中的Loss异常现象,包括Loss Spike归因与干预、梯度爆炸/消失的算法级预防、数值溢出检测与自动修复、高稀疏MoE下Activation Explosion的抑制方案。
(3)量化友好设计:从模型架构与训练策略层面设计Quantization-Friendly的方案,包括量化感知训练(QAT)策略、激活值分布约束、FP8/低精度训练的数值稳定性设计,确保模型在训练阶段即考虑部署时的量化兼容性。
(4)与Infra团队协同,建立训练异常的自动化检测、诊断与告警机制,实现Loss/梯度/激活的实时监控与根因分析。
2. 效率友好的模型结构设计
(1)从训练效率与推理成本视角深度参与模型结构设计,为架构决策提供量化依据:
·极度稀疏Fine-Grained MoE:评估不同潜空间维度、Expert池规模、激活数、负载均衡策略对训练吞吐、通信开销、显存占用的综合影响,选型效率最优的稀疏MoE方案与全局均衡算法。
·高效长上下文Attention:评估混合注意力架构、线性注意力变体、KV压缩方案在百万Token上下文下的训练FLOPs效率与推理KV Cache开销,选型对Context Parallel与Kernel效率最友好的方案。
·与Infra团队协同,将效率评估结论转化为通信模式需求与Kernel需求,推动算法-系统联合设计。
3. Self-Evolving训练闭环的Infra建设
(1)评估Self-Evolving在Qwen场景下的Infra可行性与ROI,从数据规模、训练成本、迭代效率三个维度进行量化判断。
(2)深度参与大模型Self-Evolving机制的训练基础设施建设,构建支持模型自我演进的规模化训练闭环:
·设计自生成-评估-回灌的数据流水线,搭建支持Self-Play/自蒸馏/迭代式自训练的多阶段训练编排与调度,平衡Rollout/Training/Evaluation三阶段的资源分配与流水线Overlap,确保自演进过程可控可观测。
4. 前沿技术追踪与选型判断
(1)持续追踪SOTA预训练技术,从算法收益、系统开销、工程风险三个维度进行量化评估与选型决策。
(2)推动前沿技术从论文复现到万卡规模验证的全流程落地。
(3)鼓励在NeurIPS/ICLR/MLSys等顶会发表算法与系统交叉方向的研究成果。
【任职要求】
1. 学历与理论基础
(1)全球Top高校计算机科学、人工智能等相关领域博士/顶尖硕士。
(2)扎实的深度学习理论基础,对Transformer架构有原理级理解。
(3)在MoE(路由策略、负载均衡、Fine-Grained稀疏、Expert Collapse)和/或Attention(混合注意力、MLA、线性Attention、长上下文训练)方向有深入研究。
2. 算法-系统协同能力(核心门槛)
(1)精通PyTorch,熟悉Megatron-LM等训练框架的工作机制。
(2)具备算法-系统联合思考能力:评估MoE路由策略时能建模通信开销与负载均衡效率;评估Attention变体时能判断对并行策略与Kernel效率的影响。
(3)有向Megatron-LM/DeepSpeed/vLLM/PyTorch等开源框架贡献核心代码的经历者优先。
3. 分布式训练经验
(1)具备千卡/万卡级分布式训练的实际操作经验。
(2)有MoE训练优化、长上下文预训练、或大规模模型稳定性保障中至少一项实战经验。
4. 编程与工程素养
(1)精通Python,具备CUDA/Triton Kernel开发能力或强烈意愿。
(2)极强的代码功底与工程实践能力,ACM/ICPC等编程竞赛获奖者优先。
(3)优秀的跨团队技术沟通能力,能在算法与Infra团队之间建立高效技术对话。
5. 研究志向
(1)持续关注大模型预训练前沿(新型架构、新型优化器、新型并行范式),不满足于"跟随开源",有志于定义下一代大模型预训练算法与架构。
加分项
1. 万卡级MoE/长文本预训练实操与稳定性保障经验。
2. NeurIPS/ICLR/MLSys/ASPLOS等发表MoE架构优化、高效Attention、Self-Evolving相关论文。
3. Megatron-LM/DeepSpeed/vLLM等框架的可追溯核心代码贡献。
4. 极度稀疏MoE负载均衡、线性注意力长上下文训练、Self-Play/自蒸馏Infra建设等方向的研究背景。
5. 算法-系统交叉研究。
最后确认在招:2026-09-01 19:06:52 · 来源平台:alibaba