Token Foundry · 校园招聘
千问Qwen基础大模型RL Infra-阿里星
杭州 ·经验不限·学历不限
北京·杭州
职位描述
Qwen正迈向数T参数规模参数MoE、多模态强推理与自我反思能力的新阶段,基于人类反馈的强化学习(RLHF)已成为能力质变的关键。然而,现有训练架构面对千卡到万卡集群、复杂多轮交互及自我博弈等前沿范式,效率与灵活性已触及瓶颈。你需要定义并构建下一代RL训练引擎——它将是驱动Qwen超大规模进化的算力心脏。这不仅是工程挑战,更是定义大模型对齐与涌现范式的科研无人区。
岗位职责:
1. 设计支持数T参数MoE模型的分布式RL架构,实现计算、通信与采样的极致重叠,数倍提升吞吐量。
2. 构建高度解耦的算法支持框架,使On/Off-Policy算法可敏捷迭代与混合部署。
3. 实现推理与训练资源的统一弹性调度,让“推理时搜索”“反思”等产生训练信号的环节与大规模训练无缝协同,最小化GPU空转。
4. 建立自愈式的训练稳定性体系,突破长周期、超大规模下的数值收敛与故障自恢复难题。
【任职要求】
1. 学术成果:海内外顶尖高校博士,在分布式系统、机器学习系统或强化学习领域有扎实研究背景,以第一作者在OSDI,SOSP,NSDI等顶会发表过高质量论文。
2. 技能与系统能力:精通PyTorch及分布式训练技术,对PPO、GRPO等RLHF算法有原理级理解与实现经验;熟悉NCCL、RDMA等通信优化及GPU集群调度,具备万卡规模训练调优实战能力。
3. 工程与创新落地:能将算法创新高效转化为工业级系统,有强代码工程能力,善于在计算、通信与采样之间挖掘极致吞吐性能。
4. 软实力:自驱力强,有开拓技术无人区的魄力,渴望在超大规模RL基础设施方向做出定义性工作。
最后确认在招:2026-09-01 19:06:52 · 来源平台:alibaba