直招.cv

← 返回职位列表

小红书 · AI 工程/Infra 校园招聘

【2027校招】大模型训练框架研发工程师

杭州 ·经验不限·学历不限

北京市·上海市·杭州市

需精通PyTorch及至少一种训练框架的二次开发,理解分布式训练技术,熟悉大模型后训练算法,有框架研发或优化经验。

PyTorchMegatronDeepSpeed分布式训练RLHFCUDA Kernel昇腾MLOps

职位描述

1、RL 后训练框架研发: 负责 Relax RL 后训练框架的核心研发,支持 SFT、DPO、PPO、GRPO、RLVR 等主流后训练范式,持续追踪并落地前沿算法。 2、RL Pipeline 优化: 设计高效的 RL 训练 Pipeline,优化 Rollout、Reward Model、Actor、Reference Model 等模块间的资源调度与动态协同,提升端到端训练吞吐。 3、分布式训练优化: 基于 Megatron、SGLang 等训推框架,针对Agentic RL 场景调优 TP / PP / DP /SP 以及 PD分离、KV 压缩等策略,在性能、显存与稳定性之间取得最优平衡。 4、千卡训练稳定性建设: 攻克大规模训练中的显存管理、跨节点通信、弹性容错、任务调度与数据流转等核心挑战,提升训练成功率与集群资源利用率。 5、异构芯片训练适配: 负责训练框架在国产异构计算芯片(昇腾 / PPU / 昆仑芯 等)上的适配与优化,完成模型迁移、算子支持、框架适配、Profiling 与 Kernel 调优,推动国产算力在训练场景的规模化使用。 6、后训练工具链建设: 构建端到端后训练工具链,打通训练框架与 MLOps 平台,提供训练可视化、自动超参搜索、故障诊断等生产级能力,降低算法团队使用门槛。 7、业务协同与算法探索: 与算法团队紧密协作,支撑 LLM / MLLM / Agent 等业务方向在 SFT 与Agentic RL 领域的算法探索与工程落地。 【任职要求】 1、精通 PyTorch,具备训练框架源码级阅读与修改能力,有实际性能优化经验。 2、熟练掌握 Megatron、DeepSpeed、veRL、Slime、AReal、OpenRLHF 中至少一种框架的使用与二次开发。 3、理解分布式训练核心技术,包括 TP、PP、DP、ZeRO、序列并行、梯度累积、混合精度训练等。 熟悉 RLHF、DPO、PPO、GRPO、OPD、MOPD 等4、大模型算法流程,有实际训练调优或框架开发经验优先。 5、具备模型训练性能分析经验,能借助 Nsight Systems / Compute、nvprof、PyTorch Profiler 等工具定位训练性能瓶颈。 6、具备良好的工程实现能力、沟通协作能力和问题闭环意识。 加分项: 1、有千卡级大模型训练或后训练实战经验,成功解决过跨节点通信、容错训练、显存优化、训练稳定性等生产级问题。 2、熟悉 NCCL / RDMA / InfiniBand / RoCE 等高性能网络通信机制,能独立定位跨机通信瓶颈。 有 CUDA Kernel 开发经验,如 Fused Operator、FlashAttention、通信计算重叠(Overlap)等性能优化。 3、有国产异构芯片(昇腾 Ascend、平头哥 PPU、昆仑芯XPU)训练适配或 Kernel 开发经验,熟悉 CANN / ROCm 等基础软件栈;有大模型在国产芯片上规模化落地实战经验者优先。 4、深入理解 GPU / NPU 硬件架构(Tensor Core、内存层级、计算单元、通信拓扑),能结合硬件特性进行差异化训练优化方案设计。 5、参与过 Megatron、DeepSpeed、Slime、AReal、OpenRLHF、TRL 等开源项目的核心模块开发或贡献。 6、在大模型训练、分布式系统或 MLSys 方向有高水平学术论文发表。

官网发布:2026-09-01 · 最后确认在招:2026-09-07 20:27:27 · 来源平台:xiaohongshu