直招.cv

← 返回职位列表

MiniMax 社会招聘

大模型训练框架工程师

北京 ·经验不限·学历不限

北京·上海

职位描述

训练顶尖大模型不仅依赖算法创新,也依赖稳定、高效、可扩展的训练系统。随着模型规模和训练复杂度持续提升,训练效率、并行策略、通信开销、显存管理、Checkpoint、容错恢复、大规模数值正确性保证和系统稳定性,都会直接影响模型迭代速度和能力上限。 我们正在建设 MiniMax 大模型训练框架,支撑更大规模、更高效率、更稳定的训练任务。你将与算法团队在模型架构设计和训练方案制定阶段深度协作,从系统视角参与技术判断,识别潜在瓶颈,并推动训练系统持续优化。 你会参与: - 建设和优化大规模训练框架,支撑千卡/万卡级别训练任务; - 优化数据并行、张量并行、流水线并行、专家并行等并行策略; - 解决大规模训练中的通信、显存、Checkpoint、容错恢复、数值正确性校验和稳定性问题; - 分析模型结构、训练策略与系统效率之间的关系,提升训练吞吐、资源利用率和迭代效率; - 跟进 PyTorch、Megatron-LM、DeepSpeed、TorchTitan 等训练框架及相关前沿工作,并结合实际训练场景落地。 我们希望你在分布式系统、GPU 性能优化、并行计算、通信优化、训练框架或系统稳定性等方向具备扎实积累,同时对大模型训练系统保持持续兴趣,愿意面对真实复杂系统中的高难度问题。 【任职要求】 基本要求: - 编程能力扎实,具备清晰的系统设计思路和良好的工程品味; - 对大模型训练系统、分布式系统、并行计算、GPU 性能优化或大规模数值正确性保障中的某一方向有深入理解; - 能够独立定位系统问题,提出可落地的优化方案并推动实施; - 关注算法与系统前沿,能够将论文或开源框架中的思路转化为工程判断。 加分项: - 熟悉 PyTorch、Megatron-LM、DeepSpeed、Colossal-AI、TorchTitan 等训练框架,并有深入使用或贡献经验; - 有千卡/万卡规模训练系统经验; - 熟悉 NCCL、RDMA、CUDA、Triton、通信优化、显存优化、Checkpoint 优化、大规模训练数值稳定性与正确性保障等技术; - 有 MoE 训练、长序列训练、混合并行策略优化或训练稳定性治理经验。

官网发布:2026-09-04 · 最后确认在招:2026-09-04 19:12:14 · 来源平台:feishu