MiniMax 社会招聘
大模型训练系统专家
北京 ·经验不限·学历不限
北京·上海
薪资面议
前往 MiniMax 官网投递
职位描述
我们正在建设支撑大模型研发的下一代 AI 基础设施。
这里关注的不只是“把训练任务跑起来”,更需要为训练任务跑得稳(ETTR)、效率高(MFU)负责,让大规模、长周期的模型训练在复杂的软硬件环境中具备更好的可观测性、稳定性、可恢复性与可复现性。
你将工作在算法、训练框架与底层算力基础设施的交界处,负责大模型实验平台、训练稳定性、故障诊断与容错恢复、Checkpoint 及训练效率评估等关键系统,直接影响预训练与后训练的研发体验、迭代速度和算力产出。
本岗位不以算子开发或并行训练框架研发为核心,重点解决训练全生命周期中的系统基础设施问题。
职位描述
负责大模型实验与训练平台建设,覆盖训练数据管理、实验配置、任务编排、指标观测、产物管理、模型评测、结果追踪与实验复现,持续提升模型研发体验和迭代效率;
建设大规模分布式训练稳定性体系,围绕异常感知、故障诊断、根因定位、故障隔离、自动重试与断点恢复,形成“发现—诊断—恢复—治理”的完整闭环,提升长周期训练任务的成功率;
设计并优化高性能 Checkpoint 与训练状态管理系统,解决大规模并行训练中的高吞吐读写、异步及增量保存、一致性保障、跨拓扑恢复和存储成本等问题;
建设训练任务的全链路可观测与性能分析能力,联动调度、计算、网络和存储系统定位性能瓶颈,持续提升 GPU 有效利用率、TFLOPS和整体训练吞吐;
深入理解 Pretrain、SFT、RL 等训练工作流,与算法及训练框架团队紧密协作,将链路和工程实践沉淀为算法基建,支持新模型、新算法和新训练范式快速落地;
跟踪并探索超大规模预训练、故障自愈、高性能存储、弹性训练和 Self-Evolving Agents 等前沿方向,推动技术方案在真实训练场景中落地。
【任职要求】
大模型训练系统专家
实验平台 / 稳定性与容错 / Checkpoint / 训练可观测 / 训练效率
岗位介绍
我们正在建设支撑大模型研发的下一代 AI 基础设施。
这里关注的不只是“把训练任务跑起来”,更需要为训练任务跑得稳(ETTR)、效率高(MFU)负责,让大规模、长周期的模型训练在复杂的软硬件环境中具备更好的可观测性、稳定性、可恢复性与可复现性。
你将工作在算法、训练框架与底层算力基础设施的交界处,负责大模型实验平台、训练稳定性、故障诊断与容错恢复、Checkpoint 及训练效率评估等关键系统,直接影响预训练与后训练的研发体验、迭代速度和算力产出。
本岗位不以算子开发或并行训练框架研发为核心,重点解决训练全生命周期中的系统基础设施问题。
职位描述
负责大模型实验与训练平台建设,覆盖训练数据管理、实验配置、任务编排、指标观测、产物管理、模型评测、结果追踪与实验复现,持续提升模型研发体验和迭代效率;
建设大规模分布式训练稳定性体系,围绕异常感知、故障诊断、根因定位、故障隔离、自动重试与断点恢复,形成“发现—诊断—恢复—治理”的完整闭环,提升长周期训练任务的成功率;
设计并优化高性能 Checkpoint 与训练状态管理系统,解决大规模并行训练中的高吞吐读写、异步及增量保存、一致性保障、跨拓扑恢复和存储成本等问题;
建设训练任务的全链路可观测与性能分析能力,联动调度、计算、网络和存储系统定位性能瓶颈,持续提升 GPU 有效利用率、TFLOPS和整体训练吞吐;
深入理解 Pretrain、SFT、RL 等训练工作流,与算法及训练框架团队紧密协作,将链路和工程实践沉淀为算法基建,支持新模型、新算法和新训练范式快速落地;
跟踪并探索超大规模预训练、故障自愈、高性能存储、弹性训练和 Self-Evolving Agents 等前沿方向,推动技术方案在真实训练场景中落地。
职位要求
具备扎实的计算机体系结构、操作系统和分布式系统基础,能够系统分析并解决复杂的稳定性、性能和一致性问题;
熟悉 GPU 计算与大规模集群环境,对 Kubernetes、容器及云原生技术栈有实践经验;了解 RDMA、InfiniBand、RoCE、NVLink 等高速互联技术,以及分布式存储或高性能 I/O 系统;
理解大模型训练的基本原理和端到端工程链路,熟悉 PyTorch,以及 Megatron-LM、DeepSpeed、FSDP、Ray、verl 等框架中的一种或多种;
具备较强的问题抽象、故障排查和工程落地能力,能够从复杂现象中定位关键矛盾,并推动问题得到系统性解决;
熟练掌握 Go、Python、C++、Rust 中至少一种语言,具备良好的系统设计与工程实现能力,重视代码质量、可维护性、自动化测试和长期演进;
对 AI Infra有持续的热情和好奇心,关注行业技术演进,善于使用 AI Coding 等工具提升研发、测试和问题定位效率;
具备清晰严谨的表达能力和良好的跨团队协作意识,能够与算法、框架、调度、存储及硬件团队共同推动复杂项目落地。
加分项
有大规模训练平台、MLOps、集群调度、分布式作业系统或高性能计算系统的设计与研发经验;
有 Checkpoint、分布式存储、并行文件系统、数据加载或高性能 I/O 系统的相关经验;
有训练故障检测、根因分析、自动容错、异常节点治理或大规模可观测系统建设经验;
有超大规模 GPU 集群生产实践,或主导处理过长周期训练任务中的复杂稳定性问题;
有相关开源项目、技术论文或具有影响力的系统工程实践。
官网发布:2025-03-25 · 最后确认在招:2026-09-03 19:28:38 · 来源平台:feishu