MiniMax 社会招聘
大模型工程师-RL框架&算法
北京 ·经验不限·学历不限
北京·上海
薪资面议
前往 MiniMax 官网投递
职位描述
职位描述
RL 正在成为提升大模型能力的重要方向。大规模 RL 的效率和上限,不仅取决于算法设计,也高度依赖底层系统能力,包括 RL 框架、Rollout、推理 serving、调度策略、环境交互和系统稳定性。
MiniMax 自研强化学习训练系统 Forge,支撑大规模 RL 训练和 Rollout。Rollout 往往占据 RL 循环中的大量 wall-clock time,其生成效率、稳定性和灵活性,会直接影响算法迭代速度、实验规模和策略探索空间。
我们关注 RL 训练链路中的核心系统问题:如何更高效地生成轨迹,如何支持多轮交互、工具调用和复杂环境,如何降低长尾延迟,如何提升推理吞吐和资源利用率,以及如何让推理系统、模型结构和训练算法协同优化。
你会参与:
1. 建设和优化 Forge RL 框架,支撑大规模 RLHF / RLVR / Agentic RL 等训练任务;
2. 优化 RL Rollout 系统,支持多轮交互、环境调用、工具调用、外部状态机感知等复杂场景;
3. 优化 Rollout 过程中的调度策略、长尾 latency、KV Cache 管理和整体吞吐表现;
4. 建设高性能推理 serving 能力,支撑 RL 场景下更高效、更稳定、更灵活的轨迹生成;
5. 与算法团队共同进行 RL 算法与推理系统的 co-design,提升模型能力和实验效率。
我们希望系统不仅是算法方案的执行层,也能够参与到模型结构、训练算法和推理效率的联合设计中。一方面,系统能力需要支撑算法探索;另一方面,推理效率和系统成本也应反向参与技术方案判断。
【任职要求】
基本要求:
1. 编程能力扎实,具备清晰的系统设计思路和良好的工程品味;
2. 对大模型推理系统、RL 工程、分布式系统或 GPU 性能优化中的某一方向有深入理解;
3. 能够独立发现 RL 训练或 Rollout 链路中的系统瓶颈,提出方案并推动落地;
4. 关注 RL、推理系统、Agentic workflow 等方向,愿意理解算法需求背后的系统问题。
加分项:
1. 熟悉 SGLang、vLLM、TensorRT-LLM、PyTorch、Megatron-LM 等主流推理/训练框架,并有深入使用或贡献经验;
2. 熟悉 KV Cache 管理、continuous batching、PD 分离、MTP、低精度量化、分布式 serving、通信优化等推理加速技术;
3. 有大规模 RLHF / RLVR / Agentic RL 工程经验,或参与过 Rollout 系统、RL 训练框架建设;
4. 熟悉主流大模型结构,能够理解模型设计中的效率 / 能力 trade-off;
5. 有大规模推理系统、在线 serving、GPU 性能优化或高性能系统工程经验。
官网发布:2026-09-04 · 最后确认在招:2026-09-04 19:12:14 · 来源平台:feishu