直招.cv

← 返回职位列表

MiniMax 社会招聘

大模型工程师-RL框架&算法

北京 ·经验不限·学历不限

北京·上海

职位描述

职位描述 RL 正在成为提升大模型能力的重要方向。大规模 RL 的效率和上限,不仅取决于算法设计,也高度依赖底层系统能力,包括 RL 框架、Rollout、推理 serving、调度策略、环境交互和系统稳定性。 MiniMax 自研强化学习训练系统 Forge,支撑大规模 RL 训练和 Rollout。Rollout 往往占据 RL 循环中的大量 wall-clock time,其生成效率、稳定性和灵活性,会直接影响算法迭代速度、实验规模和策略探索空间。 我们关注 RL 训练链路中的核心系统问题:如何更高效地生成轨迹,如何支持多轮交互、工具调用和复杂环境,如何降低长尾延迟,如何提升推理吞吐和资源利用率,以及如何让推理系统、模型结构和训练算法协同优化。 你会参与: 1. 建设和优化 Forge RL 框架,支撑大规模 RLHF / RLVR / Agentic RL 等训练任务; 2. 优化 RL Rollout 系统,支持多轮交互、环境调用、工具调用、外部状态机感知等复杂场景; 3. 优化 Rollout 过程中的调度策略、长尾 latency、KV Cache 管理和整体吞吐表现; 4. 建设高性能推理 serving 能力,支撑 RL 场景下更高效、更稳定、更灵活的轨迹生成; 5. 与算法团队共同进行 RL 算法与推理系统的 co-design,提升模型能力和实验效率。 我们希望系统不仅是算法方案的执行层,也能够参与到模型结构、训练算法和推理效率的联合设计中。一方面,系统能力需要支撑算法探索;另一方面,推理效率和系统成本也应反向参与技术方案判断。 【任职要求】 基本要求: 1. 编程能力扎实,具备清晰的系统设计思路和良好的工程品味; 2. 对大模型推理系统、RL 工程、分布式系统或 GPU 性能优化中的某一方向有深入理解; 3. 能够独立发现 RL 训练或 Rollout 链路中的系统瓶颈,提出方案并推动落地; 4. 关注 RL、推理系统、Agentic workflow 等方向,愿意理解算法需求背后的系统问题。 加分项: 1. 熟悉 SGLang、vLLM、TensorRT-LLM、PyTorch、Megatron-LM 等主流推理/训练框架,并有深入使用或贡献经验; 2. 熟悉 KV Cache 管理、continuous batching、PD 分离、MTP、低精度量化、分布式 serving、通信优化等推理加速技术; 3. 有大规模 RLHF / RLVR / Agentic RL 工程经验,或参与过 Rollout 系统、RL 训练框架建设; 4. 熟悉主流大模型结构,能够理解模型设计中的效率 / 能力 trade-off; 5. 有大规模推理系统、在线 serving、GPU 性能优化或高性能系统工程经验。

官网发布:2026-09-04 · 最后确认在招:2026-09-04 19:12:14 · 来源平台:feishu