小米 社会招聘
MiMo算法研究员-后训练
北京 ·经验不限·学历不限
北京
薪资面议
前往 小米 官网投递
职位描述
我们是小米MiMo团队的 Post-train 组,专注模型对齐、可扩展强化学习、AI Agent 等前沿方向,致力于产出世界级研究成果与模型。
我们拥有充足算力与真实应用场景,汇聚了一批对 AGI 怀有长期信念、追求技术深度的研究者与工程师。在开放、专注的氛围中,我们鼓励从第一性原理出发,共同探索通往更高级人工智能的路径。
主要研究方向
1. AI 智能体 (AI Agent)
- Agent 基础能力:研发大规模、高质量的 Agent 数据合成管线,提升模型在 Code、Search 及 General Tool Use 使用等场景下的能力。
- 高级 Agent 系统:探索多智能体协作、长时记忆系统及交互环境的构建,提升模型解决复杂任务能力。
2. 大语言模型推理 (LLM Reasoning)
- 强化学习与推理:探索高效、稳定的强化学习算法。
- 推理能力提升:增强模型在数学、代码与逻辑等复杂任务中的推理能力,提升模型的智能上限。
3. 可扩展对齐 (Scalable Alignment)
- 模型对齐与 RLHF:持续提升模型的指令遵循度、有用性与诚实性。
- AI 安全与价值观:为大模型构建可靠、可信的行为准则,提升 AI 安全性。
【任职要求】
我们对你的期待
- 拥有大语言模型 Post-train(如 SFT, RLHF, RLVR, Agent)相关的研究或项目实践经验。
- 具备扎实的 Data Sense 和 Evaluation Sense,能够以问题为导向,通过严谨的实验设计和数据分析驱动模型迭代。
- 具备出色的编程与工程能力,熟练掌握 PyTorch 等深度学习框架,并对 Verl、Megatron 等分布式训练方法有深入理解;熟悉 SGLang、vLLM 等高性能推理引擎。
加分项
- 作为主要贡献者主导或参与过有影响力的开源项目。
- 在 NeurIPS、ICML、ICLR、ACL、EMNLP 等人工智能顶级会议或学术期刊上发表过高质量论文。
- 在 IMO/CMO、IOI/NOI、ACM-ICPC 等国内外知名竞赛中取得过优异成绩。
官网发布:2026-03-25 · 最后确认在招:2026-09-03 23:18:29 · 来源平台:xiaomi