小米 校园招聘
顶尖应届-MiMo后训练Agent研究员-MiMo
北京 ·经验不限·学历不限
北京
薪资面议
前往 小米 官网投递
职位描述
我们是小米大模型团队的 Post-training Agent Group,专注于 AI Agent 的研究前沿,持续推动模型智能上限。
我们致力于构建能够在开放环境中理解目标、自主规划并在长周期交互中保持稳定可靠的 Agent 系统。我们的目标,是将这些能力沉淀为模型内生、可泛化、可扩展的基础能力。
团队拥有充足的计算资源,并能够直接连接大规模真实应用场景,让研究想法在前沿模型、真实任务和用户反馈中得到快速验证。
研究方向
1、构建覆盖 Coding、Visual、General Agent 以及长程任务场景的评测体系,系统刻画模型能力边界,并通过分析模型行为与失败模式,识别制约能力提升的关键瓶颈;
2、构建大规模、高质量的数据合成与筛选流程,持续提升模型在代码生成、搜索和通用工具使用等方向的基础能力;
3、研究 Agentic RL 算法,设计有效的奖励信号、grader 以及 credit assignment 机制解决长程交互、稀疏奖励 和 reward hacking 等问题;
4、提升大规模 Agent 强化学习的稳定性、训练效率与可扩展性;
5、通过大规模 Agent 强化学习提升 Agent 在未见任务、长程任务和开放环境中的泛化能力与可靠性;
6、探索 self-improvement、持续学习,以及模型与 Agent Harness 的协同演进。
【任职要求】
1、硕博以上学历,计算机相关专业, 具有 LLM post-training、Agent、RL 或模型评测方面的实际研究或项目经验;
2、出色的 Data Sense 与 Evaluation Sense,能够通过严谨的实验设计、分析和迭代持续提升模型能力;
3、扎实的编程和工程能力,熟练使用 Python、PyTorch,能够将研究想法实现为可靠、可复现、可扩展的实验系统;
4、优秀的 Research Taste 和 High Agency,认同第一性原理与长期主义。 在 NeurIPS、ICML、ICLR、ACL、EMNLP 等顶级 AI 会议或期刊发表过高质量研究
5、在有影响力的开源项目中做出过重要贡献;
6、在 IMO/CMO、IOI/NOI、ACM-ICPC 等高水平数学、信息学或程序设计竞赛中取得突出成绩
官网发布:2026-07-20 · 最后确认在招:2026-09-03 23:17:24 · 来源平台:xiaomi