美团 校园招聘
【大模型北斗实习】通用强化学习研究
北京 ·经验不限·学历不限
北京市·上海市
薪资面议
前往 美团 官网投递
职位描述
RL 技术和 Reasoning 技术是大模型处理各项复杂任务的核心。本课题聚焦于利用上述技术,构建能够应对多目标优化、长期规划和不确定性的智能决策系统。
主要研究内容包括但不限于:
1)多层次强化学习设计:研究 Hierarchical RL 与 LLM 的结合方法,构建能够处理抽象策略与具体执行的多层次决策系统;探索如何将复杂的系统任务分解为可管理的子任务,并能找到准确稠密的反馈信号,构建 Local RM 和 Global RM,进而完成可依赖和全局的优化。
2)Reasoning 技术:针对不同的任务,能对 Reasoning 过程的 Token Budget、Reasoning 路径等,有稳定可控的方式,且能实现任务自适应。
3)RL & Reasoning Scaling Law:探索高效的 RL Scaling 技术和 Test Time Scaling 技术,不断提升模型能力,且能兼顾探索利用和 Compute Cost。
【任职要求】
1)计算机科学、人工智能、机器学习或相关专业背景。
2)熟练掌握 Python,具备高效实现和优化强化学习算法的能力。
3)扎实的强化学习理论基础,熟悉分层强化学习、多智能体强化学习、贝叶斯强化学习等高级算法框架。
4)熟悉 LLM 及其与 RL 结合的前沿技术。
5)熟悉 Reasoning 相关技术。
加分项:
1)在NeurIPS、ICLR、ICML等顶级会议发表过 RL 或决策系统相关论文。
2)参与过大规模 RL 系统的实际部署,并解决过生产环境中的稳定性和效率问题。
官网刷新:2025-05-23 · 最后确认在招:2026-09-03 19:50:14 · 来源平台:meituan