直招.cv

← 返回职位列表

美团 校园招聘

【大模型北斗实习】通用强化学习研究

北京 ·经验不限·学历不限

北京市·上海市

职位描述

RL 技术和 Reasoning 技术是大模型处理各项复杂任务的核心。本课题聚焦于利用上述技术,构建能够应对多目标优化、长期规划和不确定性的智能决策系统。 主要研究内容包括但不限于: 1)多层次强化学习设计:研究 Hierarchical RL 与 LLM 的结合方法,构建能够处理抽象策略与具体执行的多层次决策系统;探索如何将复杂的系统任务分解为可管理的子任务,并能找到准确稠密的反馈信号,构建 Local RM 和 Global RM,进而完成可依赖和全局的优化。 2)Reasoning 技术:针对不同的任务,能对 Reasoning 过程的 Token Budget、Reasoning 路径等,有稳定可控的方式,且能实现任务自适应。 3)RL & Reasoning Scaling Law:探索高效的 RL Scaling 技术和 Test Time Scaling 技术,不断提升模型能力,且能兼顾探索利用和 Compute Cost。 【任职要求】 1)计算机科学、人工智能、机器学习或相关专业背景。 2)熟练掌握 Python,具备高效实现和优化强化学习算法的能力。 3)扎实的强化学习理论基础,熟悉分层强化学习、多智能体强化学习、贝叶斯强化学习等高级算法框架。 4)熟悉 LLM 及其与 RL 结合的前沿技术。 5)熟悉 Reasoning 相关技术。 加分项: 1)在NeurIPS、ICLR、ICML等顶级会议发表过 RL 或决策系统相关论文。 2)参与过大规模 RL 系统的实际部署,并解决过生产环境中的稳定性和效率问题。

官网刷新:2025-05-23 · 最后确认在招:2026-09-03 19:50:14 · 来源平台:meituan