美团 校园招聘
【大模型北斗实习】Post-training 前沿算法研究
北京 ·经验不限·学历不限
北京市·上海市
薪资面议
前往 美团 官网投递
职位描述
Post-training是联结大模型通用知识和人类偏好的桥梁,在规范知识输出、提升推理能力、对齐人类偏好等方面起到了关键作用。本课题专注于大模型Post-training相关前沿算法研究,包括但不限于:
1)训练机制设计和优化:包括数据建设、指令微调,人类偏好和安全对齐,奖励模型、强化学习及效果评估等方向,优化模型文本创作、逻辑推理、指令遵循、代码生成、工具调用等能力,提升模型可控性和安全性。
2)Post-training前沿研究:面向下一代推理基座的架构设计,test-time compute训练范式,思维链学习,多智能体和自博弈强化学习,提升模型的复杂任务处理能力和智能水平。
【任职要求】
1)熟悉NLP、LLM、RL等领域,在一个或多个相关领域有深入研究经历并有实际论文产出或项目经验。
2)熟悉大模型算法研究所需的相关编程语言、工具、算法等,如Python、C++等编程语言、Megatron等训练框架、DPO、PPO等相关算法。
3)具备独立开展科学研究和实验的能力,对大模型相关技术有浓厚兴趣,具备强烈的进取心、求知欲,热衷于追求行业顶尖的技术创新。
加分项:
1)有大模型一线研究和实践经验,在大模型领域发表过高影响力论文或主导/参与过知名开源项目者优先。
2)发表过高影响力论文优先(如ICLR,ICML,ACL,EMNLP等)。
官网刷新:2025-05-23 · 最后确认在招:2026-09-03 19:50:14 · 来源平台:meituan