美团 校园招聘
【大模型北斗实习】大规模 Post-training 算法架构前沿研究
北京 ·经验不限·学历不限
北京市·上海市
薪资面议
前往 美团 官网投递
职位描述
Post-training 是提升大模型专项能力的核心技术方向之一,包括不限于复杂推理(Reasoning)、价值观对齐(Alignment)、业务Agent应用等研究方向。
本课题研究方向包括但不限于:
1)实现高效灵活的多模型强化学习训练架构。
2)通过合理灵活动态配置资源,提升PPO及各变种算法运行效率。
3)研究低精度在 Post-training 中的应用方式。
4)研究不同的算法+数据对效果的影响。
5)在复杂框架下,研究如何高效的追踪记录训练过程,提升算法探索效率。
【任职要求】
1)熟悉大规模分布式训练、推理、量化等技术之一。
2)熟悉常用的训练推理框架,vLLM、SGLang、Megatron、Deepspeed等。
3)熟悉强化学习算法。
加分项:相关领域开源项目或发表高水平论文。
官网刷新:2025-05-23 · 最后确认在招:2026-09-03 19:50:14 · 来源平台:meituan