阿里国际 · 校园招聘
LLM and Multimodal Post-training-AliStar/Bravo Star
杭州 ·经验不限·学历不限
杭州
薪资面议
前往 阿里国际 官网投递
职位描述
我们正在寻找优秀的研究科学家和工程师,共同推进下一代 LLM 与 Multimodal Agent 系统 的关键技术研发。
该岗位聚焦于大模型后训练(Post-training)与Agent能力训练的前沿研究,致力于让基础模型具备 DeepResearch、Tool Use、Coding 以及复杂多步骤推理(long-horizon reasoning) 等能力。你将与一流的研究人员和工程团队合作,探索并实现包括 Agentic SFT、Agentic CPT、Reasoning RL、Agentic RL、RLHF 在内的新一代后训练方法,推动 AI 系统在复杂真实任务中的能力边界。
1、研究并开发 LLM 与 Multimodal 模型的 Post-training 方法,重点提升 Agent 能力与复杂推理能力;
2、设计与实现 Agentic SFT、Agentic CPT、Reasoning RL、Agentic RL等训练方法;
3、构建大规模 Agent training data,涵盖 DeepResearch、Tool Use、Coding等复杂任务;
4、设计并实现 Agent evaluation framework,评估模型在复杂任务执行与工具使用场景中的能力;
5、与模型训练、数据工程和系统团队协作,将研究成果应用到 真实 AI 系统与产品场景中;
6、推动前沿研究成果,通过技术分享、开源项目或学术论文等方式贡献于 AI 社区。
【任职要求】
1、计算机科学、人工智能、机器学习或相关领域硕士或博士学位;
2、具备 LLM 训练或后训练(fine-tuning / post-training)经验;
3、在 NeurIPS、ICML、ICLR、CVPR 等顶级会议发表论文或参与开源项目。
最后确认在招:2026-09-01 19:06:52 · 来源平台:alibaba