阿里国际 · 社会招聘
阿里国际站-Agentic RL环境与模型训练工程师-杭州/北京
杭州 ·2年以上·硕士
北京·杭州
薪资面议
前往 阿里国际 官网投递
职位描述
我们正在围绕 阿里巴巴国际站 + Accio Work 打造真实全球贸易场景的 AI Agent,覆盖买家采购、商家经营、Research、商品发布、跨平台运营、物流跟踪等复杂任务。
这个岗位聚焦 Agent rollout 环境搭建 + agentic model 训练,不是传统训练岗,也不是普通应用岗,而是把真实业务流程变成模型可交互、可学习、可优化的 environment,训练一个真正“会做事”的 Agent。
你会做什么:
1. 搭建国际站场景下的 Agent rollout / environment,支持多步任务、工具调用、Browser/API 操作
2. 构建 trajectory 采样、reward 计算、样本回流、任务重放等训练链路
3. 参与 SFT / Preference / RLHF / RLAIF 等 agentic post-training 工作
4. 研究 tool use、browser use、computer use、错误恢复、多步规划等问题
5. 联动评测/数据/产品,形成“环境-训练-评测-回流”闭环
为什么值得来:
1. 做真实业务里的 Agent 训练,而不是 benchmark 实验
2. 场景复杂且稀缺:多语言 + 多工具 + 长链路任务
3. 同时覆盖 environment、rollout、reward、training,全链路空间大
4. 有机会定义真实商业世界中 Agent 如何被训练出来
【任职要求】
我们希望你具备:
1. 3年以上机器学习 / 强化学习 / 大模型训练 / 算法工程经验
2. 熟练 Python,有训练 pipeline 或大规模系统经验
3. 了解 RL、trajectory、reward、policy optimization、post-training 等基本方法
4. 对 Agent、Tool Use、Browser/Computer Use、多步任务有兴趣或经验
5. 有 rollout system / simulator / RLHF / agent training 经验优先
最后确认在招:2026-09-01 19:10:30 · 来源平台:alibaba