阿里巴巴控股集团 · 校园招聘
算法工程师-RL数据
杭州 ·经验不限·学历不限
杭州
薪资面议
前往 阿里巴巴控股集团 官网投递
职位描述
你将深度参与强化学习后训练数据产线的构建,通过迭代数据来优化基模的各种能力。
1.结合训练需求和模型能力分析,确定 RL 数据的覆盖范围与优先级;从多种渠道的海量数据里筛选挖掘样本并构建出清晰、可执行的问题描述。
2.针对 Coding 及 Work 等场景,以人机协作的方式设计并构建Agent的运行环境,以及可量化的 Verifier 或多维度打分 Rubric。需要保证环境和Judge的正确性、完整性、鲁棒性,且持续迭代以应对 Reward Hacking等各类挑战,确保评估信号与训练目标对齐。
3.端到端搭建批量化的数据生产与验证 Pipeline,涵盖任务生成、轨迹采样、自动校验和质量过滤,保障进入训练的数据可信、可追溯。
4.与领域专家和算法/训练等团队紧密配合,将模型效果反馈转化为数据策略调整(任务难度、Reward 信号、标注规范等)。
【任职要求】
1.计算机、数学、统计学等相关专业硕士/博士优先,优秀本科生不受限制。有顶会论文(ACL/EMNLP/ICLR/NeurIPS/ICML等)/高影响项目/开源贡献者加分。
2.具备Data-centric AI意识,精通后训练所需高质量数据挖掘与构造,具备合成数据(Synthetic Data)与动作轨迹(Trajectory)构建实践经验者优先。
3.能理解 Reward Modeling 基本原理及 Reward 信号设计对 RL 训练(PPO/GRPO/DAPO 等)的影响,有 RL/Post-Training 研究或机器学习Applied Scientist 相关经历者优先,
4.熟练使用 Python,熟悉主流的harness/agent框架,能独立完成数据处理脚本、自动化 Pipeline 和 QA 校验工具的开发
5.沟通与文档能力:优秀的书面表达能力,能产出清晰的 Rubric 规范、技术方案和问题定义文档;善于跨团队协作,能将算法侧的模型反馈准确翻译为数据策略调整。
6.有大规模机器学习任务调优经验者优先,有某个领域任务深度经验者优先(数学物理,ACM,kernel研发,高并发/HFT,软件工程,research,science等)
对LLM,AGI/ASI感兴趣,践行AI Native工作范式者优先
最后确认在招:2026-09-01 19:06:52 · 来源平台:alibaba