直招.cv

← 返回职位列表

阿里巴巴控股集团 · 校园招聘

算法工程师-RL数据

杭州 ·经验不限·学历不限

杭州

职位描述

你将深度参与强化学习后训练数据产线的构建,通过迭代数据来优化基模的各种能力。 1.结合训练需求和模型能力分析,确定 RL 数据的覆盖范围与优先级;从多种渠道的海量数据里筛选挖掘样本并构建出清晰、可执行的问题描述。 2.针对 Coding 及 Work 等场景,以人机协作的方式设计并构建Agent的运行环境,以及可量化的 Verifier 或多维度打分 Rubric。需要保证环境和Judge的正确性、完整性、鲁棒性,且持续迭代以应对 Reward Hacking等各类挑战,确保评估信号与训练目标对齐。 3.端到端搭建批量化的数据生产与验证 Pipeline,涵盖任务生成、轨迹采样、自动校验和质量过滤,保障进入训练的数据可信、可追溯。 4.与领域专家和算法/训练等团队紧密配合,将模型效果反馈转化为数据策略调整(任务难度、Reward 信号、标注规范等)。 【任职要求】 1.计算机、数学、统计学等相关专业硕士/博士优先,优秀本科生不受限制。有顶会论文(ACL/EMNLP/ICLR/NeurIPS/ICML等)/高影响项目/开源贡献者加分。 2.具备Data-centric AI意识,精通后训练所需高质量数据挖掘与构造,具备合成数据(Synthetic Data)与动作轨迹(Trajectory)构建实践经验者优先。 3.能理解 Reward Modeling 基本原理及 Reward 信号设计对 RL 训练(PPO/GRPO/DAPO 等)的影响,有 RL/Post-Training 研究或机器学习Applied Scientist 相关经历者优先, 4.熟练使用 Python,熟悉主流的harness/agent框架,能独立完成数据处理脚本、自动化 Pipeline 和 QA 校验工具的开发 5.沟通与文档能力:优秀的书面表达能力,能产出清晰的 Rubric 规范、技术方案和问题定义文档;善于跨团队协作,能将算法侧的模型反馈准确翻译为数据策略调整。 6.有大规模机器学习任务调优经验者优先,有某个领域任务深度经验者优先(数学物理,ACM,kernel研发,高并发/HFT,软件工程,research,science等) 对LLM,AGI/ASI感兴趣,践行AI Native工作范式者优先

最后确认在招:2026-09-01 19:06:52 · 来源平台:alibaba