直招.cv

← 返回职位列表

阿里巴巴控股集团 · 校园招聘

面向Auto Research的强化学习算法与数据合成体系研究-阿里星

杭州 ·经验不限·学历不限

北京·杭州

职位描述

作为 Auto Research RL 算法研究与数据合成方向的算法研究员,你将参与或负责以下工作: 1.研究 Auto Research Agent 的核心训练方法,围绕理工类科研领域(如生物化学材料物理等)自动化科研智能体的自主决策、规划、工具调用、代码执行与实验验证能力,开展系统性算法研究; 2.设计并构建 Agentic 数据合成体系,研究大规模 Agent 轨迹数据的高效生成、清洗、筛选、增强与配比策略,构建高质量后训练数据管线; 3.探索稳定高效的 Agentic RL 训练方案,应用并改进 PPO、DPO、GRPO 等强化学习算法,优化长程任务中的奖励设计、训练稳定性、探索效率与泛化能力; 4.提升模型在代码、真实科研流程、实验场景中的任务成功率,针对代码生成、实验执行、错误修复、结果分析、论文写作等任务,构建训练与评测闭环,持续提升模型鲁棒性; 5.推动学术成果产出与开源建设,将研究成果整理为高水平论文,投稿至国际顶级会议;根据项目情况推动算法、数据或模型开源,提升团队技术影响力。 【任职要求】 1.计算机科学、人工智能、信息科学、数学、统计学、自动化或相关STEM专业以及交叉学科背景(如计算生物学、计算神经科学、计算化学)的应届博士毕业生,或即将获得博士学位的优秀候选人; 2.在领域内高水平学术期刊会议上发表论文并经过同行评议;或研究内容形成专利成果; 3.具备扎实的编程能力,熟练使用 Python,熟悉 PyTorch 或类似深度学习框架,能够独立完成算法实现、实验设计与结果分析; 4.深入理解以下至少一个方向:大语言模型 / 多模态大模型、强化学习 / 强化学习后训练、Agent 系统 / 工具调用 / 自主决策、代码智能体 / 自动化科研 / 自动化推理等。熟悉主流强化学习或偏好优化算法,包括但不限于:PPO、DPO、GRPO等;如为自然科学专业,需具备扎实的编程基础,并对AI for Science有强烈兴趣和深入的见解; 5.能够独立推进科研项目,具备较强的理论知识背景、问题定义能力、实验设计能力、论文阅读与复现能力,能够针对复杂问题提出创新性解决方案; 6.具有强自驱力、学习能力、创新意识和沟通协作能力,能够适应快速变化的 AI 研究方向、适应跨学科合作的工作环境,并具备一定抗压能力。

最后确认在招:2026-09-01 19:06:52 · 来源平台:alibaba