蚂蚁集团 · 社会招聘
蚂蚁集团-Code Agent 后训练算法专家-健康事业群
杭州 ·5年以上·本科
上海·杭州
薪资面议
前往 蚂蚁集团 官网投递
职位描述
1. Code Agent 强化学习训练体系设计与落地
负责大规模语言模型在后训练阶段(Post-Training)面向 Code Agent 场景的核心算法研发,设计端到端的 RL 训练流程,涵盖代码生成、代码编辑、调试修复、测试驱动开发等多环节 Agent 行为的策略学习,探索在超长代码上下文与多轮工具交互场景下的训练稳定性与样本效率。
2. 代码环境交互与多步决策优化
构建真实且可扩展的代码执行沙箱环境(Sandbox),支持 Agent 与编译器、终端、测试框架、版本控制系统等工具的闭环交互;研究多步代码推理与规划算法(如 Tree-of-Thought、Monte Carlo Tree Search 在代码任务中的适配),提升模型在跨文件编辑、大型仓库级代码理解与修改、复杂 Debug 链路上的决策质量。
3. 代码奖励信号设计与奖励模型构建
设计多层次、细粒度的代码奖励信号体系,融合可执行性验证(编译通过、测试用例通过率)、代码质量评估(可读性、效率、安全性)、需求对齐度等多维度反馈;研究如何利用自动化测试生成、变异测试(Mutation Testing)、静态分析工具等构建可靠的过程奖励模型(Process Reward Model),解决代码场景中奖励稀疏、奖励欺骗(Reward Hacking)以及部分可观测性等核心难题。
4. 泛化性与迁移能力提升
研究如何通过后训练阶段的课程学习(Curriculum Learning)、跨语言/跨领域任务混合训练、元学习(Meta-Learning)等策略,提升 Code Agent 在未见编程语言、未见框架、未见任务类型上的零样本与少样本泛化能力;探索代码推理能力向通用推理(数学、逻辑、科学问题)的正向迁移路径,推动模型整体 AGI 泛化水平。
5. 数据飞轮与自我进化机制
设计 Code Agent 的自我对弈与自我改进闭环:通过 Agent 自主探索生成高质量训练轨迹(Trajectory),结合拒绝采样(Rejection Sampling)、自我验证(Self-Verification)、自我修复(Self-Repair)等机制构建可持续的数据飞轮,实现模型能力的迭代自举(Bootstrapping),减少对人工标注数据的依赖。
6. 大规模分布式训练系统与工程协同
与基础架构团队紧密协作,针对 Code Agent 训练中环境交互延迟高、轨迹长度动态变化、Action Space 复杂等特点,设计并优化异步/同步混合的大规模分布式 RL 训练架构;解决长序列代码上下文下的显存瓶颈与吞吐效率问题,实现算法创新与系统性能的高效协同。
【任职要求】
1. 学历背景
硕士/博士学位,计算机科学、人工智能、软件工程、数学、自动 化或相关专业优先。
2. 编程与工程能力
具备扎实的编程功底与软件工程素养,精通 Python,熟悉 C/C++;对代码生成、程序分析、编译原理、软件测试等领域有系统性理解;能够独立构建和维护复杂的实验pipeline,具备良好的代码规范与工程落地能力。
3. 强化学习理论与实践
深入理解强化学习核心理论(PPO、GRPO、DPO 及其变体),能够从数学原理层面分析策略梯度估计的方差控制、KL散度约束、价值函数基线设计等关键问题;有将 RL 算法应用于语言模型后训练的实际经验,了解 RLHF/RLAIF 的完整技术栈。
4. 大语言模型后训练经验
熟悉大语言模型的 SFT → Reward Modeling → RL 全链路后训练流程,理解 Alignment、Instruction Following、Chain-of-Thought 等核心概念;有独立完成过至少一个完整后训练实验的经验,对训练过程中的常见问题(奖励坍缩、模式坍缩、过度优化等)有实际应对经验。
5. 分布式训练与系统优化
熟练掌握至少一种主流分布式训练框架(DeepSpeed、Megatron-LM、FSDP、veRL/OpenRLHF 等),理解数据并行、模型并行、流水线并行的原理与工程实现;具备在大规模 GPU 集群上进行算法调优与性能排障的实战经验。
6. 研究能力与学术素养
具备优秀的文献调研与前沿追踪能力,能够快速消化最新研究成果并转化为可落地的技术方案;在 NeurIPS、ICML、ICLR、ACL、EMNLP、ICSE、FSE 等顶级会议或期刊发表过相关高质量论文者优先。
7. 自驱力与协作能力
具备极强的自驱力、好奇心与系统性拆解复杂问题的能力,能够在高度不确定性下独立探索技术方向;善于跨团队沟通协作,具备将研究想法高效推进到工程落地的执行力;对构建通用人工智能有发自内心的热情,愿意长期投入于充满挑战与未知的前沿课题。
额外加分项
1. Code Agent 实战经验
有 SWE-bench、SWE-agent、OpenHands、Devin、Cursor 等代码智能体相关项目的开发、复现或深度研究经验;或在 Kaggle、USACO、Codeforces、IOI 等编程竞赛中取得优异成绩。
2. 高性能计算与底层优化
具备 CUDA 编程、Triton 算子开发、FlashAttention 等高性能计算经验,能够针对长序列场景进行定制化的算子优化与显存优化。
最后确认在招:2026-09-01 19:09:33 · 来源平台:alibaba