Token Foundry · 校园招聘
Agentic Coding自进化技术研究-阿里星
杭州 ·经验不限·学历不限
北京·杭州
职位描述
1、定义后训练技术体系:主导 Agentic Coding 后训练整体技术路线规划,定义 mid-training/SFT/RL/蒸馏 的最优组合与边界条件,给出能力跃迁的关键路径与里程碑;
2、主导核心算法原创突破,包括但不限于:长程轨迹下的 credit assignment、process reward 与 outcome reward 的融合机制、工具调用与环境交互的鲁棒性优化、on-policy distillation for agentic coding等技术探索;
3、构建自进化的数据飞轮:负责高质量 Agentic 轨迹的自主构造与组织、难度自适应的 学习调度、失败案例驱动的反思与重训、真实仓库与合成任务的混合策略,为后训练提供可持续供给;
4、Recursive Self-Improvement:构建模型、Training Harness、Inference Harness 三位一体的协同进化闭环,让算法、数据与系统在同一闭环内自迭代提升;
跟踪前沿并定义前沿:主导原创性算法与系统创新,在 NeurIPS / ICML / ICLR / ACL 等顶会发表高影响力工作,并推动成果在阿里大模型与核心业务中的规模化落地。
【任职要求】
1.计算机科学、人工智能、数学或相关领域的博士学历,研究方向涵盖大模型、强化学习、软件工程、Agentic Coding等。
2.在大模型 Post-Training(SFT/ RLHF / RLVR / 蒸馏)、Agent / Tool Use、Agentic Coding、Recursive Self-improvement等方向至少一项有研究深度或有一线沉淀的成果,有实际大模型训练经验者优先。
3.具备扎实的编程与工程能力,熟悉大规模分布式训练框架(PyTorch / Megatron / veRL / ROLL等)与高性能推理引擎(vLLM / SGLang等),能够把好的idea快速转化为实验结果。
4.在 NeurIPS/ICML/ICLR/等顶会发表过 LLM / RL / Agent / SWE 方向高质量论文,或在 SWE-Bench、Terminal-Bench、Frontier SWE等相关权威 benchmark 上取得有竞争力成绩,或有 Agentic Coding 相关开源高影响力项目经验者优先;具备独立定义问题、突破范式的科研品味。
最后确认在招:2026-09-01 19:06:52 · 来源平台:alibaba