直招.cv

← 返回职位列表

Token Foundry · 校园招聘

算法工程师-大模型Agentic Reward System

杭州 ·经验不限·学历不限

北京·杭州

职位描述

1. 负责基础模型 Agentic Reward System 的设计、训练与迭代,构建支撑大规模 Agentic RL 训练的奖励信号体系,持续提升模型在 Coding、Agent 等高价值场景下的对齐质量与 RL 训练上限; 2. 探索更多可 Scalable 的 Verifier 信号,通过强化学习(RL)提升模型的各项能力;研究 Reasoning Path 压缩和外推,实现更高质量的推理思考,并将 LLM 的推理能力与 Agent 及其他模态相结合,探索统一模态的 Reasoning; 3. 提升 Reward Model 在创作、人类偏好、指令遵循等各专项上的能力,减少 Reward Hacking 和 Bias,并研究面向 Agent 任务的用户体验建模与 Reward 优化,探索 User Model Rewarding 与 Behavioral Signal Mining,弥合 Benchmark 指标与用户实际体验之间的鸿沟。 【任职要求】 1. 本科及以上学历,人工智能、机器学习、深度学习、软件工程、相关专业优先; 2. 在深度学习、大规模模型训练、优化算法、生成式模型、自监督学习等领域有扎实的理论基础和实践经验,并至少在其中一个方向有学术成果或项目经历; 3. 具有较强的代码工程能力,精通 Python 以及 Pytorch 等深度学习框架,熟悉LLM推理引擎(如vLLM,SGLang)的实现; 4. 对基础模型的前沿问题有持续热情,具备独立思考能力和系统性研究思维,敢于挑战现有范式;能够独立应用技术解决复杂问题,主导或深度参与过有影响力项目的人选优先; 5. 具备跨学科视野与协作意识,能够与工程、产品等多学科团队紧密合作,推动研究成果快速落地并产生实际影响力。

最后确认在招:2026-09-01 19:06:52 · 来源平台:alibaba