通义实验室 社会招聘
Token Foundry-Reward System算法工程师-Qwen
北京 ·经验不限·硕士
北京
薪资面议
前往 通义实验室 官网投递
职位描述
负责 Qwen 基座模型 Agentic Reward System 的设计、训练与迭代,构建支撑大规模 Agentic RL 训练的奖励信号体系,持续提升模型在 Coding、Agent 等高价值场景下的对齐质量与 RL 训练上限。
1. Coding Reward System:构建面向 Code Agent 的 Reward System,设计 Evolving Rubrics 与 Code Verifier,实现 Outcome & Process Level 的自动化 Rewarding,解决长程 Coding Trajectory 下的 Credit Assignment 与 Reward 稀疏性问题。
2. Agentic User Experience Reward:研究面向 Agent 任务的用户体验建模与 Reward 优化,探索 User Model Rewarding 与 Behavioral Signal Mining,弥合 Benchmark指标与用户实际体验之间的鸿沟。
3. Reward System Infra:以 Reward 信号为核心构建数据飞轮,驱动数据筛选、难例挖掘与合成迭代;建设统一的 Reward 评估与标注框架,与 CPT / SFT / RL训练流程深度耦合,端到端优化全链路传导效率。
【任职要求】
1. 计算机、人工智能等相关专业硕士及以上学历, 具备相关领域的顶会论文发表优先。
2. 扎实的工程能力,有工业界大语言模型SFT / RL 训练经验的优先(熟悉 PPO / GRPO 等完整流程)。
3. 对 Reward System 有独立的技术判断,能分析不同技术路线(Scalar RM / Gen RM / Pair-wise RM 等)的适用边界。
4. 有以下任一方向的深入经验者优先:
(1)Reward Model Training(Agent RM / Coding RM / Agentic RM)
(2)Coding / Agent Benchmark
(3)Credit Assignment / Reward Shaping / Multi-turn RL
官网刷新:2026-08-14 · 最后确认在招:2026-09-03 22:49:13 · 来源平台:alibaba