阿里巴巴控股集团 社会招聘
晓天衡宇-大模型评测集工程师-Agent评测方向
北京 ·3年以上·本科
北京
薪资面议
前往 阿里巴巴控股集团 官网投递
职位描述
1. 环境与任务建模:把制造、金融、游戏、能源的真实业务流程拆成 agent 可交互环境与可评测任务,定义状态/动作空间、状态转移、终止条件与难度分层。
2. 工具与沙箱:将领域仿真器、求解器与生产力工具封装为统一环境接口,做到确定性复现、快照回滚与并发 rollout。
3. 奖励与判据设计:程序化判定优先、rubric judge 兜底,先判物理与业务可行性再算最优性 gap,区分"看起来对"与真正可行。
4. 任务合成:建参数化生成器批量派生任务实例及 ground truth,注入扰动与陷阱样本,把通过率控制在 30%–70%。
5. 质控与交付:制定标注规范、把控信度效度,管控污染泄漏与任务退役,与算法团队对齐接口与奖励口径,支撑评测、SFT 与 RL。
【任职要求】
1. 领域背景:至少在制造工程、金融、游戏研发或能源中的一个方向有 3 年以上实际业务经验,能独立判断一个交付物在工程或业务上是否真的可行。
2. 工程能力:Python 熟练,有仿真器、求解器、引擎或数据平台的封装与二次开发经验,能搭出可复现、可并发的沙箱环境。
3. 评测方法:理解可验证奖励与 LLM judge 的边界,能设计程序化判定逻辑,熟悉信度效度、污染管控与难度分层等基本手段。
4. 数据与标注:有评测集或训练数据的构建与质控经验,能写清标注规范并管理多人标注一致性。
5. 协作与迭代:能与算法团队对齐接口与奖励口径,依据模型表现主动迭代任务,理解评测、SFT 与 RL 三类下游用途的差异。
加分项:有 LLM benchmark 相关项目、论文或开源贡献;熟悉两个及以上上述行业领域。
官网刷新:2026-08-14 · 最后确认在招:2026-09-03 22:50:57 · 来源平台:alibaba