蚂蚁集团 · 社会招聘
蚂蚁集团-Agent 评测工程师-AI创新产品
杭州 ·3年以上·本科
上海·杭州
薪资面议
前往 蚂蚁集团 官网投递
职位描述
1. 设计智能体评测任务,覆盖工具调用、计算机操作、多智能体协作、长周期任务执行、事实准确性、指令遵循和复杂推理等方向;
2. 将抽象的模型行为问题转化为可验证的评测实验,完成假设定义、数据构建、模型运行、结果分析和迭代决策;
3. 研究模型行为的自动化探索方法,持续发现模型在复杂任务、长尾场景和真实业务流程中的能力边界与失败模式;
4. 建设可靠、可复现、可扩展的评测流水线,支持不同模型、模型版本、Prompt、智能体框架和工具配置的批量实验;
5. 建设持续评测与模型健康监控体系,包括:标准测试集和 Golden Dataset 建设、回归与性能漂移监控、模型版本对比、评测结果可视化、失败案例分析、自动化反馈和改进闭环;
6. 分析评测方法的可靠性、可扩展性、方差、统计显著性和评分一致性,持续提升评测结果的可信度;
7. 设计并维护评测相关的后端服务、数据管道和 API,将内部数据转换为适合模型、智能体和下游 AI 工作流使用的结构化格式;
8. 将评测结果反馈到数据集、Prompt、评分器、智能体架构和产品方案中,推动模型与产品效果持续优化;
9. 负责评测系统从原型设计、工程实现、上线运行到长期维护的完整生命周期,在快速实验的同时保证系统稳定性、扩展性和可维护性。
【任职要求】
1. 具备扎实的软件工程、计算机系统、机器学习、统计学或相关领域基础;
2. 熟练掌握 Python、Go、Node.js 或其他至少一种编程语言,具备良好的工程开发、系统设计和问题排查能力;
3. 熟悉大语言模型及智能体技术,具备以下一个或多个方向的实际经验:大模型评测与 Benchmark、LLM-as-a-Judge 或自动评分器、评测数据集或合成数据构建、工具调用型智能体、多智能体工作流、长上下文或长周期任务、模型效果监控与回归评测;
4. 能够将模糊、开放的模型行为问题拆解成具体、可执行、可复现的评测实验,并根据数据得出结论;
5. 具备分布式系统、API、数据处理流水线或后端平台的设计与开发经验;
6. 熟悉模型评测的基本方法,能够独立设计测试集、评分标准、评测指标和回归验证方案;
7. 重视评测结果的可靠性和可解释性,能够识别数据污染、评分偏差、统计噪声和评测集饱和等问题;
8. 既关注 Benchmark 指标,也关注模型在真实场景中的实用性、可靠性、诚实性和交互体验;
9. 具备较强的自主性,能够在目标或实现路径尚不明确的情况下推进项目落地;
10. 具备良好的分析、沟通和文档表达能力,能够清晰说明评测方法、实验结果和优化建议。
加分项
● 独立构建过大模型 Benchmark、评测集或自动评分系统;
● 开发过智能体任务环境、评测 Harness 或沙箱执行系统;
● 具备大规模评测平台、实验平台或模型监控系统建设经验;
● 熟悉 Prompt、Sampling 和 Agent Scaffolding 对评测结果的影响;
● 熟悉统计实验设计、方差分析、置信区间和显著性检验;
● 有可观测性、回归检测或实验追踪系统经验;
● 有大规模数据集构建、清洗、标注和质量控制经验;
● 对工具调用、计算机操作、多智能体或长周期智能体有深入实践。
典型项目
● 从零构建一套复杂智能体能力评测,包括任务环境、数据集、评分器和分析看板。
● 建设持续评测平台,在模型、Prompt 或智能体版本发生变化时自动执行回归测试。
● 定位评测指标异常,判断问题来自模型、数据、评分器还是评测基础设施。
● 构建工具调用或复杂任务的沙箱环境,验证评测结果的稳定性和可复现性。
● 建设 Golden Dataset、漂移监控和失败案例库,持续推动模型与产品迭代。
最后确认在招:2026-09-01 19:09:33 · 来源平台:alibaba