直招.cv

← 返回职位列表

蚂蚁集团 · 社会招聘

蚂蚁集团-Agent 评测工程师-AI创新产品

杭州 ·3年以上·本科

上海·杭州

职位描述

1. 设计智能体评测任务,覆盖工具调用、计算机操作、多智能体协作、长周期任务执行、事实准确性、指令遵循和复杂推理等方向; 2. 将抽象的模型行为问题转化为可验证的评测实验,完成假设定义、数据构建、模型运行、结果分析和迭代决策; 3. 研究模型行为的自动化探索方法,持续发现模型在复杂任务、长尾场景和真实业务流程中的能力边界与失败模式; 4. 建设可靠、可复现、可扩展的评测流水线,支持不同模型、模型版本、Prompt、智能体框架和工具配置的批量实验; 5. 建设持续评测与模型健康监控体系,包括:标准测试集和 Golden Dataset 建设、回归与性能漂移监控、模型版本对比、评测结果可视化、失败案例分析、自动化反馈和改进闭环; 6. 分析评测方法的可靠性、可扩展性、方差、统计显著性和评分一致性,持续提升评测结果的可信度; 7. 设计并维护评测相关的后端服务、数据管道和 API,将内部数据转换为适合模型、智能体和下游 AI 工作流使用的结构化格式; 8. 将评测结果反馈到数据集、Prompt、评分器、智能体架构和产品方案中,推动模型与产品效果持续优化; 9. 负责评测系统从原型设计、工程实现、上线运行到长期维护的完整生命周期,在快速实验的同时保证系统稳定性、扩展性和可维护性。 【任职要求】 1. 具备扎实的软件工程、计算机系统、机器学习、统计学或相关领域基础; 2. 熟练掌握 Python、Go、Node.js 或其他至少一种编程语言,具备良好的工程开发、系统设计和问题排查能力; 3. 熟悉大语言模型及智能体技术,具备以下一个或多个方向的实际经验:大模型评测与 Benchmark、LLM-as-a-Judge 或自动评分器、评测数据集或合成数据构建、工具调用型智能体、多智能体工作流、长上下文或长周期任务、模型效果监控与回归评测; 4. 能够将模糊、开放的模型行为问题拆解成具体、可执行、可复现的评测实验,并根据数据得出结论; 5. 具备分布式系统、API、数据处理流水线或后端平台的设计与开发经验; 6. 熟悉模型评测的基本方法,能够独立设计测试集、评分标准、评测指标和回归验证方案; 7. 重视评测结果的可靠性和可解释性,能够识别数据污染、评分偏差、统计噪声和评测集饱和等问题; 8. 既关注 Benchmark 指标,也关注模型在真实场景中的实用性、可靠性、诚实性和交互体验; 9. 具备较强的自主性,能够在目标或实现路径尚不明确的情况下推进项目落地; 10. 具备良好的分析、沟通和文档表达能力,能够清晰说明评测方法、实验结果和优化建议。 加分项 ● 独立构建过大模型 Benchmark、评测集或自动评分系统; ● 开发过智能体任务环境、评测 Harness 或沙箱执行系统; ● 具备大规模评测平台、实验平台或模型监控系统建设经验; ● 熟悉 Prompt、Sampling 和 Agent Scaffolding 对评测结果的影响; ● 熟悉统计实验设计、方差分析、置信区间和显著性检验; ● 有可观测性、回归检测或实验追踪系统经验; ● 有大规模数据集构建、清洗、标注和质量控制经验; ● 对工具调用、计算机操作、多智能体或长周期智能体有深入实践。 典型项目 ● 从零构建一套复杂智能体能力评测,包括任务环境、数据集、评分器和分析看板。 ● 建设持续评测平台,在模型、Prompt 或智能体版本发生变化时自动执行回归测试。 ● 定位评测指标异常,判断问题来自模型、数据、评分器还是评测基础设施。 ● 构建工具调用或复杂任务的沙箱环境,验证评测结果的稳定性和可复现性。 ● 建设 Golden Dataset、漂移监控和失败案例库,持续推动模型与产品迭代。

最后确认在招:2026-09-01 19:09:33 · 来源平台:alibaba