直招.cv

← 返回职位列表

淘天集团 社会招聘

业务技术-Agent 评测工程师-AI 应用效果方向

杭州 ·2年以上·本科

杭州

职位描述

加入天猫技术质量团队,你将面向导购、搜索、营销、商家经营、客服等核心业务场景中的各类 AI Agent,对端到端业务效果负责。 这个岗位不止是“给 Agent 打分”,而是深入 AI 应用链路,通过指标设计、评测集管理、自动化评测、执行轨迹分析、问题挖掘和数据回流,定位影响业务效果的关键问题,并推动 Prompt、Skill、记忆、知识库、工具链及 Agent 架构持续优化,建立“应用构建—效果评测—问题归因—数据回流—针对性优化—回归验证”的完整闭环,以评测驱动 Agent 演进,让 AI 应用在真实业务场景中取得可衡量、可持续的效果。 具体你将负责 1. Agent 端到端业务效果评测与优化 面向天猫业务 Agent,设计覆盖任务理解、规划决策、知识获取、工具调用、任务执行及最终业务结果的端到端评测方案。 建立多维度评测指标与判定标准,包括任务完成率、结果正确性、业务规则符合度、工具调用准确性、过程合理性、稳定性、安全性、成本及时延等。 打通离线评测与线上业务效果,围绕真实场景中的任务成功、用户体验、业务转化和履约质量等目标评估 Agent 价值。 能够独立负责一个 Agent 应用或核心组件的效果优化,从问题定义、方案设计、评测验证到上线回归,对最终效果负责。 2. 业务评测集与数据回流体系建设 从真实业务流量、用户行为、反馈数据、线上问题和专家经验中沉淀高价值样本,建设场景化、分层化的评测集与业务 Benchmark。 设计覆盖常规、边界、复杂及对抗场景的评测任务,持续提升评测集的代表性、区分度与风险覆盖能力。 建立数据采集、清洗、标注、质检、版本管理与持续更新机制,保障评测数据的质量、时效性和可追溯性。 建设线上问题与评测集之间的数据回流机制,将真实应用行为和失败案例转化为可复现、可回归的评测资产,驱动针对性优化。 3. 深度问题挖掘与效果归因 对 Agent 输出结果和完整执行轨迹进行分析,定位 Prompt、Skill、记忆、知识库、检索、规划推理、工具调用及业务执行等环节的问题。 建立失败模式分类与根因分析机制,识别共性短板、系统性风险及高价值优化机会,并形成可落地的改进方案。 运用统计分析、实验设计、AI 对齐评估及人工评测等方法,判断效果差异、优化收益和结论可信度。 建设可视化评测报告与问题追踪机制,推动问题从发现、归因、修复到验证的闭环管理。 4. 评测驱动的 AI 应用优化 与算法、研发、产品和业务团队协作,将评测结论转化为 Prompt、Skill、记忆、知识库、检索策略、工具链及 Agent 架构的优化方案。 设计 A/B 测试、红蓝对抗和版本对比实验,验证优化效果,识别真实收益、适用边界与回退风险。 建立版本准入、自动化回归和持续效果追踪机制,保障 Agent 迭代过程中的效果稳定性与可控性。 沉淀评测方法、工具和最佳实践,建设自动化评测框架及自助评测能力,提升团队规模化发现问题和优化应用的效率。 【任职要求】 1、本科及以上学历,计算机、人工智能、软件工程、统计学、数学等相关专业;具备 2 年以上软件测试、质量工程、AI 应用评测或效果优化经验,有大模型或 AI Agent 落地经验。 2、理解 AI Native 应用架构及 Agent 核心链路,熟悉 Prompt、RAG/向量检索、Skill、记忆、知识库、工具调用、任务规划和多轮交互等技术或组件。 3、具备端到端业务效果意识,能够从业务目标出发定义成功标准、设计评测指标,并建立离线评测与线上业务效果的关联。 4、熟悉 Agent 评测体系建设,能够综合运用自动化评测、规则评测、LLM-as-a-Judge、人工评测及红蓝对抗等方法,并理解其偏差和适用边界。 5、具备问题挖掘、数据分析和实验设计能力,能够结合评测结果与执行轨迹完成根因分析,通过 A/B 测试或版本对比验证优化收益。 6、熟练使用 Python、Java 等至少一种编程语言,具备评测集与反馈数据管理、自动化评测、数据处理或评测工具开发能力。 7、具备较强的业务理解、跨团队协作和结果推动能力,能够独立承担 Agent 应用或核心组件的效果评测与优化,并对最终交付效果负责。

官网刷新:2026-09-02 · 最后确认在招:2026-09-02 21:57:31 · 来源平台:alibaba