美团 社会招聘
大模型/Agent 评测工程师(AI 研发方向)
上海 ·经验不限·学历不限
上海市·北京市
薪资面议
前往 美团 官网投递
职位描述
1. 负责通用 Agent、Code Agent 及 AI 研发工具的评测体系设计与建设,支撑模型、Prompt、工具和 Agent 工作流的持续迭代。
2. 深入需求分析、技术方案设计、代码生成与修改、测试生成、代码评审、缺陷修复和故障诊断等研发场景,将真实研发流程抽象为可复现、可扩展的评测任务。
3. 建立覆盖任务完成度、需求符合度、代码正确性、工具调用、规划执行、稳定性、安全性、成本和时延等维度的评测指标体系。
4. 负责评测数据和样本建设,持续沉淀真实任务、典型失败案例、线上反馈及核心回归用例,保障评测数据的代表性、区分度和可维护性。
5. 设计和研发自动化评测框架及平台,支持任务批量执行、过程数据采集、自动评分、版本对比、回归分析、异常告警和结果可视化。
6. 分析 Agent 的执行轨迹,定位其在需求理解、任务规划、上下文使用、工具调用、代码修改、测试执行和错误恢复等环节的问题,判断问题来源并提出改进建议。
7. 建立线上反馈与离线评测之间的闭环,将用户反馈、任务失败、人工接管和异常行为转化为可复现的评测与回归用例。
8. 与产品、算法、研发、测试及平台团队协作,推动评测结果应用于模型选择、Agent 优化、版本验收和发布决策。
【任职要求】
1. 计算机科学、软件工程、人工智能或相关专业本科及以上学历,具备 3 年及以上软件研发、测试开发、质量工程、研发效能或 AI 工程经验。
2. 熟练掌握 Python、Go、Java 或 TypeScript 中至少一种编程语言,具备良好的工程实现能力,能够独立完成评测工具、服务或平台模块的设计与开发。
3. 熟悉软件研发流程,了解 Git、CI/CD、自动化测试、容器化环境以及常见的软件构建、测试和发布方式。
4. 对大语言模型和 Agent 有较深入理解,熟悉 Prompt、上下文管理、任务规划、工具调用、多轮交互、代码执行及错误恢复等基本机制。
5. 具备评测方案设计能力,能够将模糊的质量问题转化为明确的评测任务、指标、评分规则和验收标准。
6. 具备良好的数据分析和实验能力,能够从评测数据和执行轨迹中发现规律、归纳失败类型并定位问题根因。
7. 具备较强的业务理解、逻辑分析和跨团队协作能力,能够推动评测方案在真实研发场景中落地。
8. 对 AI 编程和 Agent 技术保持高度关注,愿意持续探索新模型、新工具和新的评测方法。
官网刷新:2026-08-31 · 最后确认在招:2026-09-03 19:51:20 · 来源平台:meituan