小红书 社会招聘
Agent 评估与进化工程师 - Agent Evaluation & Evolution Engineer
北京 ·经验不限·学历不限
北京市·上海市
薪资面议
前往 小红书 官网投递
职位描述
岗位说明
1.负责公司级Agent平台的 Evaluation、Quality Engineering 与持续进化体系建设,解决 Agent “效果如何定义、问题如何发现、优化是否真正有效,以及如何持续变好”的核心问题
2.面对的是一个行为非确定、结果开放、依赖模型和上下文的智能系统,建立适用于 Agent 的新型质量工程体系:从 Dataset、Evaluator、Trace、LLM-as-Judge,到错误发现、效果归因、回归评测、发布 Gate,再到数据闭环和自动优化
3.目标是让 Evaluation 成为 Agent 开发和发布过程中的基础设施,并最终形成由数据和评测驱动的 Agent 持续进化闭环
核心职责
1. Agent Evaluation 体系建设:设计和建设 Agent 离线与在线评测体系,包括 Dataset、Rubric、Evaluator、LLM-as-Judge、Human Evaluation、Regression Evaluation 等能力,支持不同 Agent 场景建立清晰、可量化的效果标准。
2. Agent 质量定义与评测方法设计:针对 Deep Research、任务型 Agent、Long-Horizon Task、Tool-use Agent 等不同场景,设计任务完成率、正确性、完整性、Groundedness、Tool-use Quality、过程质量等评测方法,解决开放式 Agent 结果难以评价的问题
3. Evaluation Platform 与工程体系建设:建设数据集管理、批量评测、Evaluator 管理、实验对比、回归测试、评测报告、版本管理和 Eval Gate 等平台能力,将 Evaluation 融入 Agent 开发、迭代和发布流程
4. Agent 问题发现与效果归因:结合 Trace、用户反馈、在线指标和自动检测能力建立 Badcase Discovery 与 Error Taxonomy,对问题进行聚类和归因,识别模型、Prompt、Context、Memory、Tool、Agent Architecture 等不同因素对最终效果的影响
5. 数据闭环与 Agent 持续进化:将线上 Trace、用户反馈、Badcase 和评测结果转化为高价值 Dataset 和优化信号,推动 Prompt Optimization、Context Optimization、数据生成、自动调优等能力建设,逐步形成 Evaluation → Data → Optimization → Verification 的进化闭环。
6. 新模型与新架构效果验证:与 Agent Systems、Infrastructure 和业务团队协同,通过统一 Benchmark 和 Evaluation 方法评估新模型、新 Prompt、新 Tool、新 Context Strategy 和新 Agent Architecture 的实际收益,为技术选型提供客观依据
7. Evaluation 方法前沿探索:持续研究 Agent Evaluation、Process Reward、LLM-as-Judge、Trajectory Evaluation、Synthetic Data、Agentic RL、Self-improvement 等方向,探索适合复杂 Agent 的下一代质量与进化机制
【任职要求】
任职资格
1. 具备较强的数据和工程能力:计算机、人工智能、数据科学或相关背景,具有良好的编程能力,能够独立完成数据处理、评测系统和实验平台相关研发工作
2. 有 AI / LLM / Agent 相关实践经验:熟悉 Prompt、RAG、Tool Calling、Agent 等基础技术,对 LLM 输出的不确定性、评估难点和常见问题有实际理解
3. 有较强的指标设计与实验意识:能够将模糊的“效果好不好”拆解为可衡量指标,并设计合理的数据集、实验方法和评测标准;有 A/B Test、实验平台、搜索推荐评估或机器学习评估经验更佳。
4. 具备较强的问题分析和归因能力:能够从复杂 Trace、Badcase 和用户反馈中发现规律,建立合理的问题分类和归因框架,并将问题转化为可执行的优化方向。
5. 对 Evaluation 有深入思考:理解准确率等传统指标无法完全覆盖 Agent 质量,能够针对任务完成、过程质量、开放式输出、复杂轨迹等问题设计新的评测方法。
6. 强业务效果意识:不把评测平台本身作为最终目标,能够理解评测的价值最终体现在业务效果提升、迭代效率提升和生产风险降低
加分项
1.有 LLM Evaluation、LLM-as-Judge、Agent Evaluation 相关经验
2.有搜索、推荐、广告、NLP、机器学习平台的评估体系建设经验
3.有数据飞轮、自动数据生成、Reward Model、RLHF / RLAIF / Agentic RL 相关经验
4.有实验平台、数据平台或 MLOps 平台建设经验
5.对模型能力、Agent 架构与 Evaluation 三者之间的关系有较深入的技术判断
官网发布:2026-09-02 · 最后确认在招:2026-09-03 23:16:54 · 来源平台:xiaohongshu