直招.cv

← 返回职位列表

高德 社会招聘

高德-Agent 效果产品经理-Harness 方向

北京 ·2年以上·本科

北京

职位描述

岗位使命 我们要寻找一位懂 Agent 运行机制的"效果型产品经理"。你的核心任务不是堆砌功能,而是通过对上下文工程(Context Engineering)、工具编排(Tools / Function Calling)与评测体系的持续打磨,直接提升 Agent 在真实场景中的任务完成质量,解决答非所问、关键信息遗漏、工具误调用、多轮丢失上下文等核心难题,并具备亲手写代码验证假设的能力。 你的成功标准是任务完成率与任务满足率的持续提升,而不是上线了多少功能。 岗位职责: 1. 诊断 Agent 效果瓶颈并定位根因(Diagnosis & Root Cause Analysis) 面对 Agent 表现不佳时,迅速判断问题落在哪一层:上下文构造缺失、工具 schema 描述不准、工具返回被裁剪后丢失关键字段、上下文窗口(Context Window)被系统开销占满导致对话历史被截断,还是模型能力本身不足。 区分"模型能力不足"与"harness 没喂对信息"——这是本岗位最核心的判断力。多数"答非所问"并非模型不够聪明,而是有效上下文在预算分配中被挤掉;你要能拆到 token 级别算清这笔账,再决定改哪一层。 建立 bad case 分类机制,按出现频率与业务阻塞性排优先级,驱动迭代排期,而非被 case 数量牵着走。 2. 设计上下文工程与工具编排策略(Context Engineering & Tool Orchestration) 定义各类上下文 Provider 的触发条件、注入顺序与 token 上限,在召回质量与窗口成本之间给出明确取舍。 设计工具的渐进式暴露策略(哪些工具在哪些场景进入模型视野),控制 schema 膨胀,并保证暴露给模型的 schema 与实际注册实现(含 Function Calling / MCP 工具)一致,避免"模型看得见却调不通"的幻影工具。 设计记忆(Memory)与检索增强(RAG)注入策略:定义用户画像、历史偏好、外部知识在什么时机注入、注入多少,以及与实时上下文冲突时的优先级。 3. 构建评测体系、以数据驱动迭代(Evaluation & Data-Driven Iteration) 设计细粒度评测集与评测指标,覆盖多轮追问、多约束理解、复杂指令完成度与工具调用正确性,持续补齐场景盲区。 多个指标分开看、不做加权合成,红线项单独判定;核心指标是任务完成率与任务满足率——"格式合法地终结对话"不等于"解决了问题"。 面对模型的非确定性输出,建立可复现的评测方法:当环境不可控(时间、天气、实时数据每轮变化)时,先通过 freeze clock、mock 外部依赖、record-replay 固化环境,再比较跨版本效果差异。 4. 推动改进落地并形成线上闭环(Productization & Online Loop) 改进分两类推进:快速止血(Prompt 优化、schema 修正、裁剪策略调整,带根因定位与量化收益预估,短周期上线并回归)与长期治理(工具暴露机制、记忆架构、Provider 触发逻辑等架构级调整,分阶段验收)。 将实验有效的策略固化为生产级能力,持续监控线上表现,定义效果劣化的告警规则并推动闭环修复。 5. 与算法团队协同、对齐训练信号(Collaboration & Model Alignment) 当问题确认为模型能力不足时,输出结构化训练需求:目标场景、期望行为、当前典型错误模式、建议的数据构造方向,用工程师听得懂的语言对齐。 参与模型选型与多模型路由决策,根据场景对延迟、成本与智能度的要求制定策略,把取舍标准写成可执行规则而非"视情况而定"。 6. 跟踪前沿并沉淀方法论(Frontier Tracking) 持续跟踪 Agent、Context Engineering、评测方法论的前沿进展,判断哪些可为高德 Agent 所用,并沉淀为团队可复用的方法与工具。 【任职要求】 任职要求 1、技术背景:计算机、人工智能或相关专业背景,2 年以上 AI 产品或 NLP 应用经验。深入理解大模型 Agent 的运行链路——从 query 进入、意图识别、上下文构造、工具选择与调用、结果处理到回复生成,能讲清每一步的输入输出与常见故障点。必须懂机制,而非仅会调用 API。 2、Agent 直觉(Agent Sense): 基础:理解 RAG、Function Calling、Memory、Context Window 的基本原理与典型应用; 进阶:对工具 schema 如何影响模型选择、裁剪策略的副作用、温度等推理参数的影响有实操理解; 专家:能从一次异常输出快速反推是上下文缺失、工具描述问题还是模型能力问题,并给出改进路径。 3、实战能力:熟trace 解析、Prompt 回归测试;熟悉评测集设计与 matcher 规则构造,能处理口语化表达的多样性。发现问题先自己跑数据,不靠等排期。 4、数据品味:能区分"高频低危"与"低频高阻塞"的 bad case,按业务影响而非数量排优先级;不把主观估计当作事实。 5、沟通协作:能用工程师听得懂的语言描述需求,也能向业务方讲清 Agent 能力的边界与局限。 加分项: 有从 0 到 1 构建 Agent 应用或平台的成功案例,并在其中承担核心的效果决策角色。 有 Agent 编排框架、harness 层或模型评测平台的建设经验,理解工具循环的工程实现与评测回归的自动化。 有地图、出行或本地生活领域的产品经验,熟悉 POI 搜索、路径规划等场景下的用户预期。 理解 LLM-as-judge 的适用范围与局限,做过评测集版本管理与自动化回归。 熟悉主流开源与闭源模型(Qwen、DeepSeek、Llama、GPT、Claude 等)的能力差异,做过多模型路由或线上 A/B 实验。 擅长使用 AI 工具流(AI-Native Workflow,如 Cursor、Copilot)提升个人产出效率。 我们期待的你: 你拿到一个"Agent 回答不好"的反馈,不会只说"让算法优化一下"。你会先拉 trace 看上下文里到底喂了什么、工具返回被裁了多少、有效对话历史还剩多少,再判断是改 Prompt、调裁剪策略、补一个上下文源,还是确实需要更强的模型。你用数据定位,用评测验证,用代码确认,最后推动上线并盯住线上表现。

官网刷新:2026-09-02 · 最后确认在招:2026-09-03 22:51:36 · 来源平台:alibaba