高德 社会招聘
高德-ToB Agent 平台产品专家-Harness 方向
北京 ·3年以上·本科
北京
薪资面议
前往 高德 官网投递
职位描述
岗位使命:
我们要找的是to B agent harness产品。对外把底座封装成客户三行代码就能接入的 SDK 与控制台,对内把 Agent 的智能水平变成能跑数、能回归的评测闭环,同时你自己就是这条链路的项目推进人——排期、卡点、验收全都归你。
职责配比:ToB Harness 产品 55%,Agent 平台产品 30%,项目推进 15%。
岗位职责:
1. 定义 ToB Harness 产品:把一套底座切成客户能选的能力档位
收敛 runtime 的配置维度(模型、harness、工具、Skill、卡片样式),对外只暴露档位与少量参数,不暴露内部复杂度。
设计能力分档策略:每档要给出延迟、成本、智能度的明确三角,以及哪些请求会被降级、哪些会被直接拒绝。
按客户形态拆接入方案:有屏车机、无屏 AIoT 设备、第三方 App 内嵌助手,各自的接入路径与兜底逻辑要分别定义。
定义对外返回结构与计费口径:卖结论、卡片与引用来源,不卖裸数据;按量阶梯计费而非包月。
每份方案配一份客户视角的接入演练,包含真实 API 调用示例、失败态处理和能力边界声明。
2. 建设 Agent 平台产品:让 Agent 的生产与准入变成流水线
负责 Agent 的创建、配置装配,以及外部工具与 Skill 的引入与治理。
工具与 Skill 的准入审计:schema 与实际注册实现是否同步(不同步会产出模型看得见但调不通的幻影工具);工具返回的凭据字段在上下文裁剪后是否还在(丢了会导致同一个目标被重复召回);第三方 Skill 的字段语义是否与本平台一致(同一个 allowed-tools 字段,在有的框架里是权限白名单,在有的框架里是增量召回清单,语义相反)。
上下文工程治理:拆清单请求里 system prompt、tools schema、对话历史各占多少 token,识别哪部分是固定开销,在裁剪率与召回质量之间给出明确取舍,不靠感觉调。
3. 构建评测闭环:用任务完成率而不是格式合法率驱动迭代
设计细粒度评测集,多个指标分开看、不做加权合成,红线项单独判定。
核心指标是任务完成率与任务满足率。"格式合法地终结了对话"不算完成。
推动实验有效的策略固化为生产能力,并持续监控线上表现。
4. 推进项目落地:每阶段有可验收产物,卡点显性化
按三阶段节奏推进——底座打通、SDK 与控制台上线、规模化复制,每阶段的验收标准提前写死。
维护 Owner 表与卡点表。周会只过两件事:本周动了什么、被谁卡住,不做进度美化。
客户交付走项目制:需求分级、变更控制、上线后监控与迭代排期。并行管理 3 个以上客户与 2 个以上内部团队时,排期不失控、卡点能及时上升。
【任职要求】
1、懂 Agent 运行时原理
有 ToB 产品交付经验,SDK、开放平台、开发者控制台任一方向,能独立写出客户看得懂的接入文档与能力边界说明。
2、能自己动手验证假设
熟练用 Python 配合 AI 编程助手写评测脚本、解析 trace、跑 prompt 回归、搭 mock 与 record-replay 环境,不靠等别人排期。
3、有数据品味
拿到一个 bad case 能判断根因落在哪一层:prompt 写法、工具 schema、召回数据,还是评测环境本身不可控。
4、双向翻译能力
对工程讲清要改哪个模块,对客户讲清能力边界在哪、这个需求为什么现在做不了。
5、计算机、人工智能或相关专业背景,3 年以上 AI 产品或平台产品经验。
加分项:
1、做过评测平台、harness 层或 Agent 编排框架。
2、熟悉 Skill 与 MCP 工具生态,能判断外部能力的准入风险。
3、有车企或 IoT 设备客户的交付经验。
4、从 0 到 1 建过开放平台或开发者控制台,并在其中承担核心产品决策。
5、熟悉主流开源与闭源模型的能力差异,做过多模型路由策略。
官网刷新:2026-09-03 · 最后确认在招:2026-09-03 22:51:36 · 来源平台:alibaba