直招.cv

← 返回职位列表

高德 社会招聘

高德-ToB Agent 平台产品专家-Harness 方向

北京 ·3年以上·本科

北京

职位描述

岗位使命: 我们要找的是to B agent harness产品。对外把底座封装成客户三行代码就能接入的 SDK 与控制台,对内把 Agent 的智能水平变成能跑数、能回归的评测闭环,同时你自己就是这条链路的项目推进人——排期、卡点、验收全都归你。 职责配比:ToB Harness 产品 55%,Agent 平台产品 30%,项目推进 15%。 岗位职责: 1. 定义 ToB Harness 产品:把一套底座切成客户能选的能力档位 收敛 runtime 的配置维度(模型、harness、工具、Skill、卡片样式),对外只暴露档位与少量参数,不暴露内部复杂度。 设计能力分档策略:每档要给出延迟、成本、智能度的明确三角,以及哪些请求会被降级、哪些会被直接拒绝。 按客户形态拆接入方案:有屏车机、无屏 AIoT 设备、第三方 App 内嵌助手,各自的接入路径与兜底逻辑要分别定义。 定义对外返回结构与计费口径:卖结论、卡片与引用来源,不卖裸数据;按量阶梯计费而非包月。 每份方案配一份客户视角的接入演练,包含真实 API 调用示例、失败态处理和能力边界声明。 2. 建设 Agent 平台产品:让 Agent 的生产与准入变成流水线 负责 Agent 的创建、配置装配,以及外部工具与 Skill 的引入与治理。 工具与 Skill 的准入审计:schema 与实际注册实现是否同步(不同步会产出模型看得见但调不通的幻影工具);工具返回的凭据字段在上下文裁剪后是否还在(丢了会导致同一个目标被重复召回);第三方 Skill 的字段语义是否与本平台一致(同一个 allowed-tools 字段,在有的框架里是权限白名单,在有的框架里是增量召回清单,语义相反)。 上下文工程治理:拆清单请求里 system prompt、tools schema、对话历史各占多少 token,识别哪部分是固定开销,在裁剪率与召回质量之间给出明确取舍,不靠感觉调。 3. 构建评测闭环:用任务完成率而不是格式合法率驱动迭代 设计细粒度评测集,多个指标分开看、不做加权合成,红线项单独判定。 核心指标是任务完成率与任务满足率。"格式合法地终结了对话"不算完成。 推动实验有效的策略固化为生产能力,并持续监控线上表现。 4. 推进项目落地:每阶段有可验收产物,卡点显性化 按三阶段节奏推进——底座打通、SDK 与控制台上线、规模化复制,每阶段的验收标准提前写死。 维护 Owner 表与卡点表。周会只过两件事:本周动了什么、被谁卡住,不做进度美化。 客户交付走项目制:需求分级、变更控制、上线后监控与迭代排期。并行管理 3 个以上客户与 2 个以上内部团队时,排期不失控、卡点能及时上升。 【任职要求】 1、懂 Agent 运行时原理 有 ToB 产品交付经验,SDK、开放平台、开发者控制台任一方向,能独立写出客户看得懂的接入文档与能力边界说明。 2、能自己动手验证假设 熟练用 Python 配合 AI 编程助手写评测脚本、解析 trace、跑 prompt 回归、搭 mock 与 record-replay 环境,不靠等别人排期。 3、有数据品味 拿到一个 bad case 能判断根因落在哪一层:prompt 写法、工具 schema、召回数据,还是评测环境本身不可控。 4、双向翻译能力 对工程讲清要改哪个模块,对客户讲清能力边界在哪、这个需求为什么现在做不了。 5、计算机、人工智能或相关专业背景,3 年以上 AI 产品或平台产品经验。 加分项: 1、做过评测平台、harness 层或 Agent 编排框架。 2、熟悉 Skill 与 MCP 工具生态,能判断外部能力的准入风险。 3、有车企或 IoT 设备客户的交付经验。 4、从 0 到 1 建过开放平台或开发者控制台,并在其中承担核心产品决策。 5、熟悉主流开源与闭源模型的能力差异,做过多模型路由策略。

官网刷新:2026-09-03 · 最后确认在招:2026-09-03 22:51:36 · 来源平台:alibaba