直招.cv

← 返回职位列表

小红书 社会招聘

Agent 基础设施工程师 - Agent Infrastructure Engineer

北京 ·经验不限·学历不限

北京市·上海市

职位描述

岗位说明 1.负责公司级Agent平台的核心基础设施和 Agent 生产运行底座建设,为不同 Agent 架构提供统一、稳定、高性能、可扩展的运行环境 2.工作范围不仅局限于传统 Runtime,而是覆盖 Agent Harness Kernel、Execution Runtime、Durable Execution、模型与工具调用、状态管理、Context Runtime、Sandbox、调度、可靠性、性能和成本等核心基础设施 3.目标是构建一个不绑定特定 Agent Framework 或架构范式的通用 Agent Infrastructure,使 ReAct、Workflow、Deep Research、Multi-Agent、Long-Horizon Task 等不同 Agent 能够低成本接入并稳定运行 核心职责 1. Agent Runtime / Harness Kernel 建设:参与设计和实现 Agent Runtime 核心执行模型,包括 Task、Session、Step、State、Model Call、Tool Call、Agent Loop 等关键运行实体,以及模型调用、工具执行、状态流转、异常处理等核心机制 2. Durable Execution 与任务调度能力建设:建设长生命周期 Agent 所需的 Task Scheduling、Checkpoint / Resume、状态持久化、失败恢复、任务取消、异步执行、事件驱动、Human-in-the-loop 等能力,支撑分钟级到长周期任务稳定运行 3. Agent 执行基础设施建设:建设和演进 Agent 运行过程中依赖的基础设施,包括模型调用、Tool / Skill Execution、Sandbox、Context Runtime、Memory 接入、资源隔离、任务队列以及分布式执行等能力 4. Runtime 稳定性与生产工程建设:负责 Agent 运行时的生产级可靠性,包括 Timeout、Retry、Fallback、Circuit Breaker、Idempotency、Load Shedding、Failure Recovery、Multi-region 等机制,持续提升 Agent 服务 SLO 5. 性能与成本优化:围绕模型调用、Token 消耗、Context 长度、并行执行、缓存、模型路由、Tool Execution 等核心链路持续优化 Agent 延迟、吞吐和成本,建立效果、性能和资源效率之间的合理平衡 6. Runtime 可观测与标准化:建设 Agent Runtime 统一 Trace 和运行数据模型,使 Model、Tool、Memory、Context、Sub-Agent 等执行步骤能够被完整追踪,并支撑问题定位、成本归因、效果归因和 Evaluation 7. 基础能力平台化与标准化输出:将业务 Agent 中重复出现的运行能力提炼为标准 Runtime API、SDK、Protocol 和 Execution Primitive,降低业务接入和维护成本,并保持底层基础设施对上层 Agent 架构的开放性 【任职要求】 任职资格 1. 扎实的计算机基础和工程能力:熟悉操作系统、网络、并发、存储、分布式系统等基础知识,具备良好的代码能力和工程质量意识 2. 有复杂后端或基础设施系统经验:有分布式系统、服务框架、任务调度、Workflow Engine、消息系统、计算平台、云原生基础设施等相关研发经验之一 3. 对生产级系统有深入理解:熟悉高可用、容灾、限流、熔断、超时、重试、幂等、故障恢复、可观测等生产系统关键机制,有线上复杂问题排查经验 4. 对 LLM / Agent 基础设施有兴趣和理解:了解 LLM 调用、Tool Calling、Context、Agent Loop、Streaming 等基本机制,对 Agent Runtime / Harness 有较强兴趣;有相关研发经验更佳 5. 具备良好的系统抽象能力:能够从不同业务 Agent 的具体需求中识别公共问题,并抽象成稳定的基础设施能力,而不是针对单一业务不断增加特例 6. 对性能与效率敏感:有系统性能优化、延迟优化、资源利用率或成本优化经验,能够通过数据分析定位系统瓶颈并持续优化 加分项 1.有 Agent Runtime / Harness / Agent Framework 开发经验 2.有 Workflow Engine、Scheduler、Durable Execution、Serverless Runtime 等研发经验 3.有 Kubernetes、Sandbox、Container Runtime、Service Mesh 等基础设施经验 4.有大模型网关、推理服务、模型路由或 AI Infrastructure 经验 5.有大规模分布式系统、高并发服务核心模块研发经验

官网发布:2026-09-02 · 最后确认在招:2026-09-03 23:16:54 · 来源平台:xiaohongshu