小红书 社会招聘
Agent 基础设施工程师 - Agent Infrastructure Engineer
北京 ·经验不限·学历不限
北京市·上海市
薪资面议
前往 小红书 官网投递
职位描述
岗位说明
1.负责公司级Agent平台的核心基础设施和 Agent 生产运行底座建设,为不同 Agent 架构提供统一、稳定、高性能、可扩展的运行环境
2.工作范围不仅局限于传统 Runtime,而是覆盖 Agent Harness Kernel、Execution Runtime、Durable Execution、模型与工具调用、状态管理、Context Runtime、Sandbox、调度、可靠性、性能和成本等核心基础设施
3.目标是构建一个不绑定特定 Agent Framework 或架构范式的通用 Agent Infrastructure,使 ReAct、Workflow、Deep Research、Multi-Agent、Long-Horizon Task 等不同 Agent 能够低成本接入并稳定运行
核心职责
1. Agent Runtime / Harness Kernel 建设:参与设计和实现 Agent Runtime 核心执行模型,包括 Task、Session、Step、State、Model Call、Tool Call、Agent Loop 等关键运行实体,以及模型调用、工具执行、状态流转、异常处理等核心机制
2. Durable Execution 与任务调度能力建设:建设长生命周期 Agent 所需的 Task Scheduling、Checkpoint / Resume、状态持久化、失败恢复、任务取消、异步执行、事件驱动、Human-in-the-loop 等能力,支撑分钟级到长周期任务稳定运行
3. Agent 执行基础设施建设:建设和演进 Agent 运行过程中依赖的基础设施,包括模型调用、Tool / Skill Execution、Sandbox、Context Runtime、Memory 接入、资源隔离、任务队列以及分布式执行等能力
4. Runtime 稳定性与生产工程建设:负责 Agent 运行时的生产级可靠性,包括 Timeout、Retry、Fallback、Circuit Breaker、Idempotency、Load Shedding、Failure Recovery、Multi-region 等机制,持续提升 Agent 服务 SLO
5. 性能与成本优化:围绕模型调用、Token 消耗、Context 长度、并行执行、缓存、模型路由、Tool Execution 等核心链路持续优化 Agent 延迟、吞吐和成本,建立效果、性能和资源效率之间的合理平衡
6. Runtime 可观测与标准化:建设 Agent Runtime 统一 Trace 和运行数据模型,使 Model、Tool、Memory、Context、Sub-Agent 等执行步骤能够被完整追踪,并支撑问题定位、成本归因、效果归因和 Evaluation
7. 基础能力平台化与标准化输出:将业务 Agent 中重复出现的运行能力提炼为标准 Runtime API、SDK、Protocol 和 Execution Primitive,降低业务接入和维护成本,并保持底层基础设施对上层 Agent 架构的开放性
【任职要求】
任职资格
1. 扎实的计算机基础和工程能力:熟悉操作系统、网络、并发、存储、分布式系统等基础知识,具备良好的代码能力和工程质量意识
2. 有复杂后端或基础设施系统经验:有分布式系统、服务框架、任务调度、Workflow Engine、消息系统、计算平台、云原生基础设施等相关研发经验之一
3. 对生产级系统有深入理解:熟悉高可用、容灾、限流、熔断、超时、重试、幂等、故障恢复、可观测等生产系统关键机制,有线上复杂问题排查经验
4. 对 LLM / Agent 基础设施有兴趣和理解:了解 LLM 调用、Tool Calling、Context、Agent Loop、Streaming 等基本机制,对 Agent Runtime / Harness 有较强兴趣;有相关研发经验更佳
5. 具备良好的系统抽象能力:能够从不同业务 Agent 的具体需求中识别公共问题,并抽象成稳定的基础设施能力,而不是针对单一业务不断增加特例
6. 对性能与效率敏感:有系统性能优化、延迟优化、资源利用率或成本优化经验,能够通过数据分析定位系统瓶颈并持续优化
加分项
1.有 Agent Runtime / Harness / Agent Framework 开发经验
2.有 Workflow Engine、Scheduler、Durable Execution、Serverless Runtime 等研发经验
3.有 Kubernetes、Sandbox、Container Runtime、Service Mesh 等基础设施经验
4.有大模型网关、推理服务、模型路由或 AI Infrastructure 经验
5.有大规模分布式系统、高并发服务核心模块研发经验
官网发布:2026-09-02 · 最后确认在招:2026-09-03 23:16:54 · 来源平台:xiaohongshu