阿里巴巴控股集团 · 社会招聘
AI推理平台-大模型KVCache管控系统技术专家-杭州/北京
杭州 ·4年以上·本科
北京·杭州
薪资面议
前往 阿里巴巴控股集团 官网投递
职位描述
1. 负责 LLM 推理场景下 KVCache 管控系统的架构设计与工程实现,建设面向大规模 GPU 集群的 KVCache 资源管理、容量规划、配额控制、生命周期管理与调度编排能力,提升 KVCache 资源利用率与系统稳定性。
2. 设计 KVCache 全局管控与调度策略,结合请求特征、模型类型、上下文长度、Prefix 复用关系、租户优先级与集群资源状态,实现 KVCache 的准入控制、淘汰策略、热点识别、跨实例复用、跨节点迁移与负载均衡。
3. 建设 KVCache 多级存储管控能力,统一管理 GPU HBM / CPU DRAM / NVMe SSD / 远端存储中的 Cache 资源,设计 Cache 分层、回收、预热、预取、降级与故障恢复机制,支撑长上下文、多轮对话、Agent 工作流等复杂推理场景。
4. 负责 KVCache 管控系统与主流推理引擎及调度系统的集成,围绕 vLLM / SGLang / TensorRT-LLM / RTP-LLM 等框架,抽象统一的 KVCache 元数据、状态同步、资源上报与控制接口,支撑异构推理后端的统一纳管。
5. 建设 KVCache 可观测性与稳定性体系,设计 Cache Hit Rate、复用收益、内存水位、碎片率、迁移延迟、Offload 延迟、淘汰次数、请求级 Cache 轨迹等核心指标,支持容量评估、异常诊断、策略调优与线上问题定位。
6. 参与大规模推理集群的端到端性能优化,分析 KVCache 管控策略对 TTFT、TPOT、吞吐、显存利用率、GPU 利用率和请求成功率的影响,持续优化系统在高并发、多租户、长上下文场景下的服务质量。
【任职要求】
1. 扎实的后端系统开发能力,熟悉 C++/Go/Python 中至少一种,熟悉高并发服务、分布式系统、RPC、异步编程、缓存系统与资源调度系统设计。
2. 熟悉分布式资源管控或调度系统,理解多租户隔离、资源配额、优先级调度、负载均衡、准入控制、熔断降级、故障恢复等工程问题。
3. 熟悉缓存系统或存储系统设计原理,理解缓存淘汰策略、热点识别、元数据管理、一致性、分层存储、数据迁移与容量治理,有 Redis / Memcached / Ceph / 3FS / Alluxio 等系统经验者优先。
4. 具备良好的性能分析和问题定位能力,熟悉 Linux 性能工具、Prometheus / Grafana / OpenTelemetry 等可观测性体系,能够从系统链路视角定位推理性能瓶颈。
5. 加分项1:有大规模 LLM 推理平台、GPU 集群调度、KVCache 管控平台、分布式缓存系统或云原生资源调度系统开发经验;有 vLLM / SGLang / Mooncake / Kubernetes / Ray 等相关项目实践或开源贡献经验。
6. 加分项2:AI 重度用户—— Qwen Code / Qoder / Claude Code 等工具用到 token 拉满,有自己的工作实践,把 AI 深度嵌入编码、调试与优化全流程,追求极致研发效率。
最后确认在招:2026-09-01 19:10:48 · 来源平台:alibaba