直招.cv

← 返回职位列表

阿里巴巴控股集团 · 社会招聘

智能引擎-KV Cache 存储系统开发-杭州

杭州 ·2年以上·本科

杭州

职位描述

1. KVCache 核心系统研发,负责 LLM 推理场景下 KVCache 的架构设计与工程实现,优化 KVCache 的内存管理、显存分配与生命周期调度策略,研究并实现 Prefix Cache、Radix Tree Cache 等高效缓存复用机制,提升 Cache Hit Rate。 2. 设计跨机、跨节点的分布式 KVCache 共享与迁移方案,实现 KVCache 在 GPU HBM / CPU DRAM / NVMe SSD 多级存储间的高效卸载(Offload)与加载,针对长上下文、多轮对话场景优化 KVCache 的存储与传输效率。 3. 推理性能优化,结合 Continuous Batching、PagedAttention、Chunked Prefill 等机制,协同优化 KVCache 调度策略,分析推理链路中 KVCache 相关的性能瓶颈,进行端到端性能优化,针对主流推理框架(vLLM / SGLang / TensorRT-LLM / RTP-LLM)进行 KVCache 模块的深度优化与定制。 4. 系统可靠性与可观测性建设,建设 KVCache 命中率、内存占用、调度延迟等核心指标的监控体系,保障大规模集群下 KVCache 服务的高可用与容错能力。 【任职要求】 1. 扎实的系统编程能力,精通 C++/Python,熟悉高性能并发编程与内存管理。 2. 深入理解 KVCache 相关技术,PagedAttention / vAttention 等显存分页管理,Prefix Cache / Semantic Cache 等缓存复用技术,KVCache 量化(INT8/FP8 KV)压缩技术,KVCache Offload 至 CPU/SSD 的分层存储技术。 3. 理解 LLM 推理原理,熟悉 Transformer 架构及 Attention 计算机制,熟悉主流 LLM 推理框架。 4. 熟悉 CUDA 编程,了解 GPU 显存管理、PCIe/NVLink 传输机制。 5. 加分项:有在 vLLM / SGLang / Mooncake 等开源项目贡献 KVCache 相关 PR 的经验,熟悉存储系统(Ceph / 3FS)或分布式缓存系统(Redis / Memcached)设计原理。

最后确认在招:2026-09-01 19:10:48 · 来源平台:alibaba