MiniMax 社会招聘
AGI 推理引擎工程师 — 下一代 KVCache 存储与缓存加速
上海 ·经验不限·学历不限
上海·北京
薪资面议
前往 MiniMax 官网投递
职位描述
一、为什么加入我们
1. 离 GPU 最近的工程:你写的每一行代码都直接换算成显存、吞吐和成本——KVCache 是当下大模型推理性价比的核心战场,价值看得见、摸得着;
2. AI First 文化:我们用 AI 重新定义开发范式,鼓励工程师把 AI 工具用到极致,也用 AI 加速自己的系统研发;
3. 真实的大规模场景:千卡集群、千亿 token/天的在线推理,长上下文、高并发下的存储与调度挑战,是普通业务后端给不了的成长曲线;
4. 扁平高效的团队:和推理引擎、算法、存储团队并肩作战,方案当天讨论、当天落地。
二、我们在做什么
MiniMax 正在构建驱动下一代 AGI 的推理基础设施。当上下文越来越长、模型越来越深,KVCache 已经成为推理时显存占用和成本的主导因素——谁能把 KVCache 管好,谁就能用更少的卡、更低的延迟服务更多请求。
我们要做的,是一套以 KVCache 为中心的多级缓存与存储系统:把推理过程中产生的 KV 缓存,从昂贵且稀缺的 GPU 显存(HBM),分层卸载到 DRAM、本地 NVMe SSD 乃至分布式存储集群,再通过前缀复用、智能调度和高速数据通路,把缓存命中率和有效吞吐推到极限——让有限的 GPU 资源,承载远超以往的推理负载。
这不是普通的存储系统,而是直接决定 SOTA 模型推理性能与成本的核心引擎。你将深度参与 KVCache 的卸载、复用、调度与高速 I/O 全链路,对标并超越 Mooncake、3FS、FlexKV、Tair KVCache 等业界顶尖方案。
三、你将做什么
1. 设计并实现 KVCache 多级缓存系统(HBM → DRAM → SSD → 分布式存储),构建高命中率、低延迟的缓存管理与驱逐机制;
2. 打造 KVCache 的高速数据通路,落地 RDMA、GPU Direct Storage(GDS)、零拷贝 等技术,实现 SSD↔GPU 的高吞吐、低延迟传输;
3. 设计 KVCache 调度与前缀复用能力(前缀匹配、滑窗匹配、跨请求/跨实例缓存共享),系统性提升缓存命中率,降低 TTFT;
4. 与推理引擎(vLLM / SGLang / TensorRT-LLM 等)深度集成,参与 PD 分离(Prefill/Decode) 架构下的 KVCache 池化与全局管理;
5. 在千亿 token/天的真实负载下,持续优化系统的吞吐、显存占用、命中率与稳定性,并将能力沉淀为可靠的工程平台。
【任职要求】
四、我们期待你
基础要求:
1. 熟练掌握 C++ / Go / Rust 中至少一门系统级语言(或扎实的 Python 工程能力),具备 2 年以上系统软件 / 基础设施开发经验,有良好的工程素养;
2. 扎实的操作系统、存储与网络基础,理解内存层级、文件系统、I/O 路径,对高并发、大规模数据处理有真实实践;
3. 熟悉至少一类高性能存储或通信技术:NVMe / SSD、RDMA、分布式存储、缓存系统等;
4. 较强的性能分析与问题排查能力,能独立承担核心模块的设计与实现,并对延迟、吞吐、命中率等指标有量化意识。
加分项:
1. 有 KVCache 相关方向的实践或方案经验,了解或参与过 Mooncake、3FS、FlexKV、Tair KVCache、LMCache 等业界方案者优先;
2. 熟悉 LLM 推理流程与显存管理,理解 KVCache、PagedAttention、前缀缓存、PD 分离等机制;
3. 有 GPU Direct Storage、RDMA、零拷贝或异构存储统一接入的工程经验;
4. 熟悉主流推理引擎(vLLM / SGLang / TensorRT-LLM / NVIDIA KVCache、LMCache 等业界方案者优先;
2. 熟悉 LLM 推理流程与显存管理,理解 KVCache、PagedAttention、前缀缓存、PD 分离等机制;
3. 有 GPU Direct Storage、RDMA、零拷贝或异构存储统一接入的工程经验;
4. 熟悉主流推理引擎(vLLM / SGLang / TensorRT-LLM / NVIDIA Dynamo)或对其有源码级理解、社区贡献;
5. 对 AI / 大模型基础设施有浓厚兴趣,关注社区进展并有个人项目或开源贡献。
官网发布:2026-06-26 · 最后确认在招:2026-09-03 19:28:38 · 来源平台:feishu