阿里巴巴控股集团 社会招聘
智能引擎-大模型推理与 KV Cache 系统研发工程师-存储服务方向
北京 ·2年以上·本科
北京
薪资面议
前往 阿里巴巴控股集团 官网投递
职位描述
面向大模型在线推理场景,建设高性能、低成本、高可靠的推理加速基础设施,支撑高并发、大规模模型服务。
你将参与以下工作:
1. 设计和研发 KV Cache 存储、复用、调度与加速系统,优化 Prefill/Decode 阶段的缓存管理与资源利用率。
2. 协同 GPU 显存、主存、SSD 及远端存储等多级资源,优化 KV Cache 换入换出、跨节点迁移、共享复用和生命周期管理。
3. 优化首 Token 延迟、端到端时延、推理吞吐和集群资源成本,提升大模型服务的稳定性与弹性能力。
4. 分析并解决推理服务在线上的性能瓶颈、显存碎片、长尾延迟和稳定性问题,持续推动系统架构演进。
【任职要求】
1. 计算机相关专业本科及以上学历,精通 C/C++,熟悉 Linux 系统开发、调试和性能分析。
2. 具备扎实的数据结构、算法、操作系统、并发编程和网络基础,有高性能系统或分布式系统研发经验。
3. 理解 Transformer 推理、Attention 和 KV Cache 等核心机制;对显存管理、推理调度、缓存系统或分布式资源调度有实践经验者优先。
4. 具备良好的问题拆解和工程落地能力,能够定位复杂线上性能与稳定性问题,并推动持续优化。
5. 对大模型推理、AI 基础设施和极致性能优化有浓厚兴趣。
官网刷新:2026-08-28 · 最后确认在招:2026-09-03 22:50:57 · 来源平台:alibaba