直招.cv

← 返回职位列表

阿里巴巴控股集团 · 校园招聘

面向AI芯片推理系统优化-阿里星

杭州 ·经验不限·学历不限

北京·成都·杭州·上海

职位描述

大模型时代,推理效率已成为 AI 落地的核心瓶颈。我们正在构建面向自研 AI 芯片的高性能推理系统,目标是在千亿参数大模型上实现业界领先的推理吞吐和延迟。 你将参与设计推理引擎的核心模块,包括图执行引擎、内存管理、批处理调度、分布式推理等。你需要在算法、系统和硬件三个层面寻找最优解——从模型量化、KV Cache 优化、Speculative Decoding 等算法创新,到算子调度、显存复用、流水线并行等系统优化,再到与编译器、驱动团队协作榨干硬件的每一分性能。 岗位职责 • 设计并实现高性能推理引擎,支持主流大模型(LLaMA/Qwen/GPT 等)的高效推理 • 研究和落地推理优化技术,包括但不限于:KV Cache 管理、Continuous Batching、Speculative Decoding、模型量化(INT8/INT4/FP8)、稀疏化推理 • 设计高效的显存管理策略,优化大模型推理的显存占用和碎片问题 • 开发分布式推理框架,支持张量并行(Tensor Parallelism)、流水线并行(Pipeline Parallelism)、专家并行(Expert Parallelism)等策略 • 与算子库团队协作,定义高性能算子的接口和性能目标 • 与编译器团队协作,优化推理场景下的编译策略和代码生成 • 构建推理性能基准测试框架,持续跟踪和优化推理性能 【任职要求】 • 计算机科学、软件工程、人工智能或相关专业,硕士及以上学历(博士优先) • 深入理解深度学习模型的推理过程,熟悉 Transformer/LLM 的架构和计算特性 • 扎实的 C/C++ 和 Python 编程能力,有高性能系统开发经验 • 熟悉 CUDA/ROCm 等 GPU 编程模型,或有其他 AI 加速器编程经验 • 对操作系统内存管理、多线程并发、分布式系统有深入理解 • 有强烈的性能优化意识,习惯用数据驱动决策 加分项 • 在 MLSys、系统、体系结构等领域发表过顶级论文(OSDI/SOSP/ASPLOS/EuroSys/MLSys 等) • 参与过 vLLM、SGLang、TensorRT-LLM、LMDeploy 等开源推理框架的核心开发 • 有 GPU/NPU 上的高性能算子开发经验(如 FlashAttention、FlashInfer 等) • 熟悉分布式训练/推理框架(Megatron-LM、DeepSpeed、Ray 等) • 有大规模模型部署经验,处理过千卡级别的推理集群

最后确认在招:2026-09-01 19:06:52 · 来源平台:alibaba