阿里云智能 · 校园招聘
大模型推理优化-阿里星/A Star
杭州 ·经验不限·学历不限
北京·杭州
薪资面议
前往 阿里云智能 官网投递
职位描述
1.参与大模型推理引擎(基于SGLang 框架)的设计与核心模块开发,支持 Transformer、MoE、DiffusionLLM 等多种架构及 LLM/VLM 等模型的高性能推理。
2.运用低比特量化、投机采样、稀疏计算、分布式推理等技术,加速大模型推理速度并降低部署成本, 并优化其稳定性、易用性。
3.针对 GPU/AI 芯片架构(含自研硬件),开展针对性性能调优,优化算子、内存管理、KV Cache 管理等核心模块。
4.与算法、产品及业务团队协作,推动不同模型场景下的系统端到端性能优化。
5.关注并引入前沿大模型推理技术,参与 SGLang 及相关开源生态的维护与贡献。
【任职要求】
1. 学历背景:计算机科学、人工智能、电子工程、数学等相关专业硕士,博士优先。
2. 编程能力:精通 C++/CUDA,熟练掌握 Python,具备扎实的数据结构与算法基础,能够编写高性能、高质量的工程代码。
3. 深度学习框架:熟悉 PyTorch 等主流深度学习框架,了解其底层实现机制及计算图优化原理。
4. 专业技能:推理引擎经验:熟悉至少一种主流大模型推理框架(如 SGLang、vLLM、TensorRT-LLM、LMDeploy 等),了解其核心架构与优化原理者优先。
5. 模型架构理解:深入理解 Transformer 架构,熟悉 MoE、Diffusion、LLM/VLM 等模型的原理与推理特性。
6. 推理优化技术:掌握以下至少一项核心优化技术:
- 低比特量化(INT8/INT4/FP8 等);
- 投机采样(Speculative Decoding);
- 稀疏计算 / 稀疏注意力;
- 分布式推理(TP/PP/EP/DP 等并行策略);
- KV Cache 管理与优化;
- 硬件性能调优:熟悉 GPU(NVIDIA/AMD)或 AI 芯片架构,具备算子开发、内存管理、Kernel 优化等性能调优经验;有自研硬件适配经验者优先。
7.综合素质
- 工程能力:具备良好的系统设计能力和工程实践经验,能够独立完成核心模块的设计与开发;
- 协作沟通:具备良好的团队协作精神和跨团队沟通能力,能够与算法、产品及业务团队高效配合;
- 学习能力:对大模型推理技术有强烈的兴趣和热情,关注前沿技术动态,具备快速学习与落地能力。
【加分项】
1. 有 SGLang、vLLM 等知名开源项目的贡献经验(PR、Issue、Commit 等)。
2. 在顶级会议/期刊(如 NeurIPS、ICML、ICLR、MLSys、OSDI 等)发表过相关论文。
3. 有大规模模型生产环境部署与性能优化的实战经验。
4. 熟悉 CUDA 高级特性(如 Tensor Core、CUTLASS、Triton 等)。
5. 参与过推理相关算子库(如 FlashAttention、FlashInfer 等)的开发或优化。
6. 有 MoE 大规模分布式推理或多模态模型(VLM)推理优化经验。
最后确认在招:2026-09-01 19:06:52 · 来源平台:alibaba