直招.cv

← 返回职位列表

阿里云智能 · 校园招聘

大模型推理及后训练关键技术研究-阿里星/A Star

杭州 ·经验不限·学历不限

北京·杭州

职位描述

在这里,你将深入大模型推理系统的核心腹地,从推理引擎内核、KV Cache存储体系,到模型微调与部署的全链路打通,打造高性能、低成本的推理与定制化交付引擎。 1.参与大模型推理引擎(vLLM/SGLang等)的深度优化与定制化开发,包括Continuous Batching、PD分离、投机采样、低比特量化等核心机制,持续提升推理吞吐与延迟表现; 2.负责KV Cache存储与管理体系建设,包括多级缓存架构(HBM/DRAM/SSD)、Prefix Cache复用、迁移/共享/淘汰策略、分布式KV Cache高效传输; 3.参与多模态大模型的推理与后训练技术建设,包括ViT/DiT等异构结构的推理加速、多模态场景的Cache优化与显存管理、图文/视频数据的微调链路适配; 4.参与大模型后训练与微调系统建设,包括SFT全参微调与参数高效微调(LoRA/QLoRA等)训练链路、数据流水线与效果评估,打通""微调→压缩→部署→推理""闭环,支持Multi-LoRA推理服务; 5.基于线上真实负载持续优化推理链路的性能、稳定性与成本效率,在生产环境实现延迟与吞吐的数量级提升。 【任职要求】 1.计算机相关专业博士; 2.熟悉vLLM、SGLang、TensorRT-LLM等开源推理引擎的架构与实现,深入理解Continuous Batching、PagedAttention、KV Cache管理、PD分离、量化、投机采样等关键技术; 3.了解大模型微调技术(SFT、LoRA/QLoRA等),熟悉Megatron-LM、FSDP、DeepSpeed等训练框架者优先; 4.了解多模态大模型架构(视觉理解/视觉生成等),有多模态模型推理优化或微调实践经验者优先; 5.具备高性能系统开发经验,熟悉GPU编程(CUDA/Triton)与NCCL等通信技术者优先,能够系统性分析推理链路中的性能瓶颈; 6.良好的学习与自驱能力和跨团队协作能力,积极拥抱AI辅助编程工具提升开发效率。 加分项: 1.在OSDI/SOSP/ATC/NeurIPS/ICML/ICLR等顶会/顶刊发表过高质量论文; 2.深度参与或主导贡献过顶级开源项目(vLLM/SGLang/TensorRT-LLM/Megatron-LM等); 3.有KV Cache分布式存储、微调模型量化部署等实战经验,或了解RLHF/DPO等模型对齐技术。

最后确认在招:2026-09-01 19:06:52 · 来源平台:alibaba