阿里巴巴控股集团 · 社会招聘
AI推理平台-AIGC推理基础设施研发工程师-北京/杭州
杭州 ·3年以上·硕士
北京·杭州
薪资面议
前往 阿里巴巴控股集团 官网投递
职位描述
多模态 / DiT / 分布式系统方向:面向图像、视频及多模态生成场景,围绕 DiT、VLM 等模型能力,建设稳定、高效、成本可控的 MaaS AIGC 推理基础设施。
具体职责包括:
1. 模型服务架构:负责 AIGC 模型服务框架的设计与研发,建设统一的模型接入协议、Stage 编排、Engine 管理和 Runtime 能力,支持图像、视频生成等模型快速接入,降低能力形态与硬件组合增长带来的交付复杂度。
2. 分布式推理与性能优化:围绕 DiT 等计算密集型模型,参与并行方案设计,分析计算、通信、显存和 Pipeline Bubble 等核心瓶颈;结合 Profiling、通信计算重叠、Batching、CUDA Graph、算子融合等手段,持续优化任务时延、吞吐、显存占用、GPU 利用率和单位推理成本。
3. 调度与资源效率:面向分辨率、视频时长、采样步数等差异化请求,建设请求调度队列、批处理、QoS、流量路由和弹性伸缩能力;探索 Cohort Scheduling、动态 Pipeline、异构资源池调度等方案,在保障服务质量的前提下提升闲置资源和低成本资源的使用效率。
4. 下一代推理架构:参与 NVLink/NVSwitch等高速互联环境下的 Supernode-Native Serving 探索,建设拓扑感知的进程组管理、角色编排、进程生命周期和请求调度能力,推动新硬件、新并行方案在更大并行域下继续scale的平台能力。
【任职要求】
1. 计算机、软件工程、人工智能等相关专业,熟练使用 Python;具备 C++、CUDA、Rust 等开发经验者优先。
2. 具备 2 年及以上 AI Infra、模型推理、分布式系统或 GPU 服务相关经验,熟悉 PyTorch 及其分布式执行机制。
3. 熟悉多机多卡系统中的进程组、集合通信、显存管理和并行计算,有 FSDP、TP、SP、EP、PP 等多种并行方案的实践经验。
4. 具备良好的系统设计和抽象能力,能够从单模型需求中识别共性问题,设计可扩展、可观测、可灰度和可回滚的平台能力。
5. 有责任心和结果意识,具备良好的沟通、执行与跨团队协作能力,能够推动复杂技术方案从设计、验证走向生产落地。
加分项
● 有图像、视频生成、Diffusion 或 DiT 模型服务经验。
● 熟悉 Diffusers、xDiT、vLLM、SGLang 或其他推理框架。
● 有 CUDA、Triton、NCCL、Nsight Systems/Compute 等性能优化与 Profiling 经验。
● 有 Kubernetes、大规模在线服务、异构 GPU 调度、弹性伸缩或超节点相关经验。
● 有推理框架、分布式系统或性能优化方向的开源贡献。
最后确认在招:2026-09-01 19:10:48 · 来源平台:alibaba