直招.cv

← 返回职位列表

阿里巴巴控股集团 · 社会招聘

基础设施与稳定性工程-AI软硬件性能剖析与优化专家-杭州

杭州 ·3年以上·本科

杭州

职位描述

构建面向大规模AI集群的GPU微架构采集、性能剖析与优化决策系统,建设集群的性能分析、瓶颈定位、故障诊断等核心能力。 1. 针对NVIDIA、AMD、国产GPGPU等多厂商芯片,设计并实现规模化、无侵入的kernel级采集工具链和微架构指标体系; 2. 构建AI continuous profiling系统,将GPU kernel数据与算子执行、框架调度、通信原语、CPU性能、高性能通信性能相关联,为全栈性能优化提供量化的性能瓶颈数据和画像系统; 3. 结合理论 Roofline 分析与 simulation 方法,融合线上 profiling 数据,建设集群范围的软硬件配合与关键性能瓶颈分析体系,支撑AI训练与推理典型负载下的系统级优化; 4. 跟踪主流GPU架构演进,参与AI基础设施规划与设计,结合生产应用画像,支撑多元GPU/AI ASIC芯片的适配与优化,构建异构硬件性能的全链路量化分析模型,面向scale-up等未来AI硬件架构演进,建立硬件性能建模与TCO评估能力,形成数据驱动的决策支撑。 【任职要求】 1. 两年及以上异构计算系统开发经验,理解GPU微架构、体系结构与性能特性;熟悉NVIDIA、AMD等主流GPU架构和GPU/AI ASIC硬件设计者优先。 2. 理解GPU采集机制与指标体系,有GPU kernel profiling、性能分析的实践经验;熟悉CUPTI、ROCProfiler、nsys/ncu等profiling工具者优先。 3. 掌握C++、Python、CUDA编程之一;有Cutlass、Triton等高性能算子优化开发经验,理解算子编译优化与GPU硬件特性关系者优先。 4. 理解PyTorch、TensorFlow等AI框架底层实现,理解大模型计算特性(GEMM、Attention等),熟悉Megatron、DeepSpeed等训练框架和vLLM、sglang等推理框架;有实际训练推理性能优化技术落地经验者优先; 5. 具备高水平的学习能力、抗压能力、跨团队协作沟通能力。

最后确认在招:2026-09-01 19:10:48 · 来源平台:alibaba