阿里巴巴控股集团 · 社会招聘
达摩院-大模型推理优化工程师-计算技术
杭州 ·1年以上·硕士
成都·北京·杭州·上海
薪资面议
前往 阿里巴巴控股集团 官网投递
职位描述
● 基于GPU Profile完成模型算子覆盖率分析,识别必选高性能算子开发路径并评估性能影响。
● 基于性能仿真建模工具完成性能建模并检查review,输出整网及分层模块性能预期报告,明确关键模块与算子形状、数据类型及切分策略。
● 结合Profile与建模结果,输出算子开发需求清单(含算子列表、shape、dtype、切分策略)及接口需求说明文档,明确算子/框架团队优先验证规格。
● 维护并扩展补充新增AI芯片算子单OP精度与性能参考代码,沉淀AI Harness SKILL/Agent资产。
● 建立主要模型推理规格的GPU竞品性能数据清单,形成可量化对标基准。
● 跑通模型Fake Tensor推理(带切分方案)与Real Tensor推理全流程,验证并行切分策略正确性。
● 对比实测性能与建模预期,量化Gap来源(算子效率/切分策略/调度开销/显存带宽等),驱动算子、框架、编译器团队形成优化闭环,持续逼近建模性能极限。
● 制定端到端精度验证策略,输出验证方案与QA转测说明,完成AI芯片daily QA转测交付。
● 输出模型整体并行方案与子模块/算子级切分细化方案,形成建模性能预期数据报告。
【任职要求】
● 计算机、电子工程或相关专业硕士及以上学历,初级1-3年,高级5年以上AI基础设施、高性能计算或AI编译器相关工作经验。
● 精通Python/C++,熟悉Linux开发环境。
● 深入理解至少一种推理框架(vLLM/SGLang/TensorRT-LLM/Triton Inference Server)或AI编译器生态(Triton/TileLang/TVM/MLIR),具备Op/Kernel开发或调优经验。
● 熟练使用NVIDIA性能分析工具(Nsight Systems/Nsight Compute/PyTorch Profiler),具备从trace中定位kernel耗时、带宽瓶颈及调度开销的能力。
● 理解性能建模方法论(Roofline等),能够量化建模与实测间的Gap来源。
● 熟悉Tensor/Pipeline/Data/Sequence Parallelism等并行策略,具备切分方案设计与验证经验。
● 具备AI Harness提效加速构建经验。
加分项:
● 有LLM(LLaMA/Qwen/DeepSeek等)部署至自研AI芯片或异构硬件的全流程经验。
● 有性能仿真建模工具开发或二次开发经验。
● 有vLLM/Triton/PyTorch等开源项目核心贡献经历。
● 有AI编译器端到端开发落地沉淀经验。
最后确认在招:2026-09-01 19:10:48 · 来源平台:alibaba