直招.cv

← 返回职位列表

阿里巴巴控股集团 · 社会招聘

达摩院-大模型推理优化工程师-计算技术

杭州 ·1年以上·硕士

成都·北京·杭州·上海

职位描述

● 基于GPU Profile完成模型算子覆盖率分析,识别必选高性能算子开发路径并评估性能影响。 ● 基于性能仿真建模工具完成性能建模并检查review,输出整网及分层模块性能预期报告,明确关键模块与算子形状、数据类型及切分策略。 ● 结合Profile与建模结果,输出算子开发需求清单(含算子列表、shape、dtype、切分策略)及接口需求说明文档,明确算子/框架团队优先验证规格。 ● 维护并扩展补充新增AI芯片算子单OP精度与性能参考代码,沉淀AI Harness SKILL/Agent资产。 ● 建立主要模型推理规格的GPU竞品性能数据清单,形成可量化对标基准。 ● 跑通模型Fake Tensor推理(带切分方案)与Real Tensor推理全流程,验证并行切分策略正确性。 ● 对比实测性能与建模预期,量化Gap来源(算子效率/切分策略/调度开销/显存带宽等),驱动算子、框架、编译器团队形成优化闭环,持续逼近建模性能极限。 ● 制定端到端精度验证策略,输出验证方案与QA转测说明,完成AI芯片daily QA转测交付。 ● 输出模型整体并行方案与子模块/算子级切分细化方案,形成建模性能预期数据报告。 【任职要求】 ● 计算机、电子工程或相关专业硕士及以上学历,初级1-3年,高级5年以上AI基础设施、高性能计算或AI编译器相关工作经验。 ● 精通Python/C++,熟悉Linux开发环境。 ● 深入理解至少一种推理框架(vLLM/SGLang/TensorRT-LLM/Triton Inference Server)或AI编译器生态(Triton/TileLang/TVM/MLIR),具备Op/Kernel开发或调优经验。 ● 熟练使用NVIDIA性能分析工具(Nsight Systems/Nsight Compute/PyTorch Profiler),具备从trace中定位kernel耗时、带宽瓶颈及调度开销的能力。 ● 理解性能建模方法论(Roofline等),能够量化建模与实测间的Gap来源。 ● 熟悉Tensor/Pipeline/Data/Sequence Parallelism等并行策略,具备切分方案设计与验证经验。 ● 具备AI Harness提效加速构建经验。 加分项: ● 有LLM(LLaMA/Qwen/DeepSeek等)部署至自研AI芯片或异构硬件的全流程经验。 ● 有性能仿真建模工具开发或二次开发经验。 ● 有vLLM/Triton/PyTorch等开源项目核心贡献经历。 ● 有AI编译器端到端开发落地沉淀经验。

最后确认在招:2026-09-01 19:10:48 · 来源平台:alibaba