直招.cv

← 返回职位列表

阿里云智能 社会招聘

阿里云智能-大模型训练系统研发工程师-PAI平台

杭州 ·3年以上·硕士

北京·杭州

职位描述

阿里云PAI团队致力于打造业界一流的一站式AI平台,拥有万卡级训练能力与超大规模异构资源调度技术,为复杂模型训练与推理任务构建坚实基座。PAI平台不仅是通义大模型研发与落地的核心基础设施,也作为公共云服务的关键载体,支撑众多行企业构建大模型核心业务。平台提供从数据标注、预处理、模型训练、推理服务到开发环境与工作流调度的全链路工程支持,全面覆盖AI项目从实验探索到规模化落地的完整价值链。作为大模型训练系统研发工程师,您将深度参与以下工作: 1. 负责PAI深度学习引擎的核心研发,重点突破MoE大规模训练、多模态(VLM/VLA)及Agentic RL(智能体强化学习)等前沿框架,覆盖Pretrain、SFT、RLHF/RLAIF等全生命周期训练任务的框架优化。 2. 针对超大规模模型负载,系统化分析训练各阶段瓶颈,通过数据加载加速、算子融合优化、通信库调优及分布式策略改进等手段,提升训练吞吐率。 3. 深入异构硬件底层,实现训练框架对多种新型加速卡的高效适配与性能调优。 4. 设计并实施超大规模训练任务的稳定性保障方案,构建高精度的故障检测与自动自愈系统;优化任务启动速度与断点续训机制,显著提升有效训练时长和任务成功率。 5. 构建智能体与环境交互的轨迹追踪系统及多种业界Benchmark适配体系,为LLM、自动驾驶、具身智能等领域提供便捷的底层基础设施支持。 6. 负责线上环境的实时监控、异常定位与性能诊断,建立快速响应机制;为头部客户提供专家级技术支持,保障平台服务的高可用性与高稳定性,助力客户业务顺利落地。 【任职要求】 1. 计算机及相关专业背景,具备扎实的计算机基础与系统化思维能力,熟悉Python/C++语言和常用设计模式,具备复杂系统的设计开发调试能力。 2. 熟悉深度学习的基础理论概念,熟悉Transformer架构,熟悉主流大语言模型、多模态模型、自动驾驶、具身智能等模型特点。 3. 熟练PyTorch等领域常用框架,掌握Megatron、DeepSpeed、JAX、Verl、RLInf等不同训练框架的各自特点和细节。 4. 熟悉计算机体系结构基础知识,有异构计算优化(GPGPU/x86/ARM等)、高性能网络架构通信优化、分布式训练策略优化等方面的经验。 5. 优良的沟通表达能力、团队合作意识和经验;具备快速学习的能力,以及深入钻研技术问题的耐心。 6. 具备AI辅助下的全栈软件开发能力,能够熟练运用Copilot、Agent Coding及Agentic Coding等工具,覆盖从需求、设计、编程到测试、发布的完整研发生命周期

官网刷新:2026-09-06 · 最后确认在招:2026-09-07 20:21:02 · 来源平台:alibaba