直招.cv

← 返回职位列表

vivo 社会招聘

AI Infra 算法工程师

杭州 ·5年以上·硕士研究生

上海·杭州

职位描述

AI Infra 算法工程师 岗位职责 本岗位聚焦大模型训练侧AI基础设施建设+核心算法预研,兼顾底层基建优化与训练算法创新,核心围绕大模型、多模态模型训练全链路,完成技术预研以及架构迭代。具体职责如下: 1.训练架构算法预研与迭代:跟进业界大模型训练前沿技术,针对LLM、多模态大模型训练场景,开展相关算法预研,包括但不限于TP、PP、DP、EP等分布式训练策略优化,突破传统训练瓶颈,提升超大模型训练可行性。 2.训练侧AI Infra体系搭建与优化:负责模型训练全链路基建优化,涵盖算力调度、显存优化、通信优化、梯度优化等核心模块,搭建适配超大参数模型、大规模算力集群的训练基础设施,解决训练卡顿、显存溢出、通信延迟、算力利用率低等核心问题。 3.训练性能调优与工程落地:针对自研模型、开源主流大模型(LLaMA、Qwen、GPT系列等)进行训练适配与深度调优,结合GPU/昇腾等异构算力特性,完成训练框架适配,持续提升训练吞吐、降低训练时延与算力成本,输出标准化训练解决方案。 4.前沿技术调研与落地验证:持续跟踪AI训练领域前沿算法与基建技术(如低秩适配训练LoRA、动态训练、训练加速引擎等),完成技术可行性验证、对比测评、方案落地,将前沿预研成果转化为可复用的训练工具链与基建能力。 任职要求 硬性要求 1. 研究生及以上学历,计算机、人工智能、软件工程、电子信息、数学等相关专业,1年以上AI Infra、大模型训练、算法预研相关工作/实习经验。 2. 扎实的深度学习与大模型基础,熟悉Transformer架构、大模型预训练/微调核心原理,熟练掌握PyTorch、TensorFlow等主流训练框架。 3. 精通训练侧核心技术,熟悉分布式训练机制,熟练掌握DDP、ZeRO、FSDP、Megatron-LM等主流分布式训练方案,深刻理解各类并行策略、显存优化、梯度累积核心原理。 4. 具备扎实的Python、C/C++编程能力,熟悉Linux开发环境,掌握GPU性能调优、通信优化(NCCL、Gloo)、算子开发与优化基础。 5. 具备独立技术预研、方案设计、落地攻坚能力,能够主动跟进前沿技术,独立完成技术验证与方案迭代。 优先加分项 1. 有大模型/多模态模型完整预训练、大规模分布式训练落地经验,参与过十亿/百亿/千亿参数模型训练项目者优先。 2. 熟悉AI训练基建体系,有训练平台、强化学习、算力调度系统、训练加速引擎开发优化经验,了解集群算力调度、容错训练、动态资源分配机制者优先。 3. 熟悉高效训练算法,有LoRA、QLoRA、稀疏训练、混合精度训练、动态序列长度训练等技术落地优化经验者优先。 4. 有算子优化、模型编译、推理训练一体化优化经验,熟悉CUDA开发、TorchScript、ONNX等技术者优先。 5. 在顶会(NeurIPS、ICLR、CVPR等)发表过训练优化、AI基建相关论文,或开源过相关技术项目者优先。

最后确认在招:2026-09-02 22:04:40 · 来源平台:vivo