阿里健康 · 社会招聘
阿里健康-AI infra专家(训练方向)-杭州/北京
杭州 ·3年以上·本科
北京·杭州
薪资面议
前往 阿里健康 官网投递
职位描述
训练方向:
负责分布式训练框架的设计与优化,支撑医学大模型(LLM及多模态)的预训练、SFT微调、Post-Training(RLHF/GRPO/PPO等强化学习对齐)全流程训练任务。
构建高效稳定的训练数据Pipeline,包括数据预处理、数据加载与调度、Checkpoint管理(异步快照、分布式Checkpoint、断点续训)等基础设施。
优化大规模分布式训练的性能与稳定性,包括并行策略设计与调优(数据并行/张量并行/流水线并行/序列并行)、MoE架构训练与专家并行(Expert Parallelism)、FP8/BF16混合精度训练、长上下文训练(Ring Attention/Context Parallelism)、通信拓扑优化等。
【任职要求】
1、精通代码编写,包括但不限于C/C++/Python/Rust/Java等,熟悉Linux/Unix开发环境,具备良好的工程实现能力,有较强的代码调试和解决技术问题的能力。
2、熟悉计算机系统相关知识,包括计算机网络、操作系统、计算机体系结构、数据库等;对AI Infra相关技术有浓厚兴趣,熟悉Nvidia GPU及相关生态者优先。
3、对医疗健康领域有兴趣,了解医疗AI行业的特殊要求(如数据合规、模型可靠性、循证医学等)者加分。
4、有较强的团队精神和沟通交流能力,能够跨团队协作推动项目落地。
5、熟悉业界主流的分布式训练框架,包括但不限于PyTorch/Megatron/DeepSpeed/verl等,有大规模预训练、微调或RL训练(如GRPO/PPO)的实战经验。
具备分布式训练的高性能计算经验,如并行策略调优(数据并行/张量并行/流水线并行/序列并行)、MoE架构与专家并行(Expert Parallelism)、FP8/BF16混合精度训练、长上下文训练、梯度累积与通信拓扑优化、弹性Checkpoint等。
最后确认在招:2026-09-01 19:10:11 · 来源平台:alibaba