阿里国际 · 社会招聘
阿里国际站/Alibaba.com-大模型训练基础设施工程师-Accio
杭州 ·2年以上·本科
杭州
薪资面议
前往 阿里国际 官网投递
职位描述
1、支撑模型团队使用 Megatron 进行大规模分布式训练,处理 tensor parallel、pipeline parallel、data parallel、expert parallel、sequence/context parallel 等并行策略相关问题;
2、支撑模型团队使用 SGLang 进行高吞吐推理和 rollout,优化 batching、KV cache、prefill/decode 调度、长上下文稳定性和在线训练链路;
3、设计和实现面向更大模型规模的 post-training infra,降低训练资源成本,提高实验迭代效率和系统稳定性;
4、建设 profiling、benchmark、monitoring 和 debugging 工具,提升训练吞吐、GPU utilization、rollout 稳定性和故障定位效率;
5、与研究员和模型工程师紧密合作,把新的训练想法快速落地成可复现、可扩展、可长期维护的系统能力。
【任职要求】
1、扎实的工程能力,熟悉 Python,最好熟悉一种系统语言或高性能计算相关语言,例如 C++、CUDA、Rust 或 Go;
2、熟悉 PyTorch 生态,理解大模型训练的基本流程,包括 forward/backward、optimizer、checkpoint、activation checkpointing、mixed precision 等;
3、有分布式系统或大规模训练经验,理解 GPU 集群、NCCL、通信开销、显存瓶颈、吞吐优化和故障恢复;
4、对 Megatron、DeepSpeed、FSDP、SGLang、vLLM、TensorRT-LLM、Ray 等训练或推理系统中的至少一类有实际使用或开发经验;
5、理解大模型 post-training 的基本范式,例如 SFT、DPO、PPO、GRPO、RLHF、RLAIF 或 agentic RL;
6、能够在复杂系统中定位问题:从日志、metric、profile、checkpoint、到分布式 rank 行为,都愿意追到根因;
7、有强 ownership,能把一次性的实验脚本沉淀成可复用的工具、模板、文档和稳定接口;
8、能和研究团队高效协作,既尊重研究速度,也重视系统正确性和长期可维护性。
加分项:做过 LLM training infra、RLHF infra、online RL、agent training、tool-use training、MoE 训练、低精度训练/推理、PEFT 或高质量开源 infra 项目。
最后确认在招:2026-09-01 19:10:30 · 来源平台:alibaba