字节跳动 社会招聘
大模型训练系统与优化工程师(VLM/Agent RL方向)-Data
上海 ·经验不限·学历不限
上海
薪资面议
前往 字节跳动 官网投递
职位描述
1、统一训练架构建设与演进:负责大模型Post-training框架的代码抽象与底层重构,兼容不同模态、不同训练方式的、正确的、高效的训练框架的建设;
2、超大规模分布式训练优化:面向100B~1T参数级别的超大模型,探索并落地极致的分布式训练策略(DP/TP/PP/EP等组合),通过算子融合、显存优化、分布式策略调整等手段大幅提升集群训练的MFU;
3、Agent RL框架与评估底座建设:攻坚Reasoning RL/Agent RL的训练框架,构建适用于复杂业务环境的标准化评测基准与标准的、稳定的Harness,解决千亿模型在RL阶段的稳定收敛与Rollout效率问题,解决在Agent RL下的长尾问题;
4、多模态与新架构支持:为MoE、Linear Attention等新型模型结构,以及多模态(图、文、音、视)复杂模态的模型训练提供高效支持与正确性(Convergence)验证。
【任职要求】
1、具备2年以上机器学习系统设计、开发与性能调优经验,熟练掌握Python与C++;
2、深入理解并具备PyTorch、DeepSpeed、Megatron或FSDP等主流分布式训练框架的二次开发经验;
3、有100B以上超大模型分布式训练实战经验,能够独立排查并解决收敛性问题与分布式训练瓶颈;
4、在强化学习训练框架(PPO/GRPO/Agent RL)或大模型评测底座、Agentic Harnes有深度实践者优先;
5、具备工程素养,对提升AI Infra的研发效率、代码整洁度与系统稳定性有追求。
官网发布:2026-04-22 · 最后确认在招:2026-09-03 19:35:21 · 来源平台:feishu