直招.cv

← 返回职位列表

字节跳动 社会招聘

大模型训练系统与优化工程师(VLM/Agent RL方向)-Data

上海 ·经验不限·学历不限

上海

职位描述

1、统一训练架构建设与演进:负责大模型Post-training框架的代码抽象与底层重构,兼容不同模态、不同训练方式的、正确的、高效的训练框架的建设; 2、超大规模分布式训练优化:面向100B~1T参数级别的超大模型,探索并落地极致的分布式训练策略(DP/TP/PP/EP等组合),通过算子融合、显存优化、分布式策略调整等手段大幅提升集群训练的MFU; 3、Agent RL框架与评估底座建设:攻坚Reasoning RL/Agent RL的训练框架,构建适用于复杂业务环境的标准化评测基准与标准的、稳定的Harness,解决千亿模型在RL阶段的稳定收敛与Rollout效率问题,解决在Agent RL下的长尾问题; 4、多模态与新架构支持:为MoE、Linear Attention等新型模型结构,以及多模态(图、文、音、视)复杂模态的模型训练提供高效支持与正确性(Convergence)验证。 【任职要求】 1、具备2年以上机器学习系统设计、开发与性能调优经验,熟练掌握Python与C++; 2、深入理解并具备PyTorch、DeepSpeed、Megatron或FSDP等主流分布式训练框架的二次开发经验; 3、有100B以上超大模型分布式训练实战经验,能够独立排查并解决收敛性问题与分布式训练瓶颈; 4、在强化学习训练框架(PPO/GRPO/Agent RL)或大模型评测底座、Agentic Harnes有深度实践者优先; 5、具备工程素养,对提升AI Infra的研发效率、代码整洁度与系统稳定性有追求。

官网发布:2026-04-22 · 最后确认在招:2026-09-03 19:35:21 · 来源平台:feishu