字节跳动 社会招聘
机器学习训练框架研发工程师 - Data AML
杭州 ·经验不限·学历不限
北京·杭州·上海
薪资面议
前往 字节跳动 官网投递
职位描述
团队介绍:Data AML是字节跳动的机器学习中台,为抖音/今日头条/西瓜视频等业务提供推荐/广告/CV/语音/NLP的训练和推理系统。为公司内业务部门提供强大的机器学习算力,并在这些业务的问题上研究一些具有通用性和创新性的算法。同时,也通过火山引擎将一些机器学习/推荐系统的核心能力提供给外部企业客户。
1、负责推荐、广告、搜索等业务的大规模训练系统研发,支撑超大规模稀疏模型、稠密模型、多模态模型、大语言模型及推荐生成式模型的稳定高效训练;面向推荐大模型方向,支持更长行为序列、更大参数规模和更大训练规模的模型训练,探索推荐领域Scaling Law、推荐生成式模型、多模态推荐和LLM4Rec/LLM CPT/SFT/RL/OPD等新范式;
2、深入业务训练场景,围绕训练效率、稳定性、成本、交付节奏和算法迭代效率,提供端到端系统方案,并沉淀为可复用的平台能力;与算法、平台、存储、硬件和业务团队紧密协作,推动训练链路中的架构升级、性能优化和稳定性治理,支撑下一代搜广推模型训练范式升级;
3、参与训练分布式系统、样本读取和加速、checkpoint、容错恢复、可观测性和诊断系统等模块建设,提升训练链路的可用性、性能和运维效率;深入GPU Embedding/多级存储、分布式并行训练、高性能通信、算子优化、稳定性治理等重点方向,支撑千卡/万卡规模训练系统演进。
【任职要求】
1、计算机、软件工程、人工智能等相关专业背景,具备扎实的数据结构、算法、操作系统、计算机体系结构和分布式系统基础;
2、熟练掌握Linux环境下的C++/Python,熟悉CUDA/Triton者优先;具备优秀的工程实现能力,能够编写高性能、可扩展、可维护的系统代码;
3、熟悉至少一种机器学习框架或训练系统,如PyTorch、TensorFlow、JAX、Megatron-LM、DeepSpeed、FSDP、Ray、VeRL等;有框架底层原理理解、算子开发、性能调优或分布式训练落地经验者优先;
4、具备较强的系统负责人意识,能够在复杂业务场景中识别问题、拆解优先级、推动跨团队协作,并将点状需求抽象为长期可复用的系统能力;
5、熟悉分布式训练系统,理解常见并行策略,如数据并行、模型并行、专家并行、序列并行、流水线并行等;了解DeepSpeed、Megatron等并行训练框架或相关自研系统者优先;
6、具备以下至少一类经验及良好的综合能力:
1)分布式系统、训练框架以及复杂业务系统相关研发经验;
2)参数服务器、GPU Embedding、多级存储、缓存或高性能数据访问;
3)GPU/NPU编程、CUDA/Triton、算子优化、编译器或性能Profiling;
4)高性能通信、NCCL/RDMA、collective communication或并行训练优化;
5)分布式系统、Kubernetes、稳定性治理、可观测性或故障诊断系统;
6)具备良好的沟通协作能力、业务理解能力和技术好奇心,能够在效率、稳定性、成本和长期架构之间做合理取舍,愿意探索超长序列建模、万卡训练稳定性等挑战性问题。
加分项
1、有推荐/广告/搜索训练系统、训练、100B+大模型预训练/微调/强化学习、RLHF/RL训练系统经验;
2、有参数服务器、GPU Embedding、多级缓存/存储优化、高性能数据访问经验;
3、有稳定性、监控诊断、checkpoint、自动恢复、性能建模、自动调优或大规模训练故障治理经验;
4、熟悉GPU架构,具备CUDA/Triton编程经验,深入优化过NCCL、RDMA、网络通信或collective communication性能;
5、有多模态表征学习经验,如CLIP、BLIP、VLM,能够将视觉、文本等特征有效融入推荐系统;
6、深入研究过TensorFlow、PyTorch、JAX或其他自研训练框架的代码和设计,或是训练框架、并行库、高性能计算库等知名开源项目的贡献者;或在RecSys、MLSys、NeurIPS、ICML、ICLR、KDD、SIGIR、CVPR等会议发表过高质量论文,或在ACM-ICPC、KAGGle、天池、KDD Cup、RecSys Challenge等竞赛中取得优异成绩。
官网发布:2026-01-21 · 最后确认在招:2026-09-02 19:19:00 · 来源平台:feishu