字节跳动 校园招聘
大语言模型强化学习算法工程师-Seed大模型人才校招
上海 ·经验不限·学历不限
上海
薪资面议
前往 字节跳动 官网投递
职位描述
Seed 大模型人才校招,是字节跳动 Seed 面向高校人才推出的招聘项目。我们始终相信,真正重要的技术进步来自对高难度问题的持续挑战。面对 AI 时代的巨大机遇,Seed 团队并不止步于模型迭代,而是选择进入技术深水区,推进下一代 AI 范式突破,不断探索智能的边界与上限。
团队介绍:字节跳动 Seed 团队成立于 2023 年,致力于寻找通用智能的新方法,追求智能上限,为科技和社会发展作出贡献。Seed 团队在 AI 领域拥有长期愿景与决心,团队研究方向涵盖 MLLM、GenMedia、AI for Science、机器人等,在中国、新加坡、美国等地设有实验室和岗位。目前,团队已推出业界领先的通用大模型以及前沿的多模态能力,支持豆包、即梦、TRAE 等超过 50 个应用场景,并通过火山引擎开放给企业客户。第三方数据显示,豆包 App 用户量在中国市场排名第一,豆包大模型日均 Token 调用量行业领先。
在这里,你将深度参与通往 AGI 的核心路径。我们不只是在训练模型,而是在探索智能的极限。作为 RL Science and Scaling 的一员,你将与行业前沿研究员/工程师协作,挑战如何通过强化学习让模型具备超越人类的逻辑推理与自我进化能力。
工作内容:
1、RL算法的前沿探索:参与研究并实现新一代大规模分布式强化学习算法(如PPO,GRPO以及Search-based RL),解决复杂任务下的对齐与泛化难题;
2、Scaling Law实验科学:参与设计高效率的实验体系,探索计算量、数据量与模型表现之间的尺度定律,验证推理侧Scaling的无限可能;
3、核心场景突破:挑战大模型在数学推理、代码编写、长程规划(Reasoning & Planning)等硬核领域的SOTA表现;
4、工程与算法的极致结合:深度参与万卡级别集群的分布式训练优化,将复杂的算法思想转化为高性能的工程实现。
【任职要求】
1、2027届获得本科及以上学历,计算机、数学、统计等相关专业;
2、RL基础:对强化学习有深厚兴趣,了解基本理论(如Policy Gradient,Q-Learning等),熟悉主流算法(如PPO,GRPO等),有相关课题研究或项目实战经验者优先;拥有扎实的数学功底和机器学习理论基础;
3、编程功底:具备较强的代码实现能力,精通Python/C++;如果你曾获得ACM-ICPC、NOI/IOI等顶级竞赛奖项,或者在Top Coder、Kaggle排名靠前,我们将优先考虑;
4、科研实战:
1)在NeurIPS,ICML,ICLR,CVPR,NLP顶会有相关高水平论文发表者优先;
2)对大模型(LLM)底层架构有深入理解,有主流深度学习框架(PyTorch/JAX)的深度使用经验。
5、极客精神:拥有好奇心,能从First Principles(底层逻辑)思考问题,不迷信现有框架,敢于挑战技术无人区。
官网发布:2026-03-29 · 最后确认在招:2026-09-03 19:26:41 · 来源平台:feishu