直招.cv

← 返回职位列表

字节跳动 校园招聘

Agentic RL For Long Horizon Task-剪映数据与智能团队

深圳 ·经验不限·学历不限

深圳

职位描述

团队介绍:剪映数据与智能团队旨在通过 AI 技术赋能剪映系产品,构建强大的算法能力壁垒。作为剪映系内的算法团队,负责推动整个业务在算法上的迭代与创新,为剪映、CapCut、即梦dreamina、Pippit、醒图等产品提供智能化支持。 课题介绍: Seedance2.0发布后,创作Agent进入深水区,无论是漫剧/短剧/视频/图片都有新的飞跃,为了快速满足用户高质量的创作需求,尤其是超过15s的成片,需要一个涉及多轮Function Call的创作Agent去完成,涉及大量工具的调用,包括不限于意图,分镜,创意,故事性,故事版等。我们打造基于Agentic RL的Agent赋能业务。 Agentic RL在训练 Long-Horizon Tasks有一系列核心难点,本质上比传统RL更复杂,“Agent”不仅要行动,还要规划、分解任务、记忆上下文。 具体难点: 1、Sparse Rewards; 2、Credit Assignment; 3、Planning & Decomposition; 4、Huge State Space; 5、Memory; 6、Exploration; 7、Optimization Difficulty; 8、复杂的Agent交互环境 我们需要解决Agentic RL在多轮Function Call,多个Tools和Skills下的长任务训练问题。 课题挑战: 1、Sparse Rewards a、稀疏奖励,如何设计合理的奖励 2、Credit Assignment a、如何解决信用分配问题 3、Planning & Decomposition a、如何拆解子目标 b、子目标的合理性 4、复杂的Agent交互环境 a、特别长的上下文 b、很多的Tools or Skills 5、训练的稳定性 a、同步、异步RL b、Rollout效率 课题价值: 技术价值: Agentic RL在Long Horizon Task是业内公认的难题,是处理复杂任务,Agent任务必须要攻克的难题,是提升大模型Agent效果上限的关键难题。 业务价值: 1、Long Horizon Task的解决会极大提升剪映各创作agent在处理长任务时的效果,使自研模型对比基座取得行业SOTA; 2、该技术的突破,可以落地更多更复杂的业务场景,尤其对目前的Sandbox Skill等架构有天然的适配。 【任职要求】 1、2027届毕业,获得博士学位,人工智能、计算机科学、数学相关专业优先; 2、技术能力: 1)具备出色的编程能力,精通Python/C++,熟悉TensorFlow/PyTorch等框架,有自然语言处理(NLP)、计算机视觉(CV)或多模态生成模型(如CLIP、Diffusion Models)项目经验; 2)熟悉AIGC工具链(LangChain、AutoGPT)者优先; 3)熟悉大模型理论知识和应用,熟悉常见大模型架构,理解实际业务场景Agent设计理念;有实际大模型预训练、微调或推理优化经验者优先; 3、学术与实践经验: 1)在ACL/CVPR/SIGIR/KDD/NeurIPS/ICCV等顶会发表过AIGC、LLM等相关论文者优先; 2)了解LLM架构,熟悉Multi-Agent技术、Prompt/Context Engineering工程技术,有AI Agent应用经验、AIGC实操经验的优先; 3)热爱视频剪辑,对常用视频剪辑工具有使用经验者优先。

官网发布:2026-04-14 · 最后确认在招:2026-09-03 19:26:41 · 来源平台:feishu