字节跳动 校园招聘
大模型算法实习生(多模态模型训练方向)-剪映数据与智能团队
深圳 ·经验不限·学历不限
深圳
薪资面议
前往 字节跳动 官网投递
职位描述
日常实习:面向全体在校生,为符合岗位要求的同学提供为期3个月及以上的项目实践机会。
团队介绍:剪映数据与智能团队旨在通过 AI 技术赋能剪映系产品,构建强大的算法能力壁垒。作为剪映系内的算法团队,负责推动整个业务在算法上的迭代与创新,为剪映、CapCut、即梦dreamina、Pippit、醒图等产品提供智能化支持。
1、负责多模态视频生成模型的训练与优化,重点围绕序列帧处理构建训练数据体系,包括序列帧时序一致性标注、透明度通道(Alpha Channel) 标签化、视频美学特征(色彩、构图、过渡效果)结构化,支撑模型对视频视觉元素的精准理解;
2、基于SFT、增量预训练等技术,优化多模态模型在序列帧生成、透明度图层合成场景的效果,解决帧间抖动、通道融合失真等问题;
3、参与模型审美能力的建模与提升,结合主观审美维度(色彩协调度、构图合理性、风格统一性)与客观指标(如视频优质率、用户留存率),设计模型评测方案,推动视频优质率核心指标提升;
4、协同产品、视觉设计团队,将训练后的多模态模型落地到剪映CapCut的核心功能(如智能图层生成、序列帧过渡效果推荐),验证模型在实际业务场景的效果并迭代优化。
【任职要求】
1、本科及以上学历在读,人工智能、计算机科学、数字媒体技术、计算机视觉相关专业优先;
2、技术能力:
1)具备扎实的编程能力,精通Python,熟悉C++者优先,熟练使用TensorFlow/PyTorch等深度学习框架,有计算机视觉或多模态模型(如VideoMAE、FLAVA、Diffusion-Based视频生成模型)项目经验;
2)了解视频处理基础技术,包括序列帧分帧/合帧、透明度通道(Alpha Channel)融合、图层合成算法,有相关技术实践(如视频特效生成、透明图层建模)经验者优先;
3)熟悉多模态模型理论与架构,理解模态融合(文本-图像-视频)逻辑,有视频生成模型预训练、微调或效果优化经验者优先;
4)具备基础审美能力,了解视觉设计原则(如色彩理论、构图规则),有图像/视频美学评分模型、视觉质量评估(VQA)相关项目经验者优先;
3、学术与实践经验:
1)在CVPR/ICCV/ECCV/NeurIPS/ICML等顶会发表过序列帧处理、视频生成、多模态视觉优化相关论文者优先;
2)有视频编辑工具(如剪映、Premiere、AE)使用经验,或参与过视频内容生成、视觉特效开发项目(如透明图层生成、智能剪辑)者优先;
3)有通过模型优化提升视频优质率、视觉效果评分等实际业务指标案例,或有设计类竞赛(如视觉设计、视频创作比赛)获奖经历者优先;
4)有编程竞赛(如ACM-ICPC、蓝桥杯)或数模竞赛(如国赛、美赛)获奖经历者优先;
4、每周出勤至少4天,可连续实习4个月以上。
官网发布:2025-12-16 · 最后确认在招:2026-09-03 19:26:41 · 来源平台:feishu