直招.cv

← 返回职位列表

字节跳动 校园招聘

多模态内容理解算法工程师 - 抖音直播

北京 ·经验不限·学历不限

北京·深圳

职位描述

团队介绍:直播团队负责为抖音集团旗下产品提供直播服务。团队负责直播平台技术和直播业务研发,打造灵活稳定的直播服务平台,为用户提供优质直播体验,支持电商、本地生活、游戏、节目、多人互动等不同类型的业务场景。直播业务发展迅猛,处于行业头部地位,业务发展空间巨大。现在加入我们,和优秀的人一起做有挑战的事,你的技术与创意将影响亿级用户,激发创意和丰富生活。 1、负责抖音直播AI视觉互动相关的多模态内容理解工作,实现视觉内容的结构化解析和跨模态语义对齐,打造面向AI视觉互动的多模态内容理解大模型; 2、基于CNN、VLM等技术推进模型训练、微调、评测及高效部署,推动模型在下游业务上的应用,包括AI视觉互动内容生成、Caption文本生成等,助力业务规模应用落地; 3、规划实现并优化海量多模态数据的预处理、清洗、标注、特征提取及高效融合方法。 【任职要求】 1、2027届获得本科及以上学历,计算机及相关专业优先; 2、在计算机视觉/多模态某领域有深入的研究或项目经验,在顶级学术会议有论文发表者或获得竞赛优胜者优先; 3、熟悉多模态大模型(VLM)、大语言模型(LLM)、RL相关的算法技术,熟悉大模型相关的数据构造方法、Post-training算法,对多模态数据处理具备优秀的独立开发与调试能力; 4、有大规模模型训练、压缩、蒸馏、微调等经验,熟悉Megatron、DeepSpeed等框架者优先; 5、对视觉CoT有研究经验者优先; 6、优秀的分析和解决问题的能力,对解决具有挑战性的问题充满激情,良好的沟通和团队合作能力。

官网发布:2026-08-03 · 最后确认在招:2026-09-03 19:26:41 · 来源平台:feishu