直招.cv

← 返回职位列表

字节跳动 社会招聘

多模态数据工程师-Seed

北京 ·经验不限·学历不限

北京

职位描述

团队介绍:字节跳动Seed团队成立于2023年,致力于寻找通用智能的新方法,追求智能上限,为科技和社会发展作出贡献。 Seed团队在AI领域拥有长期愿景与决心,团队研究方向涵盖MLLM、GenMedia、AI for Science、机器人等,在中国、新加坡、美国等地设有实验室和岗位。目前,团队已推出业界领先的通用大模型以及前沿的多模态能力,支持豆包、即梦、TRAE等超过50个应用场景,并通过火山引擎开放给企业客户。第三方数据显示,豆包App用户量在中国市场排名第一,豆包大模型日均Token调用量行业领先。 1、负责千亿级别海量多模态数据全生命周期管理,覆盖视频、图像等数据的存储架构设计、分布式处理、全链路安全管控、自动化数据校验与质量治理;深度结合OCR、ASR、视频语义切分技术,优化多模态数据清洗、结构化、标注流程,保障数据合规性与高可用性; 2、负责多模态数据链路基建的全栈研发,追求极致的处理性能与执行效率,基于Transformer、CNN架构特性优化数据处理链路的推理加速方案,打造高并发、低延迟、高可用的分布式多模态数据处理引擎,支撑百万QPS级别的数据处理能力,兼顾工程稳定性与算法执行效率; 3、负责大规模多模态数据的分析洞察与可视化体系建设,深度挖掘数据分布、数据质量、数据特征对模型预训练、SFT微调效果的关联影响,搭建可解释的数据洞察平台,为模型训练策略优化、效果迭代提供核心数据依据; 4、与算法、模型训练团队深度协同,端到端打造数据-训练-评测-优化的全链路闭环;深度适配LLM/VLM的SFT监督微调全流程需求,加速高质量训练数据的生产与筛选,支撑模型效果评测与数据迭代,落地企业级大模型数据相关部署方案; 5、负责多模态数据能力的产品化封装,搭建易用的数据分析、算法推理与可视化工具,降低团队内数据获取与使用门槛,最大化多模态数据在大模型迭代中的核心价值。 【任职要求】 1、熟练掌握Python、Golang中至少一种主流编程语言,具备高并发、异步编程实战经验,有百万级QPS数据链路研发与调优经验者优先。经历、面试优秀者能适当放宽就业经验要求; 2、精通Hive、ClickHouse、MySQL、MongoDB、ElasticSearch等数据湖/数据仓库技术,深入理解底层实现原理,具备优秀的数据抽象、建模与分布式架构设计能力; 3、熟练掌握Hadoop、Spark、Flink、Ray等大数据处理框架,有千亿级分布式数据处理系统的研发、运维与性能优化经验。 加分项: 1、具备扎实的深度学习理论基础,精通Transformer、CNN等主流模型架构,熟悉LLM、VLM的技术原理、训练范式与落地全流程; 2、熟练掌握LLM/VLM的SFT监督微调核心方法论,有相关技术的企业级落地与部署经验者优先; 3、熟悉大模型推理加速核心技术与实现方案,有相关产业界规模化落地经验、或顶会/顶刊相关学术成果者优先; 4、熟悉视频语义切分、OCR、ASR技术原理与落地应用,有多模态内容理解相关实战经验; 5、有通用大模型训练数据全链路建设、多模态数据治理相关完整项目经验。

官网发布:2024-06-07 · 最后确认在招:2026-09-03 19:35:21 · 来源平台:feishu