字节跳动 社会招聘
多模态数据工程师-Seed
北京 ·经验不限·学历不限
北京
薪资面议
前往 字节跳动 官网投递
职位描述
团队介绍:字节跳动Seed团队成立于2023年,致力于寻找通用智能的新方法,追求智能上限,为科技和社会发展作出贡献。
Seed团队在AI领域拥有长期愿景与决心,团队研究方向涵盖MLLM、GenMedia、AI for Science、机器人等,在中国、新加坡、美国等地设有实验室和岗位。目前,团队已推出业界领先的通用大模型以及前沿的多模态能力,支持豆包、即梦、TRAE等超过50个应用场景,并通过火山引擎开放给企业客户。第三方数据显示,豆包App用户量在中国市场排名第一,豆包大模型日均Token调用量行业领先。
1、负责千亿级别海量多模态数据全生命周期管理,覆盖视频、图像等数据的存储架构设计、分布式处理、全链路安全管控、自动化数据校验与质量治理;深度结合OCR、ASR、视频语义切分技术,优化多模态数据清洗、结构化、标注流程,保障数据合规性与高可用性;
2、负责多模态数据链路基建的全栈研发,追求极致的处理性能与执行效率,基于Transformer、CNN架构特性优化数据处理链路的推理加速方案,打造高并发、低延迟、高可用的分布式多模态数据处理引擎,支撑百万QPS级别的数据处理能力,兼顾工程稳定性与算法执行效率;
3、负责大规模多模态数据的分析洞察与可视化体系建设,深度挖掘数据分布、数据质量、数据特征对模型预训练、SFT微调效果的关联影响,搭建可解释的数据洞察平台,为模型训练策略优化、效果迭代提供核心数据依据;
4、与算法、模型训练团队深度协同,端到端打造数据-训练-评测-优化的全链路闭环;深度适配LLM/VLM的SFT监督微调全流程需求,加速高质量训练数据的生产与筛选,支撑模型效果评测与数据迭代,落地企业级大模型数据相关部署方案;
5、负责多模态数据能力的产品化封装,搭建易用的数据分析、算法推理与可视化工具,降低团队内数据获取与使用门槛,最大化多模态数据在大模型迭代中的核心价值。
【任职要求】
1、熟练掌握Python、Golang中至少一种主流编程语言,具备高并发、异步编程实战经验,有百万级QPS数据链路研发与调优经验者优先。经历、面试优秀者能适当放宽就业经验要求;
2、精通Hive、ClickHouse、MySQL、MongoDB、ElasticSearch等数据湖/数据仓库技术,深入理解底层实现原理,具备优秀的数据抽象、建模与分布式架构设计能力;
3、熟练掌握Hadoop、Spark、Flink、Ray等大数据处理框架,有千亿级分布式数据处理系统的研发、运维与性能优化经验。
加分项:
1、具备扎实的深度学习理论基础,精通Transformer、CNN等主流模型架构,熟悉LLM、VLM的技术原理、训练范式与落地全流程;
2、熟练掌握LLM/VLM的SFT监督微调核心方法论,有相关技术的企业级落地与部署经验者优先;
3、熟悉大模型推理加速核心技术与实现方案,有相关产业界规模化落地经验、或顶会/顶刊相关学术成果者优先;
4、熟悉视频语义切分、OCR、ASR技术原理与落地应用,有多模态内容理解相关实战经验;
5、有通用大模型训练数据全链路建设、多模态数据治理相关完整项目经验。
官网发布:2024-06-07 · 最后确认在招:2026-09-03 19:35:21 · 来源平台:feishu