直招.cv

← 返回职位列表

字节跳动 社会招聘

语音大模型数据专家(国际化数据) - AI数据与安全

北京 ·经验不限·学历不限

北京

职位描述

团队介绍:AI 数据与安全团队为 Seed 基座模型及 AI 原生应用提供跨模态数据服务,覆盖数据生产全流程,包含模型评估标准的制定、数据规模化生产、数据飞轮搭建,不断提升数据质量,支持模型快速迭代。 团队由产品经理、数据工程、数据运营等跨职能人才组成,并通过与 Seed 研究员、行业专家、全球顶尖数据供应商紧密合作,从真实场景中收集反馈并分析模型表现数据,解决 AI 前沿突破过程中的复杂数据问题,推动模型性能与用户体验的双重提升。我们既是帮助模型技术迭代的一线贡献者,也是模型和 AI 产品的一手用户。 1、牵头多语种(西班牙语、葡萄牙语、俄语、阿拉伯语、马来语等多语种)训练数据全流程管理,搭建符合各语种特性的标注框架与质量标准,对齐专家/算法团队需求,确保数据适配大模型训练场景; 2、统筹标注团队,主导多语种数据生产、预处理、标注、校验全链路推进,解决不同语种在表达习惯、文化适配等方面的差异化问题; 3、搭建多语种数据自动化生产链路,通过PE工具、代码工具优化数据处理效率,开展数据质量评估与分析调优,提升数据准确率、完整性与多样性; 4、协同算法、产品团队跟踪大模型技术进展,探索多语种智能数据生产模式,结合各语种使用场景迭代数据生产方案,支撑模型多语种能力优化,开展自然语言处理、自动语音识别、文本转语音方向自研探索与业务落地; 5、建立多语种数据生产协作机制,跨团队同步数据进度与质量情况,沉淀语种适配经验与数据处理方法论,形成可复用的标准流程。 【任职要求】 1、本科及以上学历,语言类、计算机类、数据科学类相关专业,具备1年以上多语种数据处理或大模型数据生产相关工作经验; 2、语言学基础扎实、或精通至少1门小语种,拥有C1证书(或同等水平语言证明),具备2至3种其他语种的基本语言学认识;能独立完成本语种数据质量校验与标准制定,英文可作为工作语言,听说能力佳,能撰写英文文档; 3、熟悉大语言模型训练数据生产逻辑,掌握数据标注、预处理、质量评估的核心方法,具备搭建多语种数据生产框架的实操能力; 4、具备基础的Python代码能力或PE工具使用经验,能通过技术手段优化多语种数据处理效率,有自动化数据生产链路搭建经验者优先; 5、具备优秀的统筹协调与跨团队沟通能力,能带领团队高效推进多语种数据生产任务,擅长解决不同语种的差异化协作问题; 6、了解各目标语种的使用区域特性与表达习惯,对大语言模型多语种能力优化有一定认知,具备较强的问题解决能力与迭代思维。

官网发布:2025-12-15 · 最后确认在招:2026-09-03 19:35:21 · 来源平台:feishu