字节跳动 社会招聘
语音/多模态大模型算法工程师(Speech/Omni/Agent方向) - Data语音
北京 ·经验不限·学历不限
北京
薪资面议
前往 字节跳动 官网投递
职位描述
团队介绍:Data-语音团队致力于语音、音乐等大模型AIGC技术的研发和产品创新,我们的使命是通过多模态AIGC音频技术赋能内容创作和语音交互,让内容生产、消费与互动变得更加简单、沉浸、多元化。当前团队已有成熟的大模型语音合成、语音理解、音乐生成等多模态音频技术,并持续迭代大模型端到端语音交互方案等,一方面通过中台形式服务于公司众多业务线,例如豆包/Dola、抖音/TikTok、剪映/CapCut、番茄小说、海绵音乐等产品;另一方面,团队已经通过字节跳动旗下的火山引擎开放平台-语音技术和火山方舟平台,向众多企业开放技术成熟稳定的能力和服务。
1、参与研发语音、语言、视觉多模态一体化(Omni)端到端大模型,探索跨模态原生融合与低延迟实时交互体验;
2、负责大模型在复杂企业生产场景下的任务规划、工具调用(Tool Use)、长文本/长音频处理及多智能体(Multi-Agent)协同系统的构建与架构优化;
3、推动多模态大模型、AI Agent及语音生成/理解技术在企业级关键场景中的应用落地,如智能座舱、智能客服、生产力工具、沉浸式陪伴等,实现技术价值转化;
4、深入调研并攻克语音、NLP、多模态、强化学习及大模型Agent等领域的前沿技术难题。
【任职要求】
1、计算机科学、电子信息工程、自动化、人工智能等相关专业背景,硕士学位/博士学位优先;
2、具备多模态大模型、语音语言模型或大语言模型(LLM)的研发经验和深入理解;
3、熟悉AI Agent系统设计与工程实现,工具调用、复杂推理、任务规划、多智能体协同或基于反馈学习的Agent行为对齐方面有实际项目经验者优先;
4、具备良好的工程实现能力,熟悉大模型训练、推理、评测与部署链路,有模型效果优化、性能优化或系统稳定性建设经验者优先。
加分项
1、在领域国际会议或期刊发表过高水平论文者优先,如NeurIPS、ICML、ICLR、CVPR、ACL、Interspeech、ICASSP等;
2、有开源大模型、多模态系统、Agent系统或语音智能项目核心贡献经验者优先;
3、对企业、生产力场景中的模型能力、工程效率、成本控制与稳定性有经验者优先。
官网发布:2026-06-24 · 最后确认在招:2026-09-03 19:35:21 · 来源平台:feishu