直招.cv

← 返回职位列表

通义实验室 · 社会招聘

Token Foundry-多模态交互算法专家-Qwen Audio

杭州 ·2年以上·硕士

北京·杭州

职位描述

1. 负责Token Foundry多模态口语交互的算法研发,通过深入理解全链路多模态交互技术,推进大模型增强的语言交互技术能力建设。 2. 多模态交互: (1)端到端多模态联合建模 - 语音/视觉/文本等模态融合并应用于人机交互场景。 (2)多模态交互应用算法 - 意图动态规划、多智能体协作、多任务推理、主动交互。 (3)多模态对话系统设计 - 多轮交互状态管理、情境感知、情感理解及生成控制。 3. 音视频内容理解: (1)转写内容后处理 - 书面化、标点、分段分章节。 (2)音视频分析 - 分角色、语种判别、视频场景划分。 (3)口语内容长篇章理解及生成。 4. 探索多模态口语交互技术落地于实际应用场景,包括但不限于: (1)消费电子-智能穿戴实时交互、手机多模态助手、具身机器人环境感知。 (2)内容消费-音视频媒资、会议场景、电销通话多模态理解等。 5. 持续关注行业前沿动态,通过专利申请、论文和技术报告等形式提升团队的技术影响力。 【任职要求】 1. 计算机或通信专业硕士及以上学历。 2. 具有2年以上多模态交互或语言理解算法研发经验,以下领域至少精通一项: (1)多模态联合建模(语音+视觉/文本等)。 (2)对话系统设计及开发。 (3)口语语言理解。 (4)多智能体交互决策。 3. 精通基于深度神经网络的机器学习算法,熟悉Transformer、GPT、LLM等算法原理,掌握 AI 产品开发的开源工具和框架,具备优秀的编程能力。 4. 具备以下经验者加分: (1)在顶级会议或期刊上发表过相关领域的论文。 (2)有业界前沿的语音多模态交互或数字人交互系统的算法经验。

最后确认在招:2026-09-01 19:09:38 · 来源平台:alibaba