直招.cv

← 返回职位列表

通义实验室 · 社会招聘

Token Foundry-语音多模态大模型算法工程师-Qwen Audio

杭州 ·3年以上·硕士

北京·杭州

职位描述

1. 语音多模态大模型算法创新:面向下一代语音多模态通用大模型,探索并定义统一的技术范式,开展文本、语音等多模态的联合建模与协同推理研究,系统性解决多模态对齐、跨模态推理、Agentic 能力等核心挑战,持续推动模型能力与泛化上限。 2. 场景驱动的算法创新:紧密结合真实业务场景(如智能交互、内容生成、跨模态检索等),设计并优化多模态大模型架构与训练策略,在保证效果领先的同时,持续提升模型效率、稳定性与鲁棒性,推动技术在复杂场景中的规模化落地。 3. 前沿应用技术探索:跟踪并深度参与 LLM、多模态模型、Diffusion Models、强化学习等方向的前沿研究,快速完成技术验证与实验迭代,探索新建模范式与训练范式,持续刷新相关任务的 SOTA。" 【任职要求】 1. 硕士及以上学历,计算机、人工智能等相关专业,3年以上语音大模型/多模态/跨模态相关的算法经验。 2. 深入掌握深度学习、强化学习、表示学习等建模方法,在多模态建模和跨模态对齐等方面有深入研究。 3. 在国际顶级计算机会议/期刊(如NeurIPS、ICLR、ICML、CVPR、ECCV、InterSpeech、ACL等)以一作身份发表过多篇论文;或在开源社区、竞赛中展示出引领性的研究成果。 4. 良好的工程与实验思维:熟悉PyTorch/TensorFlow等主流框架,具备大规模语言/视觉模型调优经验,能高效实现定制化训练流程;重视代码质量与实验结果,追求“不仅work,而且高效优雅”。 5. 技术热情与好奇心:有志于将AI从实验室推向真实业务场景,构建“可解释、可控制、可落地”的行业智能系统,善于从复杂的行业需求中提炼出核心AI建模问题,并设计创新性的解决方案。 6. 善于跨团队协作:能与产品、基础研究团队高效沟通,平衡技术理想与落地实现。

最后确认在招:2026-09-01 19:09:38 · 来源平台:alibaba