直招.cv

← 返回职位列表

Token Foundry · 校园招聘

算法工程师-全模态基础大模型

杭州 ·经验不限·学历不限

北京·杭州·上海

职位描述

1. 负责音频/音视频Agentic能力,包括原生音视频Agentic/Long-horizen, 全模态Agentic/Coding不降智等。 2. 负责音视频理解基础能力:包括Caption, Grouding, 音视频Alignment, General QA,长视频,多音视频理解等。 3. 负责音频/语音理解基础能力: 包括ASR, MultiSpkASR, 语音/音频Grouding/Counting/QA,音乐理解,长音频,多音频理解等。 4. 负责全模态包括音频/音视频Postrain/RL/OPD。 5. 负责音视频通话与交互:包括全音视频双工,音频query不降智/体感优化等。 6. 负责语音生成基础能力: 包括音色克隆,可控性,长语音生成稳定性等。 7. 全模态模型自主优化与Self-evolving。 【任职要求】 1. 硕士及以上学历,计算机科学、人工智能、语音信号处理、自然语言处理或相关专业。 2. 具备扎实的计算机与机器学习理论基础,熟练掌握至少一种编程语言(如 Python/C++),工程实现能力强。 3. 熟悉视频理解,音频理解,Agentic,实时交互等核心技术,具备以下一项或多项经验: - 音频/音视频/视频的建模经验; - Agent算法经验 (不限于多模态); - 大语言模型(LLM)相关研发,包括预训练、SFT、强化学习; - 实时交互模型开发,包括打断/判停/主动交互/GPT-Live。 4. 对前沿技术有强烈探索欲,具备优秀的自驱力、独立思考能力和团队协作精神。

最后确认在招:2026-09-01 19:06:52 · 来源平台:alibaba