直招.cv

← 返回职位列表

极米科技 社会招聘

算法工程师(音频方向)

深圳 ·3-5年·本科

深圳

职位描述

岗位职责: 1、核心语音算法与模型应用 负责公司AI产品中ASR(语音识别)、TTS(语音合成)等核心功能的开发、推理加速与落地集成; 设计并实现完整的语音处理Pipeline,包括但不限于 VAD(语音端点检测)、Speaker Diarization(说话人分离)、语音切片、降噪与音频过滤等; 跟进并评估前沿ASR模型(如Whisper, FunASR等),针对特定业务场景进行调优。 2、设备端协同与全链路优化 负责与硬件/设备端团队协同,进行端到端的音频链路联调与优化,解决实际场景下的端云交互延迟、音频丢包等问题; 参与设备端音频采集质量的评估,配合设备端进行复杂声学环境下的问题排查(如回声、环境噪声),优化流式/非流式语音识别体验; 制定端云接口的音频传输协议与标准,确保设备端音频数据与云端算法的无缝对接。 3、大模型(LLM)应用与Agent赋能 基于生成的Transcript(语音转文字结果),结合LLM设计并实现高阶NLP功能,如:对话纪要生成、语音情绪识别、意图理解等; 协助Agent团队,利用Prompt Engineering、RAG(检索增强生成)等技术,优化模型输出质量并搭建专属知识库; 参与 AI Agent/Workflow 的设计与编排,打通“听、懂、答”的全链路AI闭环。 4、系统工程化与敏捷开发 参与项目需求分析与系统架构设计,编写相关API接口,协调前后端及硬件团队完成高效对接; 负责相关功能的自动化测试方案设计,保障AI模型及业务流程的稳定性,撰写并维护高质量的技术文档。 任职要求: 1、教育 与经验背景计算机、人工智能、电子通信或相关专业本科及以上学历,具备1年以上语音/AI方向开发经验。 2、语音算法与音频技术 熟悉ASR底层原理及常用架构,有丰富的ASR模型(如Whisper、FunASR、Kaldi、wav2vec等)应用或微调经验; 深入理解或熟悉 VAD、Speaker Diarization 技术,具备实际商业项目落地经验者优先; 【加分项】了解音频信号处理基础(如AEC回声消除、AGC自动增益、ANS降噪等),有智能硬件/IoT/移动端设备协同开发与调试经验者优先。 3、AI工程与大模型能力 熟练掌握 Python,熟悉HuggingFace等开源生态,了解主流模型部署框架(如ONNX, TensorRT等); 深入理解 LLM、RAG、Prompt Engineering 原理,有实际落地经验; 熟悉 AI Agent/Workflow Orchestration 框架(如LangChain, LangGraph, Eino, LlamaIndex, Spring-ai 等)。 4、工程化开发素质 具备扎实的软件工程基础,熟悉自动化测试工具与AI产品的测试评估流程; 具备良好的跨部门沟通能力与团队协作精神,能够独立推动端到端问题的排查与解决。

官网发布:2026-07-27 · 最后确认在招:2026-09-03 21:44:36 · 来源平台:moka