极米科技 社会招聘
算法工程师(音频方向)
深圳 ·3-5年·本科
深圳
薪资面议
前往 极米科技 官网投递
职位描述
岗位职责:
1、核心语音算法与模型应用
负责公司AI产品中ASR(语音识别)、TTS(语音合成)等核心功能的开发、推理加速与落地集成;
设计并实现完整的语音处理Pipeline,包括但不限于 VAD(语音端点检测)、Speaker Diarization(说话人分离)、语音切片、降噪与音频过滤等;
跟进并评估前沿ASR模型(如Whisper, FunASR等),针对特定业务场景进行调优。
2、设备端协同与全链路优化
负责与硬件/设备端团队协同,进行端到端的音频链路联调与优化,解决实际场景下的端云交互延迟、音频丢包等问题;
参与设备端音频采集质量的评估,配合设备端进行复杂声学环境下的问题排查(如回声、环境噪声),优化流式/非流式语音识别体验;
制定端云接口的音频传输协议与标准,确保设备端音频数据与云端算法的无缝对接。
3、大模型(LLM)应用与Agent赋能
基于生成的Transcript(语音转文字结果),结合LLM设计并实现高阶NLP功能,如:对话纪要生成、语音情绪识别、意图理解等;
协助Agent团队,利用Prompt Engineering、RAG(检索增强生成)等技术,优化模型输出质量并搭建专属知识库;
参与 AI Agent/Workflow 的设计与编排,打通“听、懂、答”的全链路AI闭环。
4、系统工程化与敏捷开发
参与项目需求分析与系统架构设计,编写相关API接口,协调前后端及硬件团队完成高效对接;
负责相关功能的自动化测试方案设计,保障AI模型及业务流程的稳定性,撰写并维护高质量的技术文档。
任职要求:
1、教育
与经验背景计算机、人工智能、电子通信或相关专业本科及以上学历,具备1年以上语音/AI方向开发经验。
2、语音算法与音频技术
熟悉ASR底层原理及常用架构,有丰富的ASR模型(如Whisper、FunASR、Kaldi、wav2vec等)应用或微调经验;
深入理解或熟悉 VAD、Speaker Diarization 技术,具备实际商业项目落地经验者优先;
【加分项】了解音频信号处理基础(如AEC回声消除、AGC自动增益、ANS降噪等),有智能硬件/IoT/移动端设备协同开发与调试经验者优先。
3、AI工程与大模型能力
熟练掌握 Python,熟悉HuggingFace等开源生态,了解主流模型部署框架(如ONNX, TensorRT等);
深入理解 LLM、RAG、Prompt Engineering 原理,有实际落地经验;
熟悉 AI Agent/Workflow Orchestration 框架(如LangChain, LangGraph, Eino, LlamaIndex, Spring-ai 等)。
4、工程化开发素质
具备扎实的软件工程基础,熟悉自动化测试工具与AI产品的测试评估流程;
具备良好的跨部门沟通能力与团队协作精神,能够独立推动端到端问题的排查与解决。
官网发布:2026-07-27 · 最后确认在招:2026-09-03 21:44:36 · 来源平台:moka