小鹏汽车 社会招聘
Omni模型算法工程师/研究员
北京 ·经验不限·学历不限
北京·深圳
薪资面议
前往 小鹏汽车 官网投递
职位描述
职位愿景:
加入我们,你将参与打造机器人新一代的“交互大脑”。我们致力于通过 Omni 多模态大模型突破传统交互边界,实现文本、语音、视觉、视频与物理动作的统一建模,让机器人在复杂物理世界中具备实时、自然、可靠且可持续迭代的交互与决策能力。
核心职责:
根据个人专长,重点负责以下一个或多个方向:
1、参与 Omni 多模态大模型的技术路线规划与核心架构设计,推进文本、语音、视觉、视频和动作等模态的统一表征、理解、推理与生成;
2、攻关可泛化、具备规模扩展能力的模型架构与训练方法,重点解决跨模态对齐、时序建模、长上下文理解、实时流式交互及端到端 Audio-to-Audio、Speech-to-Action 等关键问题;
3、建设多模态数据体系和大规模训练流程,制定数据质量与配比方案,推进预训练、后训练、指令微调、偏好对齐或强化学习,并持续优化训练效率与稳定性;
4、研发面向真实物理世界的具身智能体与任务规划系统,将非结构化指令转化为可执行动作序列,提升长链路推理、记忆、决策安全性及复杂场景鲁棒性;
5、建立模型能力、任务成功率、交互自然度、安全性、响应时延和资源消耗等评测指标,推动数据、训练、评测与真实场景反馈形成迭代闭环;
6、推动模型与机器人感知、认知、决策和控制系统集成,开展量化、蒸馏、剪枝、算子优化及端云协同,保障模型在端侧和异构计算平台上的高效部署;
7、承担关键技术攻坚与跨团队项目推进,通过算法创新、系统落地以及论文、专利或开源成果建设技术影响力,并参与团队技术分享与人才培养。
【任职要求】
1、计算机、人工智能、自动化、电子信息、数学等相关专业,硕士及以上学历;具备突出研究成果或丰富工程经验者可放宽学历要求;
2、具备 5 年及以上多模态大模型、语音大模型、视觉语言模型或具身智能相关研发经验,主导或深度负责过模型研发、训练或部署落地中的关键环节;具备突出研究成果或同等能力者可适当放宽年限要求;
3、深入理解 Transformer、LLM、VLM、语音大模型及多模态生成模型原理,对模型规模扩展规律、数据工程、后训练方法和效果评估有系统认知;
4、在跨模态对齐、流式音视频建模、端到端语音交互、大规模训练与后训练、智能体规划或推理优化中的至少一个方向具备深入积累和可验证成果;
5、熟练掌握 Python、PyTorch,熟悉 C++ 及主流分布式训练框架,具备性能分析和复杂工程问题定位能力;
6、算法工程师方向重点考察大规模训练、系统工程、性能优化及真实场景落地能力;研究员方向重点考察原创算法、研究深度以及论文、专利或开源成果;
7、具备较强的技术前瞻性、架构设计能力和结果意识,能够独立定义复杂问题、推动跨团队协作并对关键项目交付负责。
加分项
- 具备大规模多模态模型分布式训练、数据治理、训练稳定性优化或完整后训练经验;
- 熟悉实时音视频、低时延流式交互、机器人智能体或真实物理世界多模态应用;
- 具备端侧部署、模型压缩、异构计算优化经验,或有代表性的论文、开源项目及专利成果。
官网发布:2026-07-21 · 最后确认在招:2026-09-03 19:36:58 · 来源平台:feishu