小鹏汽车 社会招聘
大模型算法研究员
深圳 ·经验不限·学历不限
深圳·北京·上海
薪资面议
前往 小鹏汽车 官网投递
职位描述
我们正在探索面向真实世界任务的大模型与智能体技术,重点关注大模型后训练、Agent 能力构建,以及大模型与具身智能的结合。你将参与大模型算法的研究、训练与评测工作,探索如何通过高质量数据、监督微调、强化学习和交互式训练等方法,提升模型在推理、工具使用、长程任务与复杂环境中的能力,并推动相关技术在机器人及具身智能场景中的落地。
主要工作包括:
1、负责大模型后训练相关算法的研究与开发,包括但不限于监督微调、强化学习、在线蒸馏及持续学习等方向。
2、负责训练数据的构建、清洗、筛选与分析,探索数据组成、数据质量及训练策略对模型能力的影响。
3、探索大模型 Agent 相关技术,包括工具调用、任务规划、环境交互、记忆、反思与长程任务执行等能力。
4、探索大模型与具身智能的结合,研究大模型在机器人任务理解、高层决策、环境交互和复杂任务执行中的应用。
5、设计并搭建模型训练与评测流程,分析模型行为、训练稳定性和能力边界,持续推动模型效果迭代。
6、跟进大模型、Agent、强化学习和具身智能领域的前沿研究,形成可验证的技术方案,并推动研究成果落地。
7、与算法、工程、机器人及产品团队协作,完成从算法研究、实验验证到系统部署的完整闭环。
【任职要求】
1、计算机科学、人工智能、自动化或相关专业硕士及以上学历,优秀本科毕业生亦可考虑。
2、具备扎实的机器学习和深度学习基础,理解 Transformer、大语言模型训练及自回归生成的基本原理。
3、熟悉大模型后训练中的一种或多种方法,包括监督微调、偏好学习、强化学习、知识蒸馏或模型融合等。
4、具备良好的编程能力,熟练使用 Python,熟悉 PyTorch 等深度学习框架,能够独立完成算法实现、实验设计与问题排查。
5、具备大规模数据处理经验,能够完成训练数据的清洗、转换、采样、质量分析与数据管线开发。
6、具备大模型训练或微调经验,了解分布式训练、显存优化、推理部署及常见训练框架和工具。
7、具备较强的实验分析能力,能够根据训练曲线、评测结果和模型输出定位问题,并提出合理的改进方案。
8、对大模型 Agent、强化学习或具身智能方向有浓厚兴趣,愿意探索尚未形成标准答案的研究问题。
9、具备良好的沟通和协作能力,能够清晰表达研究思路、实验结论与技术判断。
【加分项】
1、在大语言模型后训练、强化学习、Agent、具身智能或机器人学习方向有实际研究或项目经验。
2、熟悉 SFT、DPO、PPO、GRPO、RLHF、RLAIF、RLVR 等训练方法,并有完整训练或调优经验。
3、具备 Agent 系统或交互环境开发经验,例如工具调用、多轮决策、长期记忆、任务规划、环境反馈或多智能体系统。
4、具备机器人、具身智能、仿真环境或视觉语言模型相关经验,熟悉机器人任务规划、环境建模或多模态交互。
5、具备高质量训练数据建设经验,包括数据生成、数据清洗、难度分层、拒绝采样、质量评估或数据配比优化。
6、在 NeurIPS、ICML、ICLR、ACL、EMNLP、AAAI、CVPR、CoRL、ICRA、IROS 等相关会议或期刊发表过论文。
7、在相关竞赛、开源项目或模型研发项目中取得突出成果,或对开源社区有持续贡献。
8、具备较强的研究敏感度,能够快速理解前沿工作、识别关键问题,并将研究思路转化为可执行的实验方案。
官网发布:2026-07-23 · 最后确认在招:2026-09-03 19:36:58 · 来源平台:feishu