蔚来 校园招聘
校招-端到端智能辅助驾驶大模型-后训练方向
上海 ·经验不限·学历不限
上海·北京
薪资面议
前往 蔚来 官网投递
职位描述
1、负责强化学习算法的研究与开发,包括但不限于PPO、DPO、GRPO、DAPO等算法;
2、构建仿真环境,设计奖励机制,训练并调优智能体策略;
3、与产品和工程团队紧密合作,将RL算法落地到实际业务场景;
4、跟踪学术界和工业界最新RL研究进展,持续优化模型性能与训练效率;
5、撰写技术文档,参与代码评审,推动团队技术能力提升。
【任职要求】
1、计算机、人工智能、自动化、数学等相关专业硕士及以上学历;
2、扎实的强化学习理论基础,熟悉MDP、Bellman方程、策略梯度、值函数逼近等核心概念;
3、熟练掌握Python,熟悉PyTorch/TensorFlow等深度学习框架,具备独立实现RL算法的能力;
4、有强化学习项目经验(如游戏AI、推荐系统、机器人控制、仿真环境训练等)者优先;
5、具备良好的问题分析能力、团队协作能力和技术沟通能力。
官网发布:2026-08-12 · 最后确认在招:2026-09-03 19:28:25 · 来源平台:feishu