直招.cv

← 返回职位列表

蔚来 校园招聘

校招-端到端智能辅助驾驶大模型-后训练方向

上海 ·经验不限·学历不限

上海·北京

职位描述

1、负责强化学习算法的研究与开发,包括但不限于PPO、DPO、GRPO、DAPO等算法; 2、构建仿真环境,设计奖励机制,训练并调优智能体策略; 3、与产品和工程团队紧密合作,将RL算法落地到实际业务场景; 4、跟踪学术界和工业界最新RL研究进展,持续优化模型性能与训练效率; 5、撰写技术文档,参与代码评审,推动团队技术能力提升。 【任职要求】 1、计算机、人工智能、自动化、数学等相关专业硕士及以上学历; 2、扎实的强化学习理论基础,熟悉MDP、Bellman方程、策略梯度、值函数逼近等核心概念; 3、熟练掌握Python,熟悉PyTorch/TensorFlow等深度学习框架,具备独立实现RL算法的能力; 4、有强化学习项目经验(如游戏AI、推荐系统、机器人控制、仿真环境训练等)者优先; 5、具备良好的问题分析能力、团队协作能力和技术沟通能力。

官网发布:2026-08-12 · 最后确认在招:2026-09-03 19:28:25 · 来源平台:feishu