小米 社会招聘
自动驾驶基座模型(强化学习方向)
北京 ·经验不限·学历不限
北京
薪资面议
前往 小米 官网投递
职位描述
负责强化学习的框架在自动驾驶场景中的前沿算法研究,;
负责强化学习的框架在自动驾驶场景中的前沿算法研究,;
参与大模型基座范式下(VLA+World Model)的强化学习框架搭建;
负责将大模型(AD Agent)作为基础代理,利用 RL 技术优化其在复杂自动驾驶场景中的感知、推理和长期决策能力,涵盖场景理解、语义引导决策、时空建模等核心能力,并推动大模型与安全(Safety-Critical RL)及人类偏好(RLHF/DPO/PPO for AD)的深度对齐。
【任职要求】
教育背景:计算机科学、人工智能、机器人学、自动驾驶或相关领域的博士学位,或具备等效的研究经验;
精通深度强化学习理论及其核心算法(如PPO, TD3, GRPO等系列)
理论与实践能力:扎实的机器学习、深度学习理论基础,具有视觉理解、自然语言处理与行为决策的交叉领域研究背景;
编程能力:熟练掌握Python及主流深度学习框架(如PyTorch、TensorFlow等),有高效模型训练与大规模数据处理经验;
学术能力:具有在国际顶级会议(NeurIPS、ICLR、CVPR、ICCV等)上发表过论文的经验,或参与过具有影响力的学术竞赛(如COCO、Kitti、nuScenes等);
跨学科能力:具备跨学科协作能力,能够有效将计算机视觉、自然语言处理与机器人学的知识融合,推动自动驾驶机器人领域的创新;
加分项:
熟悉自动驾驶系统(感知-预测-规划)架构,理解 World Model 如何支持基于 RL 的规划算法(如 MCTS)
具有自动驾驶平台(如CARLA、Waymo、nuScenes等)上的实验经验。
官网发布:2026-03-25 · 最后确认在招:2026-09-03 23:18:29 · 来源平台:xiaomi