直招.cv

← 返回职位列表

菜鸟 · 社会招聘

菜鸟-具身智能强化学习算法工程师-杭州

杭州 ·3年以上·本科

杭州

职位描述

1. 策略后训练:负责 VLA / 基础操作模型的后训练全流程,在预训练/模仿学习得到的基座策略之上,通过强化学习微调(RLFT)、离线 RL、DAgger、HIL-SERL 、RECAP 等手段持续提升真实仓储任务的成功率与鲁棒性。 2. 奖励与数据闭环:设计任务奖励函数与自动成功判定,搭建 Reward Model / 偏好数据标注流程,构建"部署→失败挖掘→补采/在线交互→后训练→自动评测→再部署"的策略迭代闭环。 3. 大规模训练:在仿真并行环境与真机上开展大规模 Rollout 与 RL 训练,负责采样、经验回放、分布式训练框架的搭建与吞吐优化。 4. 评测与安全:建立后训练前后的量化 Benchmark(成功率、恢复能力、碰撞率、泛化性),管控灾难性遗忘与安全约束,保障策略上真机的稳定性。 【任职要求】 1. 计算机/自动化/机器人相关专业,扎实的 Python 工程能力。 2. 系统掌握强化学习原理,熟悉各类 On/Off-Policy 等强化学习算法及其调参与稳定性问题。 3. 了解模仿学习与 VLA 训练范式,理解预训练与后训练的分工与衔接。 4. 熟悉至少一种仿真/训练平台(Isaac Lab/Isaac Gym/MuJoCo),具备真机或仿真 RL 落地经验。 加分项: 1. 有大模型/VLA 后训练经验(RLHF/RLAIF、偏好优化、奖励建模)。 2. 有 HIL-SERL、RECAP、Diffusion Policy、π 系列、GR00T、OpenVLA 等实践经验。 3. 有 Sim2Real 迁移或在线 RL 真机部署的完整案例。 4. 有分布式/GPU 并行训练基础设施经验。 5. 有仓储物流自动化背景,或 CoRL/RSS/ICRA/IROS 论文、优质开源项目。

最后确认在招:2026-09-01 19:07:41 · 来源平台:alibaba