安克创新 校园招聘
具身智能-强化学习(灵巧操作方向) 实习生
深圳 ·经验不限·学历不限
深圳
薪资面议
前往 安克创新 官网投递
职位描述
安克实习生项目是面向正式校招岗位的人才培养与选拔通道。实习期间将按照校招标准进行系统的培养与综合评估,表现优秀者可直接获得校招转正机会,提前锁定正式校招席位。我们以严肃、长期的视角对待每一位实习生,也期待与你共同成长。
【你将参与】
1.参与具身操作模型(VA/VLA/WAM)的监督微调(SFT)和强化学习(RL),包括数据格式设计、训练配置、效果评估与 benchmark 分析
2.负责在真实机器人平台上设计并实施 RL 训练方案,通过真机数据迭代提升具身操作模型在复杂、非结构化环境下的泛化能力与鲁棒性
3.参与设计与训练通用奖励模型,通过奖励模型引导,实现长程任务(Long-horizon tasks)下的高效真机强化学习
4.跟踪前沿具身智能方向论文,探索基础模型与 RL 结合的最新技术,推动其在真机任务中的表现超越传统模仿学习方法
【任职要求】
1.硕士及以上学历在读,计算机、人工智能、机器人、自动化等相关专业,2026 年及以后毕业优先
2.深刻理解强化学习核心算法(PPO, SAC 等),同时熟悉具身操作大模型(VA/VLA/WAM)的训练逻辑
3.具备扎实的机器人运动学、动力学基础,能够处理真机实验中的延迟、噪声及硬件非线性特性
4.精通 Python 与 PyTorch,熟悉主流 RL 框架,具备良好的分布式训练与真机部署工程经验
5.了解以下至少一个方向的核心技术:
Offline-to-online 真机RL算法
去噪模型(Flow matching/Diffusion)RL算法
VLA / 多模态大模型
机器人学习或具身智能基础方法
6.具备较强的论文阅读与复现能力,能够快速理解并验证新方法
7.具备良好的数据组织与问题分析能力,能够处理大规模数据集与复杂 pipeline
加分项
Offline-to-online RL 算法经验、去噪模型(Flow matching/Diffusion)RL算法经验
在具身智能、多模态学习、机器人数据集等方向有科研或开源项目经历
学术成果:在机器人、RL 或计算机视觉顶会(CoRL, ICRA, IROS, RSS, NeurIPS)、顶刊发表过关于“真机 RL”或“具身大模型”的高质量论文
前沿生产力工具:熟练使用 Claude Code, Codex, Cursor 等工具进行高效代码开发与系统构建
官网发布:2026-06-02 · 最后确认在招:2026-09-03 19:27:05 · 来源平台:feishu