安克创新 校园招聘
多模态大模型(VLM/VLA)算法工程师(博士)
深圳 ·经验不限·学历不限
深圳·北京·上海
薪资面议
前往 安克创新 官网投递
职位描述
岗位职责
1. 研究应用大模型实现四足、人形机器人的复杂认知能力,包括:
(1)开放指令任务理解及规划、复杂场景理解、行为决策推理与动作规划,长程任务规划等;
(2)实现机器人自主探索导航
(3)实现高效可泛化的四足、人形机器人的移动、操作联合决策和规划
2. 实现基于视觉、深度等的环境感知与3D空间表征,人脸人形识别、人体姿态估计等, 实现精准的空间推理 及action model 动作轨迹规划;
3. 开发适配大模型VLM/VLA的场景表征/对齐技术和场景语义识别。训练图像/视频与文本融合的多模态理解大模型,提升模型的跨模态理解能力;
4.设计构建模型训练数据集和标注方法,支持大批量自动化的标注构建
5.负责基模型的领域预训练,模型微调SFT、强化学习(RLHF)训练,提升夸任务的泛化性能,开发高效的模型评测方法提高迭代效率。
6.解决模型评测/部署/真机测试中的问题,满足项目交付指标要求。跟踪前沿技术方案,持续迭代升级方案
【任职要求】
岗位要求
1.人工智能、计算机、机器人、自动驾驶、自然语言处理等相关专业博士学位
2.有如下某个方向研究经验:
(1)熟练掌握主流LLM技术(Bert、GPT、Llama、transformer等),有VLM模型(Llava、QwenVL等)、VLA(action token)模型应用经验, 熟悉生成式AI 技术(diffusion)。
(2)有量产动静态环境感知或表征经验,熟悉 BEV、Sparse,SAM,VIT,CLIP,DINO
(3)具备多模态数据融合(文+视+听)研发经验;
(4)掌握主流的具身大模型技术(RT2, π系列、OpenVLA,ACT, Diffusion Policy)
(5)基于学习的机器人移动、操纵相关算法经验
3. 熟练掌握大模型领域训练、微调方法(LoRA/P-tuning等)、RL方法(PPO/DPO/GRPO、A3C等);
4. 掌握大模型的分布式训练框架
5. 熟练使用PyTorch/TensorFlow深度学习框架,熟练使用Python/C++语言编程,有实际项目开发经验
6. 有 ROS2/DDS下的开发经验,能够在Linux环境下独立进行开发和调试;
加分项
1.在CVPR/NeurIPS/ICML/CoRL发表具身智能/机器人学习相关论文
2.具备主流具身智能开源项目经验(如RT-1/RT-2、OpenVLA、π系列π0/π0.5等)
3.熟悉机器人抓取规划或人机协作场景落地
官网发布:2025-03-25 · 最后确认在招:2026-09-03 19:27:05 · 来源平台:feishu