百度 校园招聘
实习自动驾驶感知3D算法工程师(J71300)
北京 ·经验不限·学历不限
北京市
薪资面议
前往 百度 官网投递
职位描述
-负责基于 **VLM(Vision-Language Model)/多模态大模型的场景理解算法研发,面向复杂真实场景开展目标、属性、行为及场景语义等多层次理解能力建设
-负责 VLM 在场景理解任务中的模型方案调研、算法设计、训练优化与工程落地,包括但不限于视觉语言对齐、多模态理解等方向
-结合业务场景,探索 **VLM 与传统视觉感知模型融合,提升模型在复杂场景、长尾场景及开放世界场景下的泛化与推理能力
-负责多模态训练数据的自动化构建与数据闭环体系建设,包括数据挖掘、自动标注、数据清洗、难例发现、合成数据生成及数据质量评估等
-跟踪 VLM、多模态大模型及场景理解领域前沿技术,推动相关算法在实际业务中的验证、优化与落地。
【任职要求】
-计算机、电子信息、应用数学、自动化、人工智能等相关专业硕士及以上学历
-具备扎实的机器学习、深度学习基础,以及良好的数学基础、算法分析和问题解决能力
-熟练掌握 Python,具备 C++ 开发能力,熟悉 Linux 开发环境,具有良好的代码习惯和工程实现能力
-熟悉主流视觉及多模态模型架构,对 **Transformer、ViT、LLM、VLM 等模型的基本原理和训练方法有较深入理解
-熟悉至少一个或多个多模态相关方向,包括但不限于视觉语言对齐、多模态预训练、场景推理、视频理解**等
-具备 VLM/LLM 模型训练、微调或后训练经验者优先,包括但不限于 SFT、Preference Optimization、RL、多模态指令微调等
-具备视觉感知、3D 场景理解相关经验者优先
-具备大规模数据构建、自动标注、合成数据、数据飞轮或模型迭代闭环相关经验者优先
-在计算机视觉、多模态或机器人领域顶级会议/期刊,如 CVPR、ICCV、ECCV、NeurIPS、ICLR、ICRA、IROS、TPAMI 等发表论文者优先
-具有良好的沟通表达能力、团队协作意识和较强的工程落地能力
官网发布:2024-03-12 · 最后确认在招:2026-09-03 19:11:28 · 来源平台:baidu