钉钉 · 社会招聘
千问办公-视觉Agent 算法专家-杭州
杭州 ·2年以上·本科
杭州
薪资面议
前往 钉钉 官网投递
职位描述
负责面向真实业务场景的视频分析 Agent 算法研发,围绕实时视频理解与离线长视频复杂任务分析两大方向,构建具备感知、记忆、规划、推理与工具调用能力的多模态智能系统。
岗位职责
1、负责实时视频分析 Agent研发,融合 CV、VLM、Omni/多模态大模型等能力,服务于工业质检、巡检、SOP 合规、Streaming Video 交互等场景;
2、设计并优化面向视频流场景的长短期记忆机制、事件检测、异常告警与状态跟踪能力,提升实时性、稳定性与准确率;
3、负责通用/专用视觉模型在垂直场景中的微调、适配与性能优化,包括检测、识别、时序理解、多模态问答等任务;
4、负责离线长视频分析 Agent能力建设,提升模型在复杂任务中的自主拆解、规划、多步推理、细粒度分析与结果归因能力;
5、基于 SFT、RL/RLHF、DPO、Agentic RL 等后训练方法,提升大模型在Planning、Reasoning、Function Calling、RAG、数据洞察等方面的能力;
6、构建视频分析 Agent 的工具使用体系,支持如 crop_video、zoom-in、片段重采样、目标聚焦、证据回溯等能力,形成“观察—推理—行动—验证”闭环;
7、设计高质量训练数据与评测体系,持续提升长视频复杂任务上的准确率、鲁棒性、可解释性与泛化能力;
8、与产品、工程、业务团队协作,推动算法方案在真实场景中的落地与迭代。
【任职要求】
计算机、人工智能、模式识别、自动化等相关专业,本科及以上,具备扎实的机器学习/深度学习基础。
熟悉计算机视觉与视频理解核心方向,具备检测、分割、跟踪、动作识别、时序建模、事件分析等相关经验。
熟悉 VLM/MLLM/Omni 多模态模型原理及应用,有视频理解、多模态问答、视频 Agent 或具身/交互式智能体经验者优先。
熟悉大模型后训练方法,包括 SFT、DPO、RL/RLHF 等,对 Agent 能力对齐、任务分解、规划推理有实战经验。
具备 Agent/tool use/function calling/RAG 相关经验,能够设计基于工具增强的多轮推理流程。
熟悉长短期记忆、上下文管理、时序信息压缩与检索机制,有长视频理解或流式视频分析经验者优先。
熟练使用 PyTorch,具备模型训练、微调、部署与性能优化能力;有低延迟推理、流式系统优化经验者优先。
具备较强的问题抽象与系统设计能力,能够从业务场景出发定义任务、构建数据、设计评测并推动落地。
优先条件
有工业质检、巡检、安防、SOP 合规、视频交互等真实场景落地经验。
有长视频复杂任务分析、视频 CoT/规划推理、视频 Agent、Agentic RL 相关经验。
有多模态大模型微调、蒸馏、对齐、推理加速或线上部署经验。
在 CV、MM、NLP、Agent、RL 等方向有高水平论文、开源项目或竞赛成果。
加分项关键词
视频理解、Streaming Video、VLM、MLLM、Omni、Agent、Planning、Reasoning、Memory、Tool Use、Function Calling、RAG、SFT、DPO、RLHF、Agentic RL、工业质检、巡检、SOP
最后确认在招:2026-09-01 19:09:46 · 来源平台:alibaba