直招.cv

← 返回职位列表

阿里云智能 · 社会招聘

ATH事业群-AI Agent全栈工程师-视频智能评测-广州

杭州 ·3年以上·本科

北京·杭州·广州

职位描述

岗位定位 你将作为AI视频生产产品智能评测体系的核心建造者。我们既评测视频生成、图片生成等多模态模型的能力边界,也评测产品在真实业务场景下的端到端产出质量——从模型选型到生产链路放行,每一环都需要可量化、可解释、可复现的评判依据。你要建造的智能评测体系,能自主理解评测目标、调度多模态模型诊断、给出可解释判分、驱动生产链路的重试与放行;同时与生成大模型形成双向飞轮——评测产出反哺大模型微调与偏好对齐,大模型跃迁驱动视频生成产品及评测能力演进。 核心职责 1. 评测Agent架构设计 ● 主导设计"视频评测Agent"的能力边界、工具集与决策协议,使其具备任务规划、模型选型、自动重试、异常归因、人工介入点设计等自主能力。 ● 与视频生产链路上下游的Agent打通,将评测Agent作为生产链路中的智能质检与自纠错节点,形成"生成→质检→修复→放行"的闭环。 ● 设计评测Agent的可观测体系,让每一次决策都可追溯、可复盘、可改进。 2. 跨模型Benchmark体系建设 ● 构建覆盖视频生成、图片生成等多模态生成模型的Benchmark评测基准,定义能力地图与质量基线。 ● 建立模型选型、版本对比、回归验证的数据化决策链路,让模型选型从经验驱动走向证据驱动。 ● 攻关"跨模型可比性"工程难题:评测样本设计、风格归一化、置信区间标注、人工抽样补评机制。 3. 评测Prompt工程与VLM调优 ● 系统性构建面向视频评测各环节的Prompt工程体系:分层结构化、多模态对齐、领域知识注入、置信度自评等精细化设计。 ● 建立Prompt版本管理、A/B评测、自动优化机制,让VLM评分在跨模型对比语境下持续逼近人工裁判的一致性。 ● 探索结合人类反馈与Benchmark交叉验证的评测Prompt偏好对齐,让智能评测"打分像一个有审美的人"。 4. 评测与生成大模型的协同进化 ● 设计评测产物的结构化沉淀方案,把每一次评测都转化为可检索、可复用、可再加工的数据资产,作为视频生成大模型微调(SFT/DPO)与偏好对齐的高质量信号源。 ● 与算法侧协同建立"评测→反哺→生成→再评测"的双向闭环:评测识别出的Bad Case与Hard Case定向输入生成模型的迭代训练,生成模型每一次能力跃迁又驱动评测维度的扩展、Benchmark的扩容与评分基线的重标定。 ● 建设case库管理与质量回归机制,保障评测体系自身能跟上生成模型的迭代节奏。 5. 评测全栈工程能力 ● 端到端打通"任务提交→视频处理(抽帧/转码/格式适配)→多模态推理→评分聚合→报告生成→数据可视化"的自动化流水线。 ● 独立完成评测控制台、Benchmark对比看板、case库管理等前端功能,保障评测系统具备可用性与可维护性。 ● 保障长链路评测任务的稳定性:断点续传、局部重试、并发调度、容错降级等核心工程难题。 【任职要求】 基础条件 ● 计算机、人工智能等相关专业本科及以上学历。 ● 3年以上后端研发经验,精通Java(Spring Boot / MyBatis-Plus)或Go其中之一,工程基础扎实、代码规范意识好。 ● 具备独立完成React/TypeScript前端功能开发的能力。 核心技术能力 ● 有LLM应用、Agent系统或AIGC产品的实际开发经验,理解RAG、Function Calling、Tool Use、ReAct等核心范式,能独立设计并落地Agent。 ● 熟悉主流多模态模型(Qwen-VL、Gemini、GPT-4V等)的能力特性、接入方式与不确定性边界,能从模型能力出发设计评测方案。 ● 良好的Prompt Engineering实践经验,熟悉CoT、Few-shot、Self-Consistency等策略,能用数据而非直觉驱动Prompt迭代。 ● 有视频相关开发经验(转码、抽帧、流媒体、视频生成或编辑工具),熟悉FFmpeg工具链。 加分项 ● 有AIGC视频领域完整研发经验,了解主流视频生成模型的能力与差异;对视频美学、镜头语言、剪辑节奏有理解,能将创作领域知识转化为评测维度设计。 ● 有Multi-Agent系统设计或落地经验,熟悉主流Agent/Skill编排与分发协议(MCP、LangChain、CrewAI等)。 ● 了解视频客观质量评估标准(VMAF、SSIM、CLIP-Score等),有Benchmark/评测/质量保障系统设计经验。 ● 有模型微调(SFT、RLHF、DPO)实践经验,理解评测产物如何转化为偏好数据。 ● 有跨模型路由、A/B评测平台、数据闭环系统的设计经验。 我们期待的你 1. Benchmark思维者:拒绝单条拍脑袋打分,习惯用对比、基线、置信区间说话。 2. Agent建造者:把评测看作有自主能力的智能体,而不是一组静态规则。 3. 数据驱动信徒:每一次评测都不浪费,永远在想"这份数据下一次喂给谁"。 4. 极客全栈工程师:后端有章法,前端有美感,对工具系统的可用性有匠人般的偏执。 5. 跨界沟通者:能与算法、产品、视频创作者高效协作,共同定义"AI视频该是什么质量"。

最后确认在招:2026-09-01 19:10:00 · 来源平台:alibaba