直招.cv

← 返回职位列表

阿里巴巴控股集团 · 社会招聘

晓天衡宇-大模型评测工程师-AI应用

杭州 ·2年以上·本科

北京·杭州

职位描述

1、场景化评测执行: 负责大模型/Agent在真实生产力应用场景下的实际效果评测。具备真实用户行为分析能力和评测转化能力,熟悉 Rubrics 评测方法与质量判断,具备评测结果分析能力,熟悉大模型/Agent问题归纳逻辑,包括但不限于逻辑推理、工具调用、内容生成等。 2、竞品分析与对比: 关注市面上优秀的C端/B端AI产品,定期进行竞品对比评测。从用户体验和产品功能角度出发,输出对比报告,帮助团队发现自身产品的差距与优化方向。 数据生产与标准落地: 根据评测需求,执行高质量评测体系的搭建工作。将场景需求转化为清晰、可操作的Rubrics评分标准与标注规则,跟进评测数据构建流程,确保交付数据的准确性和一致性。 3、外部团队组织与质量把控:组织并管理外部评测/标注团队及各领域专家人力,统筹作业排期与分工,对产出的数据集和评测结果进行质量把控,针对执行过程中发现的流程卡点,积极推动优化,保障项目高效交付。 4、Bad Case闭环: 对评测中发现的Bad Case进行归类整理,与产品和算法团队协作推动问题修复,并验证修复效果,确保模型体验持续提升。 【任职要求】 本科及以上学历,至少1-3年AI领域相关经验,具备以下背景优先: (1)有Agent真实生产力应用场景经验: 曾参与过智能助手、办公自动化等方向的评测、测试或交付工作,了解大模型在复杂任务中的常见问题。 (2)有C端/B端AI产品助理/产品经理经验:独立完成过竞品分析或用户体验调研,能将产品问题转化为可描述的评测案例 (3)熟练掌握Rubrics方法论:具备将模糊的主观评价转化为**多维度、量化、可操作评分标准(Rubrics)**的能力;能结构化梳理评测方案、Rubrics细则、分析报告等内容,确保信息传递清晰准确; (4)AI工具与文档能力:具备“Vibe coding”能力,能灵活使用各类AI工具/大模型辅助完成日常评测、数据处理和评测报告撰写; (5)人员与项目管理能力:具备优秀的外部人员管理与组织能力,能协助对接专家、作业人力等外部资源,有效传达Rubrics及SOP要求,及时处理执行偏差,为最终项目交付负责; (6)沟通与协作:良好的沟通能力和协作意识,能清晰表达问题并与技术/产品同学高效配合。

最后确认在招:2026-09-01 19:10:48 · 来源平台:alibaba