阿里巴巴控股集团 · 社会招聘
晓天衡宇-大模型评测工程师-AI应用
杭州 ·2年以上·本科
北京·杭州
薪资面议
前往 阿里巴巴控股集团 官网投递
职位描述
1、场景化评测执行: 负责大模型/Agent在真实生产力应用场景下的实际效果评测。具备真实用户行为分析能力和评测转化能力,熟悉 Rubrics 评测方法与质量判断,具备评测结果分析能力,熟悉大模型/Agent问题归纳逻辑,包括但不限于逻辑推理、工具调用、内容生成等。
2、竞品分析与对比: 关注市面上优秀的C端/B端AI产品,定期进行竞品对比评测。从用户体验和产品功能角度出发,输出对比报告,帮助团队发现自身产品的差距与优化方向。
数据生产与标准落地: 根据评测需求,执行高质量评测体系的搭建工作。将场景需求转化为清晰、可操作的Rubrics评分标准与标注规则,跟进评测数据构建流程,确保交付数据的准确性和一致性。
3、外部团队组织与质量把控:组织并管理外部评测/标注团队及各领域专家人力,统筹作业排期与分工,对产出的数据集和评测结果进行质量把控,针对执行过程中发现的流程卡点,积极推动优化,保障项目高效交付。
4、Bad Case闭环: 对评测中发现的Bad Case进行归类整理,与产品和算法团队协作推动问题修复,并验证修复效果,确保模型体验持续提升。
【任职要求】
本科及以上学历,至少1-3年AI领域相关经验,具备以下背景优先:
(1)有Agent真实生产力应用场景经验: 曾参与过智能助手、办公自动化等方向的评测、测试或交付工作,了解大模型在复杂任务中的常见问题。
(2)有C端/B端AI产品助理/产品经理经验:独立完成过竞品分析或用户体验调研,能将产品问题转化为可描述的评测案例
(3)熟练掌握Rubrics方法论:具备将模糊的主观评价转化为**多维度、量化、可操作评分标准(Rubrics)**的能力;能结构化梳理评测方案、Rubrics细则、分析报告等内容,确保信息传递清晰准确;
(4)AI工具与文档能力:具备“Vibe coding”能力,能灵活使用各类AI工具/大模型辅助完成日常评测、数据处理和评测报告撰写;
(5)人员与项目管理能力:具备优秀的外部人员管理与组织能力,能协助对接专家、作业人力等外部资源,有效传达Rubrics及SOP要求,及时处理执行偏差,为最终项目交付负责;
(6)沟通与协作:良好的沟通能力和协作意识,能清晰表达问题并与技术/产品同学高效配合。
最后确认在招:2026-09-01 19:10:48 · 来源平台:alibaba