直招.cv

← 返回职位列表

蚂蚁集团 · 社会招聘

蚂蚁集团-AI评测专家-杭州/重庆

杭州 ·3年以上·本科

杭州·重庆

职位描述

1. 评测体系构建: 设计并开发全面、客观、可量化的AI模型评测方案,涵盖能力、性能、安全、伦理等多个维度。 2. 基准测试与执行: ○ 熟练运用和改造现有的主流评测基准(如 MMLU, GSM8K, HumanEval, BIG-Bench, MT-Bench, HELM 等)。 ○ 针对具体业务场景,设计并构建定制化的评测数据集(包括指令编写、数据清洗、质量评估)。 ○ 执行自动化与人工评测,确保评测过程的高效与准确。 3. 深度分析与洞察: ○ 对评测结果进行深度分析,定位模型的能力强项、缺陷与失败模式。 ○ 探究模型在不同任务、领域和提示词下的表现差异。 ○ 撰写详尽的评测报告,清晰地呈现结论,并提出模型改进或应用策略建议。 4. 工具与平台建设: 参与或主导内部评测工具、平台和流程的建设,提升评测的自动化水平与规模化能力。 5. 前沿追踪: 紧密跟踪业界最新的模型动态、评测方法学与研究进展,并快速应用到实际工作中。 【任职要求】 1. 学历与经验: 计算机科学、人工智能相关专业本科及以上学历. 2. 技术理解: 对机器学习、深度学习,特别是大语言模型的基本原理有一定的了解。 3. 编程能力: 熟练掌握 Python,进行数据处理和分析。具备良好的脚本编写能力以自动化评测流程。 4. 评测方法论: 了解主流的AI评测基准和方法,具备设计评测实验和控制变量的科学思维。 5. 数据分析能力: 具备强大的数据分析能力,能够从复杂数据中提炼核心洞察,并熟练使用图表进行可视化呈现。 6. 沟通协作: 出色的书面和口头沟通能力,能够清晰地撰写报告并与研发、产品等团队高效协作。 优先考虑: 1. 具备构建评测数据集的经验。 2. 对模型的安全性、偏见、鲁棒性等领域有深入理解和评测经验。 3. 具备Prompt Engineering的丰富经验,能够设计复杂的提示词来激发和检验模型能力。

最后确认在招:2026-09-01 19:09:33 · 来源平台:alibaba