蚂蚁集团 · 社会招聘
蚂蚁集团-AI评测专家-杭州/重庆
杭州 ·3年以上·本科
杭州·重庆
薪资面议
前往 蚂蚁集团 官网投递
职位描述
1. 评测体系构建: 设计并开发全面、客观、可量化的AI模型评测方案,涵盖能力、性能、安全、伦理等多个维度。
2. 基准测试与执行:
○ 熟练运用和改造现有的主流评测基准(如 MMLU, GSM8K, HumanEval, BIG-Bench, MT-Bench, HELM 等)。
○ 针对具体业务场景,设计并构建定制化的评测数据集(包括指令编写、数据清洗、质量评估)。
○ 执行自动化与人工评测,确保评测过程的高效与准确。
3. 深度分析与洞察:
○ 对评测结果进行深度分析,定位模型的能力强项、缺陷与失败模式。
○ 探究模型在不同任务、领域和提示词下的表现差异。
○ 撰写详尽的评测报告,清晰地呈现结论,并提出模型改进或应用策略建议。
4. 工具与平台建设: 参与或主导内部评测工具、平台和流程的建设,提升评测的自动化水平与规模化能力。
5. 前沿追踪: 紧密跟踪业界最新的模型动态、评测方法学与研究进展,并快速应用到实际工作中。
【任职要求】
1. 学历与经验: 计算机科学、人工智能相关专业本科及以上学历.
2. 技术理解: 对机器学习、深度学习,特别是大语言模型的基本原理有一定的了解。
3. 编程能力: 熟练掌握 Python,进行数据处理和分析。具备良好的脚本编写能力以自动化评测流程。
4. 评测方法论: 了解主流的AI评测基准和方法,具备设计评测实验和控制变量的科学思维。
5. 数据分析能力: 具备强大的数据分析能力,能够从复杂数据中提炼核心洞察,并熟练使用图表进行可视化呈现。
6. 沟通协作: 出色的书面和口头沟通能力,能够清晰地撰写报告并与研发、产品等团队高效协作。
优先考虑:
1. 具备构建评测数据集的经验。
2. 对模型的安全性、偏见、鲁棒性等领域有深入理解和评测经验。
3. 具备Prompt Engineering的丰富经验,能够设计复杂的提示词来激发和检验模型能力。
最后确认在招:2026-09-01 19:09:33 · 来源平台:alibaba