字节跳动 社会招聘
AI评测专家 - 飞书
北京 ·经验不限·学历不限
北京
薪资面议
前往 字节跳动 官网投递
职位描述
团队介绍:飞书是字节跳动旗下 AI 工作平台,面向人与agent协作,提供一站式协同办公、组织管理、业务提效工具和深入企业场景的 AI 能力,让 AI 真能用真落地。
从互联网、高科技、消费零售到制造、金融、医疗健康,各行各业先进企业都在飞书落地AI,与飞书共创行业最佳实践。先进团队,AI用飞书。
1、负责AI Agent的评测体系建设,制定覆盖基础能力、业务效果、工具调用、任务执行、稳定性、安全性和用户体验的评测标准,根据业务场景设计评测集、评分规则和验收门槛,建立从离线评测、自动化评测到线上效果监控的完整评测链路;
2、设计并维护高质量评测数据集,负责样本采集、清洗、标注、分层、去重及版本管理,保障数据代表性、覆盖度和区分度;
3、建设自动化评测能力,综合使用规则、代码、模型裁判和人工专家完成多维评分,并持续提升评测结果的准确性与一致性;
4、建立失败案例归因体系,对幻觉、误判、漏答、工具调用失败、执行中断和结果不稳定等问题持续聚类,推动Top问题专项治理;
5、探索用户反馈、线上行为和业务结果与离线评测之间的关联,持续提升评测指标对真实用户体验的解释能力,跟踪业界评测方法和前沿技术,沉淀AI评测规范、最佳实践和方法论,推动评测能力在不同业务场景中复用。
【任职要求】
1、具备大模型评测、算法评测、数据分析、测试开发或AI产品质量相关经验,有自动化评测平台或评测流水线建设经验、复杂任务E2E评测、工具调用评测或Computer Use Agent评测经验优先;
2、熟悉大语言模型、AI Agent、RAG、工具调用、Prompt Engineering和模型推理的基本原理;
3、熟悉准确率、召回率、Pass@K、成对比较、评分量表、LLM-as-a-Judge和人工评测等常见评测方法;
4、具备数据分析和基础编程能力,能够使用Python、SQL等工具完成数据处理、评测实验和结果分析;
5、具备较强的结构化分析和报告能力,能够从大量失败样本中提炼共性问题并提出。
官网发布:2026-07-27 · 最后确认在招:2026-09-03 19:35:21 · 来源平台:feishu