腾讯 社会招聘
AI高级评测工程师
深圳 ·五年以上工作经验·学历不限
深圳
薪资面议
前往 腾讯 官网投递
职位描述
1.负责医疗 Agent 核心业务的质量评测工作,覆盖健康问问、AI 诊室、医保智能助手等场景,制定 Agent 全链路评测方案、准出标准、回归策略与质量风险判断机制;
2.建设医疗 Agent 评测指标体系,围绕意图理解、任务完成度、多轮追问有效性、信息收集完整性、工具调用准确性、RAG 检索与引用质量、结果生成质量、兜底与异常处理等维度进行系统化评估;
3.负责医疗复杂链路专项评测,包括 AI 问诊全流程、科室/服务匹配、医保政策问答与办理指引、多模态报告解读等场景,沉淀可量化、可复用的评测方法和评估标准;
4.推动 Agent 自动化评测与数据基准建设,建设高质量评测集、标准答案、链路 Trace 标注规范和评测流水线,结合人工评测、规则评测、自动化评测和 LLM-as-a-Judge 提升评测效率与稳定性;
5.建立线上 Badcase 分析与治理闭环,针对医疗安全、内容安全、隐私合规、诊疗建议边界等高风险问题,设计安全护栏评测策略,并推动算法、产品和研发团队持续优化。
【任职要求】
1.计算机或相关专业本科及以上学历,具备扎实的软件测试与质量保证基础,有大型复杂系统、AI 产品或算法评测相关经验,能够独立负责核心模块或专项评测方向;
2.具备 AI 评测实战经验,熟悉大模型应用或 Agent 类产品的评测方法,能够围绕非确定性输出、复杂任务链路和多轮交互过程设计评测指标、测试集、验收标准、质量准出策略和回归评测方案;
3.深入理解 LLM/大模型技术原理,熟悉 Agent、RAG、Prompt Engineering、工具调用、工作流编排等大模型应用架构,能够识别模型能力、业务策略、工具链路和系统工程中的质量风险;
4.熟练掌握主流大模型与 Agent 评测方法,包括客观指标自动化评测、主观人工标注对齐、链路 Trace 分析、工具调用评测、模型互评机制、LLM-as-a-Judge 等,能够建设可复用的评测方法和质量判断标准;
5.具备优秀的工程化与数据分析能力,熟悉 Python 或其他脚本语言,能够独立开发数据处理脚本、自动化评测工具和评测结果分析能力;能够从对话日志、Agent Trace、工具调用记录、评测结果、用户反馈和线上 Badcase 中完成复杂问题分析、体系化归因和闭环推动。
最后确认在招:2026-09-03 23:15:16 · 来源平台:tencent