钉钉 · 社会招聘
千问办公-AI 测试工程师-杭州
杭州 ·2年以上·本科
杭州
薪资面议
前往 钉钉 官网投递
职位描述
1.负责 AI 工作台产品的端到端功能测试,覆盖多租户管控、权限模型、配额计费、模型准入、Agent 编排与工具调用等核心业务链路,确保功能正确性与业务一致性。
2.主导 AI 应用与 Agent 运行链路的效果测试体系建设,围绕模型输出质量、意图识别准确率、工具调用成功率、端到端任务完成率等维度,设计可量化的评测方案与基准集。
3.构建自动化测试框架,覆盖接口测试、集成测试、回归测试与性能基线验证,支撑持续集成流水线中的质量门禁。
4.设计 AI 场景专项测试策略,包括 Prompt 鲁棒性测试、对抗样本注入、幻觉检测、内容安全护栏验证、多轮对话一致性校验等。
5.参与可观测性与质量度量体系建设,定义测试覆盖率、缺陷逃逸率、效果评测回归趋势等核心质量指标,驱动产品质量持续改进。
6.与研发、算法团队紧密协作,参与需求评审与技术方案评审,前置识别质量风险并推动测试左移。
【任职要求】
1.扎实的软件测试工程能力,熟练使用 Python / Java / Go 中至少一门语言编写自动化测试脚本,具备复杂分布式系统的测试设计与执行经验。
2.熟悉 AI/LLM 应用测试方法论,理解 Prompt Engineering、Function Calling、Agent 执行链路、Context Window 等核心概念,具备 AI 输出质量评估的实战经验。
3.具备端到端测试框架设计能力,熟悉 Pytest / JUnit / TestNG 等主流框架,有接口自动化、契约测试或混沌测试落地经验。
4.熟悉 CI/CD 流程与质量门禁集成,能独立搭建自动化回归体系并嵌入持续交付流水线。
5.良好的数据分析能力,能基于测试结果进行效果评测数据统计、趋势分析与归因定位。
6.持续关注 AI 测试与评测领域前沿,能独立消化英文一手资料并转化为测试实践;习惯使用 AI 工具辅助测试用例生成与缺陷分析。加分项
7.有 LLM 评测 / AI 效果测试平台建设经验,熟悉 RAGAS、DeepEval、Promptfoo 等评测框架或自建评测体系。
8.有 Agent 端到端测试经验,包括多步骤任务链路验证、工具调用结果校验、异常恢复路径测试。
9.有性能测试与稳定性保障经验,能设计高并发场景下的 AI 推理服务压测方案。
10.有安全测试或红队测试经验,如 Prompt 注入攻防、越权检测、数据泄露验证等
最后确认在招:2026-09-01 19:09:46 · 来源平台:alibaba