小米 社会招聘
Agent 评测工程师
北京 ·经验不限·学历不限
北京
薪资面议
前往 小米 官网投递
职位描述
1. 搭建Agent端到端评测体系,覆盖单轮问答质量、多轮对话一致性、工具调用准确率、任务完成率等维度。
2. 构建和维护评测数据集(Golden Dataset),包括标准问答对、多步推理用例、边界Case、对抗样本等。
3. 开发自动化评测Pipeline,集成到CI/CD流程,实现Agent版本发布前的自动回归测试。
4. 设计Agent安全性评测方案,包括Prompt注入防御、信息泄露检测、权限越界测试。
5. 对标Manus、Genspark等产品的Agent能力,定期进行竞品Benchmark对比评测。
6. 输出评测报告,驱动算法和工程团队持续优化。
【任职要求】
1.本科及以上学历,2年以上AI/NLP评测或QA工程经验。
2.熟悉Agent评测框架:RAGAS、DeepEval、TruLens、AgentBench、PromptFoo中至少两种。
3.有评测数据集构建经验,熟悉数据标注流程与质量控制方法。
4.熟悉LangSmith、LangFuse等LLM可观测性工具,能追踪Agent全链路执行日志。
5.了解主流Agent Benchmark(SWE-Bench、WebArena、GAIA、ToolBench等)。
6.精通Python,有自动化测试框架开发经验。
7.了解红队测试(Red Teaming)、对抗性评测方法者加分。
8.有Manus、Genspark、Perplexity等AI Agent产品深度使用与评测经验者优先。
官网发布:2026-04-08 · 最后确认在招:2026-09-03 23:18:29 · 来源平台:xiaomi