数据技术及产品部-RL Data 工程师-Work(工程方向)
杭州 ·2年以上·本科
杭州
需2年以上大模型评测或工业相关经验,本科学历,精通Python,熟悉Agent框架和LLM推理服务。
薪资面议
职位描述
主导办公场景下宽泛工业场景如制造业、建筑、工业工程等方向评测体系的设计与落地实施,定义模型能力,设计评测方法并构建专业评测集。具体包括:
1. 主导设计并构建面向工业场景的评测基准,涵盖能力维度拆解、任务难度分级、数据集构造、评分标准制定等全流程,具备从 0 到 1 打造高区分度评测集的能力。
2. 持续跟踪大模型在工业领域的落地进展,确保评测体系能有效度量模型的真实能力边界。
3. 设计覆盖真实工业场景的代码评测任务,包括但不限于:制造业效率提升、建设设计规划等,推动评测从"解题"向"工程实践"演进。
4. 设计面向复杂 Agent 场景的评测任务体系,涵盖多步推理、环境交互、工具编排、长程规划、错误恢复等维度,构建能反映真实 Agentic 工作流的端到端评测方案。
5. 建立评测数据质量管控机制,包括题目查重与污染检测、难度标定与校准、人工标注规范制定与一致性审核,确保评测结果的可信度与可复现性。
6. 与模型训练团队紧密协作,将评测洞察转化为模型能力改进方向;与工程团队协同推动评测基础设施建设,支撑高频次、大规模的自动化评测流程。
【任职要求】
1. 对大模型在工业领域有深入理解和判断,能清晰判断如何将工业领域任务转化为大模型评测任务,并将其转化为可量化的评测维度。
2. 具备从零设计 Benchmark 的完整经验,理解评测集在区分度、抗污染性、生态效度等方面的设计权衡。
3. 工业背景+大模型评测经历,具备将实际工业场景抽象为大模型能力评测的能力。
4. 熟练掌握 Python,具备数据处理、统计分析与可视化能力;了解主流 LLM 推理服务的调用方式与工程约束。
6. 了解 Agent 框架的核心机制(如 ReAct、Tool Use、Planning 等范式),对 MCP 等工具协议有认知或实践经验。
7. 优秀的技术写作与沟通能力,能将评测设计思路清晰传达给研究与工程团队,并撰写高质量的评测报告与技术文档。
官网刷新:2026-09-07 · 最后确认在招:2026-09-07 20:21:45 · 来源平台:alibaba