阶跃星辰 社会招聘
Coding评测工程师
上海 ·经验不限·学历不限
上海·北京
薪资面议
前往 阶跃星辰 官网投递
职位描述
一句话定义
负责大模型代码能力的评测体系建设与持续演进。定义模型在软件工程场景下的能力发展方向、质量标准,并构建可抵御刷分的评测体系,要求兼具一线工程判断力与AI评测方法论
工作范围
评测环境构建
为模型在特定方向上构建完整的任务完成环境,将真实软件开发流程抽象为可复现、可扩展的评测用例
设计模拟真实软件工程场景的评测环境,包含需求分析、架构设计、多文件编辑、Debug、测试覆盖等完整链路
评测标准制定
制定覆盖多语言的代码能力评测标准(正确性、代码质量、复杂度处理、工程规范等),建立能力基线并持续追踪
设计超越简单Pass/Fail的多维度评估维度,涵盖正确性、安全性、鲁棒性、可读性、执行效率等指标
基于评测结果进行结构化分析,持续迭代优化Rubric标准
评测数据工程
完成评测数据的全流程处理,包括数据清洗、过滤、去重与质量校验,构建高质量评测数据集
负责评测数据、评测样本与Benchmark的建设与治理,保障评测结果的客观性与可复现性
建立评测-训练闭环迭代机制,使能力提升可量化
人才画像
技术背景:计算机科学、人工智能、软件工程等相关专业,本科及以上学历
编程能力:精通Python,熟练掌握至少一种其他编程语言(Java/Go/C++/TypeScript等),有跨语言工程实践经验
工程经验:具备复杂系统或产品的核心研发经验,能清晰阐述关键设计决策与权衡
评测经验:熟悉评测集、指标体系、Rubric设计及自动化评测流程,有评测平台、数据流水线或实验系统建设经验
LLM认知:对主流大模型的原理、能力边界及典型应用场景有较深入理解,熟悉大模型与Agent的常见评测方法
工具链:熟悉Linux、容器技术(Docker)及编排工具;熟悉主流LLM评测基准与方法论(HumanEval、SWE-bench等)
加分项
有安全、隔离的代码执行沙箱环境构建经验
有桌面沙盒与虚拟机环境相关构建经验,支持桌面端代码编译打包、应用启动、进程健康、UI渲染、跨平台一致性等验证环节
熟悉容器技术及编排工具,支持大规模并发调度的评测执行
有Broswer Use、自动化测试等相关项目经验
官网发布:2026-08-02 · 最后确认在招:2026-09-03 22:42:05 · 来源平台:moka