直招.cv

← 返回职位列表

阶跃星辰 社会招聘

大模型评测基建工程师

北京 ·经验不限·学历不限

北京·上海

职位描述

岗位职责: 构建真实工作场景/Code Task Benchmark (Docker-based tasks(s) 设计Agent执行环境,包括代码运行、测试与结果验证框架 研发CodeAgent框架,实现任务规划、代码生成、执行与迭代闭环 构建Agent Runtime,包括工具调用、环境管理与执行状态控制 搭建可扩展的模型对比评测系统(multi-modelevaluation) 优化Agent执行稳定性、可复现性与评测效率 推动研究能力向工程系统转化,支持模型与Agent的快速迭代 岗位要求: 扎实的软件工程能力,熟练掌握Python,Go, TypeScript等开发语言 熟悉Docker/Linux环境与自动化执行流程 理解LLMAgent工作机制与工具调用模式 有复杂系统设计与工程落地经验 熟悉测试体系、任务执行与自动化 workflow设计 优先考虑: 有LLMevaluation/benchmark构建经验 熟悉SWE-bench或类似代码任务评测框架 开发过CodeAgent或自动化编程系统 熟悉Agent orchestration / multi-agent framework 有模型比较或大规模实验平台经验

官网发布:2026-03-31 · 最后确认在招:2026-09-03 22:42:05 · 来源平台:moka