阶跃星辰 社会招聘
大模型评测基建工程师
北京 ·经验不限·学历不限
北京·上海
薪资面议
前往 阶跃星辰 官网投递
职位描述
岗位职责:
构建真实工作场景/Code Task Benchmark (Docker-based tasks(s)
设计Agent执行环境,包括代码运行、测试与结果验证框架
研发CodeAgent框架,实现任务规划、代码生成、执行与迭代闭环
构建Agent Runtime,包括工具调用、环境管理与执行状态控制
搭建可扩展的模型对比评测系统(multi-modelevaluation)
优化Agent执行稳定性、可复现性与评测效率
推动研究能力向工程系统转化,支持模型与Agent的快速迭代
岗位要求:
扎实的软件工程能力,熟练掌握Python,Go, TypeScript等开发语言
熟悉Docker/Linux环境与自动化执行流程
理解LLMAgent工作机制与工具调用模式
有复杂系统设计与工程落地经验
熟悉测试体系、任务执行与自动化 workflow设计
优先考虑:
有LLMevaluation/benchmark构建经验
熟悉SWE-bench或类似代码任务评测框架
开发过CodeAgent或自动化编程系统
熟悉Agent orchestration / multi-agent framework
有模型比较或大规模实验平台经验
官网发布:2026-03-31 · 最后确认在招:2026-09-03 22:42:05 · 来源平台:moka