阶跃星辰 校园招聘
实习-后训练基础设施算法工程师
地点未注明 ·经验不限·学历不限
薪资面议
前往 阶跃星辰 官网投递
职位描述
岗位方向
参与大模型后训练中的 Agent 数据合成、评测诊断与基础设施建设,围绕 Long-Horizon Agent、代码 Agent、工具调用、多模型协作等方向,构建可用于 SFT/RL 的高质量轨迹数据与自动化评测体系。
岗位职责
设计并搭建面向 SFT/RL 的 Agent 轨迹合成 pipeline,支持多模型、多 scaffold、多策略生成训练数据;
建设 Agent 执行框架,支持任务规划、工具调用、代码修改、测试执行、失败恢复与 checkpoint 续跑;
构建 Agent 评测与诊断系统,支持 Rubric Eval、LLM-as-Judge、Failure Onset 定位和轨迹清洗;
接入 SWE-Bench、代码修复、工具调用、长上下文任务等 benchmark,形成自动化评测闭环;
分析模型在规划、工具使用、代码理解、错误恢复等方面的能力短板,并反哺数据与训练迭代。
任职要求
熟悉大模型后训练流程,了解 SFT、RLHF、GRPO/PPO 等方法;
具备扎实的 Python 工程能力,能够独立搭建数据 pipeline、评测系统或 agent runtime;
熟悉 LLM Agent 基本范式,如 ReAct、Planner-Executor、Tool Calling、Multi-Agent 等;
有代码 Agent、SWE-Bench、自动化代码修复、工具调用或长上下文任务经验者优先;
对数据质量、评测可信度、失败样本分析和训练闭环有较强理解。
加分项
有 Claude Code、Codex、OpenHands、SWE-agent、DeerFlow、MCP 等相关经验;
有大规模 SFT/RL 数据生产、trajectory synthesis、LLM-as-Judge 或 verifier 设计经验;
熟悉容器沙箱、Ray、Kubernetes、异步任务调度、Git patch/test loop 等工程系统;
熟悉 context engineering、memory、summary、retrieval、context compression 等长上下文技术。
期望产出
搭建稳定可复用的 Agent 数据合成与评测 pipeline;
提升代码任务、工具调用任务、长任务规划类 benchmark 的通过率;
形成从轨迹生成、评测诊断、数据清洗到 SFT/RL 训练的闭环。
官网发布:2026-06-17 · 最后确认在招:2026-09-03 20:15:56 · 来源平台:moka