直招.cv

← 返回职位列表

字节跳动 社会招聘

大模型与Agent评估方法算法研究员-Commercial AI

北京 ·经验不限·学历不限

北京

职位描述

1、我们正在围绕大模型与Agent构建新一代评估体系,关注如何在真实任务和复杂交互中,对模型能力、风险、稳定性与优化方向进行系统性推断; 2、算法研究员的核心职责是把评估问题变成可运行的研究对象,包括任务设计、数据构造、评分协议、比较方法和推断分析; 3、从真实任务和复杂Agent行为中抽象高价值评估问题,设计面向大模型/Agent的评估任务、样本集、Benchmark、Protocol与Scoring Policy; 4、研究并落地Rubric-based Eval、LLM-as-a-judge、Pairwise comparison、自动Red-teaming、多轮交互评估等方法; 5、运用统计推断、实验设计和归因分析方法,对不同模型、策略与环境配置进行严谨比较; 6、在日常工作中,写实验代码、清洗样本、分析Judge分歧、复盘模型失败模式,并据此重写任务和评分协议; 7、与科学家讨论能力定义合理性,将其落成为可执行的任务集、Rubric或比较实验; 8、持续面对Benchmark失效、模型利用规则漏洞、线上线下结论不一致等真实问题。 【任职要求】 1、计算机、机器学习、统计、数学、物理、语言学等相关专业,硕士学位及以上; 2、具备机器学习、NLP、LLM、Agent、推荐、广告、强化学习等方向研究或项目经验; 3、熟悉实验设计、统计分析、模型评测、因果推断中至少一类核心方法; 4、能将模糊问题拆解为清晰任务、方案、证据与评估体系,擅长研究抽象与技术表达; 5、关注智能系统评估、能力边界、失败模式与泛化问题,愿意落地真实业务场景; 6、具备跨团队协作能力,有评测相关、业务落地、开源或论文成果者优先。

官网发布:2026-01-13 · 最后确认在招:2026-09-08 19:16:26 · 来源平台:feishu