字节跳动 社会招聘
大模型代码评测专家 - AI数据与安全
北京 ·经验不限·学历不限
北京
薪资面议
前往 字节跳动 官网投递
职位描述
团队介绍:AI 数据与安全团队为 Seed 基座模型及 AI 原生应用提供跨模态数据服务,覆盖数据生产全流程,包含模型评估标准的制定、数据规模化生产、数据飞轮搭建,不断提升数据质量,支持模型快速迭代。
团队由产品经理、数据工程、数据运营等跨职能人才组成,并通过与 Seed 研究员、行业专家、全球顶尖数据供应商紧密合作,从真实场景中收集反馈并分析模型表现数据,解决 AI 前沿突破过程中的复杂数据问题,推动模型性能与用户体验的双重提升。我们既是帮助模型技术迭代的一线贡献者,也是模型和 AI 产品的一手用户。
1、调研主流公开代码评测方法与基准(覆盖代码补全、修复、重构、Agentic SWE、多轮交互等维度),主导内部自建评测集的设计;
2、参与评测工具算法设计与开发,优化评测效率与自动化水平,提升团队研发效能;
3、制定代码方向的模型评估标准与指标体系,分能力维度、分难度分级、含权重与红线指标;
4、设计算法与工具,实现评测结果自动化量化分析、缺陷定位及根因追溯,输出分析报告,为模型迭代提供数据支撑。
【任职要求】
1、本科及以上学历,计算机科学与技术、软件工程、大数据、人工智能等相关专业优先;具备英文文献阅读能力,能持续跟进前沿评测方法,在计算机相关国际会议/期刊发表过论文者优先;
2、熟练掌握Python,具备较强的工程开发能力与良好的编码风格,有平台/工具从0到1搭建经验者优先;
3、熟悉大模型评测方法,了解Prompt Engineering,有大模型训练、微调或模型评估相关经验;了解Rubric评分、LLM-as-Judge、Agentic/多轮评估等前沿评测范式者优先;
4、具备优秀的沟通协调与跨团队协作能力,能主导评估标准的制定与推广;有项目管理经验、能独立推动复杂项目落地者优先;
5、大模型产品(如编程助手/Coding Agent)的深度用户,对代码类模型的能力边界与真实使用痛点有感受者优先。
官网发布:2025-11-07 · 最后确认在招:2026-09-03 19:35:21 · 来源平台:feishu