直招.cv

← 返回职位列表

字节跳动 社会招聘

大模型平台研发(评测工程) - TikTok内容安全平台

上海 ·经验不限·学历不限

上海

职位描述

团队介绍:国际化内容安全平台团队致力于为字节跳动国际化产品的用户维护安全可信赖环境,通过开发、迭代机器学习模型和信息系统以更早、更快发掘风险、监控风险、响应紧急事件,以人工智能技术支持业务发展,力求更高效、更敏捷、更全能地维护站内生态安全。 1、多模态评测体系建设:负责国际化内容安全平台多模态大模型评测体系搭建,设计科学、可解释、可持续迭代的评测指标、方法和流程; 2、评测集与Benchmark构建:面向违规内容识别、多模态风险检测、多语言等安全场景,构建高质量自动化评测集和Benchmark,完成文本、图像、音视频等多模态数据的清洗、去重与持续迭代; 3、自动化评测框架与诊断分析:开发通用、多维度的自动化评测框架,支持大规模评测任务的部署、执行和监控;深入分析评测结果,定位模型能力短板、分布漂移和负面案例根因,为算法团队提供清晰的性能诊断和迭代建议; 4、前沿评测技术探索:持续跟踪大模型、多模态模型和内容安全领域的评测技术,探索LLM-as-Judge、人工标注校准、对抗样本、长尾风险评估等方法,并转化为内部可复用的评测实践; 5、评测工具化与闭环落地:利用Agent/LLM等技术开发评测辅助工具,提升评测任务接入、执行、分析和报告生成的自动化水平,推动评测结果进入数据建设、模型训练和产品治理闭环。 【任职要求】 1、本科及以上学历,计算机、人工智能、统计学、数学或相关专业,3年以上AI评测,数据分析,模型诊断相关经验; 2、具备优秀的编程能力,精通Python/Go/C++中至少一种编程语言,熟悉主流训练框架、评测工具或数据分析工具; 3、理解LLM及多模态模型的基本原理,有模型评测、Benchmark构建、误差分析或算法迭代经验; 4、熟悉内容安全领域,具备较强的数据敏感度、分析能力和结构化表达能力,能够独立完成评测分析、问题诊断和迭代建议输出; 5、具备良好的跨团队沟通和项目推动能力,对AI前沿评测技术保持好奇心,愿意在真实复杂业务场景中建设长期可复用的平台能力。

官网发布:2026-07-06 · 最后确认在招:2026-09-05 19:16:04 · 来源平台:feishu