直招.cv

← 返回职位列表

字节跳动 社会招聘

豆包AI大模型评测产品解决方案(Coding/Agent方向) - 火山方舟

上海 ·经验不限·学历不限

上海·北京·深圳

职位描述

团队介绍:火山方舟是火山引擎推出的一站式大模型服务平台,是中国大模型市场产品和份额领跑者。平台提供模型推理、评测、精调等全流程服务。方舟搭载了豆包及业界主流大模型,提供丰富的插件生态和AI应用开发服务,并通过稳定可靠的安全互信方案、专业的算法技术服务,全方位保障企业级AI应用落地。 1、深入洞察企业客户在Coding/Agent场景下的大模型使用诉求,指导客户搭建高质量评测方案,真实、可量化地反映模型在客户业务中的实际效果; 2、以真实使用视角设计评测案例,还原客户完整研发Workflow(IDE内编码、CI/CD自动化、Code Review Agent等),评估模型在端到端工作流中的表现; 3、系统性收集客户评测反馈与问题案例,联合算法与评测团队定位模型能力短板与问题根因,沉淀内部评测集,驱动模型能力持续迭代; 4、牵头重点标杆客户评测方案的落地与场景推广,结合内外部评测结果,提炼可复用的行业最佳实践与方法论; 5、持续跟踪前沿评测技术与Benchmark演进(SWE-bench、HumanEval、Terminal Bench、NL2Repo、Cybergym等),开展技术调研与创新实践,推动评测体系升级。 【任职要求】 1、本科及以上学历,计算机科学、软件工程、人工智能、数据科学等相关专业,硕士学位优先; 2、3年以上互联网AI领域工作经验,其中至少1年以上大模型评测、大模型应用、AI to B解决方案或智能体项目相关经验; 3、具备扎实的编程能力和代码能力,熟练掌握Python/Go/Rust/Java中至少一种编程语言,能独立完成评测工具与平台的开发、模型案例问题分析; 4、对主流Agent与Vibe coding工具非常熟悉并有丰富使用经验,包括但不限于Claude Code、Cursor、Codex、TRAE、DeepSeek Harness等,能独立调试AI Coding问题,支撑客户现场开发、演示与问题修复; 5、对主流大模型有深入使用经验,熟悉各模型能力边界与特性差异,能感知并分析模型能力差距; 6、熟悉主流大模型评测Benchmark及其评测方法与局限性。

官网发布:2026-08-28 · 最后确认在招:2026-09-03 19:35:21 · 来源平台:feishu