字节跳动 社会招聘
AI服务器系统集成测试-服务器
杭州 ·经验不限·学历不限
杭州
薪资面议
前往 字节跳动 官网投递
职位描述
1、GPU机型端到端交付测试:负责GPU卡及GPU服务器整机在选型验证、研发验证、SIT、产测导入与交付验收等全流程测试,输出测试基线、验收标准与交付报告,保障项目按期交付与质量达标;
2、GPU SIT能力建设:构建并持续维护GPU SIT基线体系,覆盖功能、性能、稳定性、可靠性与可观测性(监控/告警/日志)等维度,沉淀可复用用例与门禁标准,支撑GPU产品规模化交付;
3、GPU卡评测与选型:跟踪业界新GPU卡与关键技术演进,设计并执行功能/性能/稳定性等评测与对标,输出评测结论(优势/短板/风险项),为业务产品选型与引入决策提供依据;
4、GPU业务场景测试:深入理解业务使用场景与关键指标,持续优化SIT测试标准与基线用例,支撑线上问题复现定位与改进闭环,提升业务使用体验与稳定性;
5、GPU测试自动化开发:设计并实现自动化测试框架与流水线能力,包括用例编排与并发执行、结果判定、报告生成/看板与基线对比等,持续提升测试覆盖率与交付效率。
【任职要求】
1、本科及以上学历,计算机、电子、通信、自动化等相关专业;具备服务器硬件测试、系统测试或产测/交付测试相关经验;
2、扎实的GPU与服务器硬件基础,深入理解AI/GPU硬件原理与系统架构,包括GPU计算与显存体系、PCIe/NUMA、CPU-IO拓扑等;能够将硬件特性与潜在风险转化为可执行的测试策略与验收标准;
3、熟练掌握GPU常用性能Benchmark与评测方法,覆盖计算、显存、PCIe、互联、通信等维度;
4、精通自动化开发,以Python为主,能够独立完成用例开发、并发执行、结果判定、日志解析、报表可视化等;熟悉Shell脚本,具备工程化交付意识与可维护性设计能力;
5、良好的沟通与项目推进能力,能够有效推动跨团队协作与问题闭环,保障交付节奏与质量目标达成。
加分项
1、GPU Benchmark测试与算子优化:精通GPU Benchmark测试设计与执行,熟悉算子级性能分析与调优,包括CUDA Kernel优化、算子融合、内存访问模式优化等;
2、具备GPU芯片硅后验证(Post-Silicon Validation)经验,熟悉GPU卡功能验证、性能验证与问题定位流程;
3、深入理解AI大模型训练/推理流程、计算图优化、显存管理及并行策略(数据并行/模型并行/流水线并行),能够将业务需求转化为测试场景与验收标准;
4、熟悉大规模AI集群(千卡/万卡级)网络架构(IB/RoCE/以太网)、拓扑设计、通信优化与故障定位;
5、有自动化测试平台或CI/CD流水线建设经验,熟悉任务编排、资源管理、结果判定与数据看板开发等。
官网发布:2026-04-13 · 最后确认在招:2026-09-02 19:19:00 · 来源平台:feishu