【2027校招】测试开发
杭州 ·经验不限·学历不限
杭州市
需计算机相关专业本科及以上学历,精通CUDA编程和GPU性能调优,熟悉分布式训练框架,掌握Nsight
薪资面议
职位描述
1、GPU集群性能基准测试与分析:设计并执行针对英伟达/国产等主流AI芯片的微架构级Benchmark(如GEMM、AllReduce、显存带宽),建立标准化性能基线;深入分析算力瓶颈、通信延迟及能效比,输出可落地的硬件选型与调优建议;
2、大模型训练/推理系统评测:构建覆盖预训练、SFT、RLHF及推理服务的全链路评测框架,量化评估不同并行策略(TP/PP/DP)、算子融合、量化精度(FP8/INT4)对吞吐量、延迟、收敛性的影响,支撑训练框架与推理引擎的迭代优化;
3、软硬件协同问题定位:联合芯片厂商、驱动团队及算法团队,复现并根因分析GPU相关故障(如ECC错误、NVLink降速、OOM、精度漂移),推动固件/驱动/编译器层面的修复验证,保障万卡集群稳定性;
4、前沿技术预研与工具建设:跟踪NVIDIA/AMD/国产芯片新特性(如Blackwell FP4、MI300X MFMA),提前验证其在小红书业务场景的适用性;开发自动化测试平台与可视化分析工具,提升团队研发效能;
5、技术标准沉淀与知识传递:撰写GPU测试规范、性能调优手册及故障案例库,参与内部技术培训,将研究成果转化为可复用的基础设施能力。
【任职要求】
1、本科及以上学历,计算机体系结构、高性能计算、电子工程、人工智能等相关专业,扎实的计算机系统功底,熟悉 Linux 内核、CUDA 编程、计算机网络及存储原理。
2、GPU与AI系统经验:
a、有CUDA/OpenCL kernel编写与性能调优实战经验,理解GPU内存层次、Warp调度、Tensor Core工作机制。
b、参与过Megatron-LM/DeepSpeed/vLLM/TensorRT-LLM等框架的开发、测试或深度使用,理解分布式训练/推理底层机制。
c、在MLSys、ISCA、MICRO、ASPLOS等会议发表过GPU/AI系统相关论文,或在知名开源项目(如PyTorch、Triton、FlashAttention)有实质性贡献。
3、测试与研究能力:具备严谨的实验设计思维,能独立定义评测指标、控制变量、排除干扰因素;熟练使用Nsight Systems/Compute、Perfetto、DCGM等profiling工具;有大规模集群(≥千卡)测试经验者优先;
4、工程落地意识:代码能力强(Python/C++/Rust至少精通一门),注重代码质量与可维护性;能将研究成果转化为自动化工具或平台组件,而非仅停留在论文/报告层面。
【加分项】:
1、熟悉国产AI芯片(昇腾、寒武纪、海光等)生态或有适配经验;
2、有编译器(TVM/MLIR/XLA)或算子库(cuBLAS/cuDNN)开发背景;
3、在Kaggle/顶会竞赛中取得优异成绩,或有高质量技术博客/开源项目。
官网发布:2026-09-01 · 最后确认在招:2026-09-07 20:27:27 · 来源平台:xiaohongshu