宁德时代 社会招聘
推理服务研发工程师
厦门 ·经验不限·学历不限
厦门
薪资面议
前往 宁德时代 官网投递
职位描述
岗位职责:
1、负责大模型推理引擎的工程化与性能优化,核心技术方向包括:PD分离架构、多级KVCache缓存、投机解码、MTP加速;
2、设计并实现分层KVCache管理系统,研发智能淘汰策略与预取机制,持续提升缓存命中率;
3、开发高性能推理引擎,涵盖Continuous Batching、动态Batch Size调整、混合精度推理、多种并行策略;
4、基于GPU/AI芯片,设计、开发和优化底层高性能算子库,针对大模型算法(Transformer、MoE等)进行算子级性能优化;
5、针对不同硬件平台(NVIDIA GPU、华为昇腾NPU、国产加速卡)进行算子适配与性能调优,包括Attention算子、GEMM、通信原语等;
6、建设推理服务的Benchmark体系,覆盖吞吐量、首Token延迟(TTFT)、生成延迟(TPOT)、MFU等核心指标;
7、保障推理服务的高可用性,设计并实现秒级故障检测与自愈机制。
任职要求:
1、计算机科学、人工智能、电子工程等相关专业本科及以上学历,3年以上深度学习系统、推理引擎或高性能计算开发经验;
2、精通C++和CUDA编程,深入理解GPU硬件架构(SM、Warp调度、内存层次、TensorCore);
3、深入理解Transformer架构的推理计算流程,熟悉vLLM、SGLang、TensorRT-LLM、TGI中至少一种框架的原理与实现;
4、掌握KVCache优化(PagedAttention/RadixAttention)、FlashAttention、量化推理(GPTQ/AWQ/SmoothQuant)等关键技术;
5、熟悉深度学习框架(PyTorch/TensorFlow)底层原理,有Kernel开发能力;
6、具备性能分析与优化能力(Nsight Systems/Nsight Compute/PyTorch Profiler);
7、能够借助AI辅助工具加速开发,快速掌握新硬件平台与新技术栈。
加分项:
1、有PD分离、Disaggregated Serving架构的生产实战经验;
2、向vLLM/SGLang/FlashAttention等开源项目贡献过代码;
3、熟悉国产AI芯片(昇腾/摩尔线程)的推理适配与算子开发;
4、有AI编译器开发经验;
5、有Mooncake的使用经验;
6、有RDMA/NVLink等高速互联场景下的分布式推理经验。
官网发布:2026-06-24 · 最后确认在招:2026-09-03 21:20:17 · 来源平台:moka