度小满 社会招聘
AI infra工程师
北京 ·经验不限·学历不限
北京
薪资面议
前往 度小满 官网投递
职位描述
一、模型性能优化
- 算子开发与优化: 针对 Transformer 类模型(Qwen, MoE),使用 CUDA、Triton 或 CUTLASS 开发高性能算子(Attention, GEMM, Softmax 等)
- 模型量化落地: 负责大模型量化技术(FP8, INT8, INT4, AWQ, GPTQ 等)的工程落地与精度/性能调优,开发高效的量化计算 Kernel
- 极致时延优化: 通过算子融合、显存管理优化、流水线并行等手段,极致降低首字延迟(TTFT)和提升吞吐量(TPOT)
二、推理框架与编译优化
- 推理引擎研发: 深度参与或自研高性能 LLM 推理框架( vLLM, SGLang),优化 Request 调度、KV Cache 管理及连续批处理机制
- 编译优化: 利用 TVM, MLIR, TorchCompile 等编译技术,进行计算图层面的自动融合、内存规划和代码编写
- 分布式推理: 优化多卡、多机环境下的通信效率,实现高效的张量并行(TP)和流水线并行(PP)
三、训推平台与调度系统
- 大规模集群调度: 基于 Kubernetes 构建大规模 GPU 集群调度系统,解决千卡/万卡级别的资源分配、任务排队与优先级管理
- 训推平台建设: 打造一站式大模型训练与推理平台,支持断点续训、弹性伸缩和故障自动恢复
- 推理服务治理: 建设推理服务的负载均衡、流量调度、模型热加载及多级缓存系统,保障高并发下的 SLA
- 可观测性与效能: 建立 GPU 集群的深度监控与日志系统,提升资源利用率(MFU)和研发效能
【任职要求】
1.计算机、电子工程、数学或相关专业本科及以上学历,扎实的计算机体系结构、操作系统和数据结构算法基础
2.熟悉 C++、Python 或 Go 中至少一门语言,具备高质量的代码交付能力和良好的工程习惯
相关技能 (满足以下任意一项或多项):
- 高性能计算: 熟悉 CUDA/Triton 编程,熟悉 GPU 内存层级与线程模型,有 TensorRT、FasterTransformer 或自定义算子开发经验
- 推理/编译框架: 深入理解 vLLM、SGLang、TensorRT-LLM、TVM、MLIR 或 PyTorch 源码,熟悉计算图优化与分布式并行策略(TP/PP/EP)
- 分布式系统: 熟悉 Kubernetes (K8s) 生态、Ray 框架或 Slurm 调度,熟悉 RDMA 网络通信、存储系统及大规模集群的资源调度算法
官网发布:2025-09-11 · 最后确认在招:2026-09-03 19:37:04 · 来源平台:feishu