直招.cv

← 返回职位列表

腾讯 · AI 工程/Infra 社会招聘

大模型推理优化工程师(上海/深圳)

上海 ·两年以上工作经验·学历不限

上海

需两年以上工作经验,硕士学历,精通Python与C++,熟悉PyTorch和CUDA,有大模型推理优化或GPU调优经验

职位描述

1.背景:我们正在寻找专注于大模型推理优化的工程师,负责游戏业务中线上大模型服务的性能优化。您将参与从推理引擎优化到异构硬件落地的全流程,在低延迟、高吞吐的场景中支撑游戏大模型的在线推理服务,作为核心技术中台支持不同游戏项目的落地需求; 2.推理性能优化:围绕首 Token 延迟(TTFT)、生成吞吐、显存与算力利用率进行极致调优;应用量化(FP8、INT4/AWQ、MXFP4 等)、稀疏化等压缩技术,在维持模型推理效果的前提下降低推理成本; 3.推理引擎与算子优化:基于 vLLM、SGLang、TensorRT-LLM 等主流框架进行二次开发与深度优化,涉及连续批处理、PagedAttention、前缀缓存、KV Cache 量化与分级存储等关键能力;结合 CUDA/Triton 进行算子融合与计算图编译优化; 4.推理架构演进:探索 PD 分离、投机解码、MoE 专家并行等前沿架构,优化长上下文、长思维链与高并发场景下的推理效率; 5.算力适配:负责推理服务在算力上的部署、适配与调优,开展算子适配、显存管理与通信优化,构建跨硬件、可复用的推理加速方案; 6.性能分析与持续优化:建立推理服务的分析与监控体系,使用 Nsight 等工具进行 profiling 与瓶颈定位,监控推理服务的算力资源使用效率;与模型、agent、游戏引擎等多团队协作,结合游戏研发与运营的实际需求,持续优化推理成本。 【任职要求】 1.教育背景:硕士及以上学历,计算机、软件工程、人工智能或相关专业;在大模型推理优化、GPU 性能调优方向有丰富经验者优先; 2.技术能力:; 3.精通 Python 与 C++,熟悉 Linux 开发环境,具备扎实的系统编程与算法基础; 4.熟悉 PyTorch 等深度学习框架,深入理解 KV Cache、量化、前缀缓存等大模型推理优化机制; 5.有 CUDA 编程或 GPU 性能调优经验,能使用 Nsight 等工具进行 profiling; 6.熟悉主流推理框架(vLLM、SGLang、TensorRT-LLM 等),有二次开发或深度优化经验。

最后确认在招:2026-09-08 20:21:27 · 来源平台:tencent