直招.cv

← 返回职位列表

商汤科技 社会招聘

推理优化工程师,高性能C++

杭州 ·经验不限·学历不限

上海·北京·杭州

职位描述

我们正在构建全球最具性能密度的「AI推理引擎」 。不止追求单 GPU 峰值利用率,更着眼于在异构加速器上,为前沿大模型提供极致吞吐与最低延迟 。 我们提供 1. 深度参与国产大模型 + 国产芯片异构推理的前沿工程挑战 2. 与头部 AI Infra 团队协作,解决真实的大规模部署问题 3. 接触完整的 PD 分离架构,从 Kernel 到 Scheduling 到集群级优化 4. 有竞争力的薪酬和成长空间 工作内容 1. 负责超大规模大语言模型推理系统的设计、开发与优化,提升吞吐和降低延迟 2. 设计并实现高性能推理 Kernel(CUDA / AscendC / 国产芯片算子),包括 Attention、Decode、Prefill 等核心算子 3. 参与 LLM Serving 系统架构设计,解决 PD 分离、PP/TP 并行、KV Cache 管理、Scheduling 等核心问题 4. 优化推理框架(vLLM / SGLang / TensorRT-LLM / MindIE 等)在不同硬件平台上的性能表现 5. 参与异构计算平台适配,推动模型在国产 GPU/NPU(沐曦、昇腾等)上的高效部署 6. 建设推理性能基准测试体系(Benchmark),量化并持续追踪系统性能 【任职要求】 1. 计算机科学、电子工程、人工智能等相关专业,硕士及以上学历 2. 2 年以上 AI Infra / 推理优化 / 高性能计算相关工作经验 3. 精通 Python,熟练使用 C++ 进行系统级开发 4. 熟悉 LLM 推理框架(vLLM / SGLang / TensorRT-LLM / MindIE 至少一种)的原理和使用 5. 熟悉 Transformer 模型架构,理解 Attention 机制、KV Cache、量化等核心概念 6. 有 CUDA Kernel 开发经验或 GPU 性能调优经验 加分项 1. 有头部公司相关岗位工作经验 2. 有 LLM Serving 系统生产环境调优经验(Scheduling、Continuous Batching、PagedAttention 等) 3. 熟悉分布式推理(TP / PP / PD 分离),了解 NCCL / 通信优化 4. 有国产芯片适配和优化经验 5. 有 AI Agent 系统开发经验 6. 有顶会论文发表(NeurIPS / ICML / AAAI / MICRO / ISCA 等) 7. 参与过 vLLM / SGLang / PyTorch 等开源项目贡献

官网发布:2026-06-29 · 最后确认在招:2026-09-02 19:12:28 · 来源平台:feishu