直招.cv

← 返回职位列表

MiniMax 社会招聘

MaaS 架构师

上海 ·经验不限·学历不限

上海·北京

职位描述

作为 MaaS 架构师,你将全面负责大模型线上服务的全链路架构设计与质量保障,构建高性能、高可用、可弹性伸缩的模型服务平台,确保模型在生产环境中的 SLA、延迟、吞吐量达到业界领先水平。工作包括不限于: -负责 MaaS 平台架构设计,明确模型从产出到上线的全链路环节,对模型服务的 SLA、延迟、吞吐量等核心指标负责 -主导大模型推理网关的设计与建设,包括多模型路由、流量调度、优先级队列、多租户隔离与 Token 级计量能力 -设计 GPU 资源弹性伸缩策略,结合模型特征与负载信号实现智能调度与资源高效利用 -推动 KV Cache 感知调度的方案设计与落地,包括 Prefix Caching、Paged Attention 等技术在生产环境的应用,提升显存利用率与系统吞吐 -参与单机推理框架的选型、适配与性能调优,跟进 vLLM / TensorRT-LLM / SGLang 等主流引擎的演进,推动 Continuous Batching、Speculative Decoding、量化部署等优化落地 -构建推理负载的统一抽象与服务化封装,支持 LLM / 多模态 / Embedding 等多种负载类型的标准化部署与可观测性建设 【任职要求】 本科及以上学历,计算机科学或相关专业,5 年以上后端架构或 AI 基础设施相关经验 精通 C++ / Python / Go 中至少两门语言,具备扎实的系统编程能力 深刻理解LLM原理(Attention 机制、KV Cache、Batching 策略等) 具备大规模 GPU 集群的架构设计与调度经验,熟悉 Kubernetes 及 GPU 相关调度机制 熟悉至少一种主流推理框架(vLLM / TensorRT-LLM / SGLang),有源码级理解或定制开发经验 具备良好的跨团队协作与技术方案推动能力 加分项: 有千卡以上规模 GPU 推理平台的建设经验 有自研或深度定制推理引擎的经历 在 LLM Serving 相关开源项目中有贡献(vLLM / SGLang / Ray Serve 等) 了解 MoE 模型推理、长上下文推理(128K+)的工程优化实践 熟悉 CUDA / NCCL / Triton 等 GPU 编程与通信框架

官网发布:2026-06-22 · 最后确认在招:2026-09-03 19:28:38 · 来源平台:feishu