MiniMax 社会招聘
MaaS 架构师
上海 ·经验不限·学历不限
上海·北京
薪资面议
前往 MiniMax 官网投递
职位描述
作为 MaaS 架构师,你将全面负责大模型线上服务的全链路架构设计与质量保障,构建高性能、高可用、可弹性伸缩的模型服务平台,确保模型在生产环境中的 SLA、延迟、吞吐量达到业界领先水平。工作包括不限于:
-负责 MaaS 平台架构设计,明确模型从产出到上线的全链路环节,对模型服务的 SLA、延迟、吞吐量等核心指标负责
-主导大模型推理网关的设计与建设,包括多模型路由、流量调度、优先级队列、多租户隔离与 Token 级计量能力
-设计 GPU 资源弹性伸缩策略,结合模型特征与负载信号实现智能调度与资源高效利用
-推动 KV Cache 感知调度的方案设计与落地,包括 Prefix Caching、Paged Attention 等技术在生产环境的应用,提升显存利用率与系统吞吐
-参与单机推理框架的选型、适配与性能调优,跟进 vLLM / TensorRT-LLM / SGLang 等主流引擎的演进,推动 Continuous Batching、Speculative Decoding、量化部署等优化落地
-构建推理负载的统一抽象与服务化封装,支持 LLM / 多模态 / Embedding 等多种负载类型的标准化部署与可观测性建设
【任职要求】
本科及以上学历,计算机科学或相关专业,5 年以上后端架构或 AI 基础设施相关经验
精通 C++ / Python / Go 中至少两门语言,具备扎实的系统编程能力
深刻理解LLM原理(Attention 机制、KV Cache、Batching 策略等)
具备大规模 GPU 集群的架构设计与调度经验,熟悉 Kubernetes 及 GPU 相关调度机制
熟悉至少一种主流推理框架(vLLM / TensorRT-LLM / SGLang),有源码级理解或定制开发经验
具备良好的跨团队协作与技术方案推动能力
加分项:
有千卡以上规模 GPU 推理平台的建设经验
有自研或深度定制推理引擎的经历
在 LLM Serving 相关开源项目中有贡献(vLLM / SGLang / Ray Serve 等)
了解 MoE 模型推理、长上下文推理(128K+)的工程优化实践
熟悉 CUDA / NCCL / Triton 等 GPU 编程与通信框架
官网发布:2026-06-22 · 最后确认在招:2026-09-03 19:28:38 · 来源平台:feishu