直招.cv

← 返回职位列表

小红书 · 社会招聘

大模型推理服务(MaaS)研发工程师/专家

北京市,上海市,杭州 ·经验不限·学历不限

北京市,上海市,杭州市

职位描述

我们是小红书中台大模型 Infra 团队,专注打造领先易用的「AI 大模型全链路基础设施」!团队深耕大模型「数-训-压-推-评」技术闭环,在大模型训练加速、模型压缩、推理优化、部署提效等方向积累了深厚的技术优势,基于 RedAccel 训练引擎、RedSlim 压缩工具、RedServing 推理部署引擎、DirectLLM 大模型 API 服务、QuickSilver 大模型生产部署平台等核心产品,持续赋能社区、商业、交易、安全、数平、研效等多个核心业务,实现 AI 技术高效落地! DirectLLM是小红书内部面向各业务场景建设的大模型API服务产品,通过标准化API接口提供LLM/MLLM等大模型推理服务,致力于为AI应用开发者提供品类丰富、数量众多的模型选择,并通过API接口为其提供开箱即用、能力卓越、成本经济的模型服务,各领域模型的能力均可通过统一的API和SDK来实现被不同业务系统集成。 核心职责 1、MaaS 平台架构与研发: 参与 MaaS 系统架构设计与研发,建设公司统一的大模型 API 服务入口。 2、模型服务治理能力建设: 负责模型接入、请求路由、鉴权、限流、配额、TPM / RPM、灰度发布、SLO、成本统计等核心能力。 3、请求调度与稳定性建设: 建设多模型、多租户、高并发场景下的请求调度与服务治理能力,提升模型服务稳定性和资源效率。 4、推理引擎与业务打通: 打通底层推理引擎与上层业务应用,为社区、搜索、审核、企效、AI 应用等场景提供开箱即用的大模型服务能力。 5、开发者体验优化: 持续优化统一 API、SDK、文档、监控、问题诊断和接入流程,提升内部 AI 应用开发效率。 6、成本与效率优化: 与推理、压缩、调度团队协同,持续优化模型调用成本、服务延迟和资源利用率。 【任职要求】 任职要求 1、熟悉 Go / Java / Python / C++ 中至少一门语言,具备扎实的服务端研发能力。 2、有大规模分布式系统、高并发 API 网关、服务治理、流控限流、鉴权、多租户系统等相关经验。 3、能对复杂业务问题进行系统建模和抽象,具备良好的稳定性、可观测性和工程质量意识。 4、了解大模型推理服务基本链路,对模型部署、请求调度、服务高可用、SLO 保障等有基本认知。 5、具备良好的沟通协作能力,能与推理框架、平台、算法和业务团队协同推进项目落地。 加分项 1、有 LLM / MLLM 模型服务平台、MaaS 平台、API 网关、云服务平台开发经验。 2、熟悉 vLLM、SGLang、TensorRT-LLM 等大模型推理框架,有模型推理部署或优化经验。 3、熟悉 Kubernetes、服务发现、负载均衡、弹性扩缩容、限流熔断、灰度发布等服务治理能力。 4、有面向开发者的平台产品建设经验,理解 API、SDK、文档、接入体验对平台效率的影响。 5、有成本治理、资源调度、请求路由、模型路由相关经验优先。

最后确认在招:2026-09-01 19:11:29 · 来源平台:xiaohongshu