直招.cv

← 返回职位列表

小红书 · 社会招聘

大模型平台全栈工程师/专家

北京市,上海市,杭州 ·经验不限·学历不限

北京市,上海市,杭州市

职位描述

1、大模型生产平台架构研发:负责一站式大模型生产与部署平台的架构设计和核心功能研发,构建云原生、高可用、高性能、可扩展的平台体系,覆盖数据、训练、压缩、评测、模型管理和服务部署全生命周期。 2、ModelOps / LLMOps 与资产管理:建设模型、数据集、实验、Checkpoint、评测结果、镜像和服务版本等资产体系,完善数据血缘、版本追踪、权限、审计和成本归因能力,让模型生产过程可管理、可追溯、可复现。 3、训练平台与 Agentic RL 生产链路:建设统一训练入口、实验控制面和 Pipeline 编排能力,支持 SFT、后训练及 Agentic RL 场景,编排 Trainer、Rollout、Reward、Environment / Sandbox 等异构角色,完善阶段追踪、失败重试、Checkpoint 恢复和运行轨迹观测。 4、大模型服务部署平台:建设面向超大模型的分布式部署和运维能力,支持 KV Router、PD / EPD 分离、Role-based 多角色拓扑、角色级配置与独立扩缩容,完善服务发布、更新、灰度、回滚、监控和故障诊断能力。 5、Pipeline 与云原生系统建设:建设训练、评测、部署等复杂任务的工作流与控制面,结合 Kubernetes、Argo Workflows / Kubeflow 等技术,提升任务自动化、可观测、可恢复和资源隔离能力。 6、平台与框架、调度及 MaaS 协同:打通 Relax、rLLM 等训推框架及资源调度、存储、MaaS 等上下游系统,将性能优化、弹性调度、拓扑感知和服务治理能力转化为标准化的平台供给。 7、开发者体验与业务协同:持续优化 API、CLI / Skill、控制台、SDK、文档和诊断体验,与算法、训练、推理、云原生及业务团队协作,降低模型研发、部署和运维门槛。 【任职要求】 任职要求: 1、本科及以上学历,计算机、软件工程、人工智能等相关专业优先。 2、具备优秀的代码能力,熟悉 Go / Java / Python 中至少一门语言,具备良好的工程实现能力、代码质量意识和系统抽象能力。 3、具备扎实的计算机基础,理解操作系统、数据结构、算法、数据库、网络和分布式系统等基础知识。 4、熟悉云原生和后端技术栈,包括 Kubernetes、Docker、微服务、MySQL、Redis、MQ 等,有高可用、高并发、可观测系统建设经验优先。 5、理解大模型数据、训练、压缩、评测、模型管理和推理部署的基本流程,对模型资产、Pipeline、任务调度、分布式训练或服务治理中的部分方向有深入认知。 6、了解 PyTorch、Megatron、DeepSpeed、veRL、vLLM、SGLang、TensorRT-LLM 等训练或推理框架,具备框架接入、部署或平台化经验优先。 7、责任心强、自驱力强,能与算法、平台、基础架构、资源调度和业务团队协同推进复杂项目落地。 加分项: 1、有 AI 大模型平台、MLOps、LLMOps、模型部署平台、训练平台或模型评测平台开发经验。 2、有大规模训练任务平台、Agentic RL 实验平台、分布式任务编排或异构角色协同系统建设经验。 3、有 KV Router、PD / EPD 分离、多角色推理拓扑、模型服务发布、弹性扩缩容或 MaaS 平台经验。 4、熟悉 Kubernetes、Kubeflow、Argo Workflows、Volcano、Kueue、Ray 等云原生与调度生态。 5、有分布式系统、大规模在线服务、高并发平台、工作流或多租户平台建设经验。 6、有平台产品意识和 AI 工具使用习惯,能够从开发者体验出发优化接入、诊断、链路追踪、监控告警和使用效率。 7、有相关高水平论文、重要开源项目贡献或复杂生产系统中的突出技术成果。

最后确认在招:2026-09-01 19:11:29 · 来源平台:xiaohongshu