直招.cv

← 返回职位列表

新华三集团 · 社会招聘

智算云MaaS平台架构师(J18842)

杭州 ·经验不限·学历不限

北京市·杭州市·郑州市·成都市

职位描述

1. 负责 MaaS 平台产品与技术架构及演进路线设计,构建覆盖模型开发、训练、微调、强化学习、评测、部署、推理及模型服务的全生命周期平台。 2. 负责大模型后训练服务规划,主导大模型分布式训练故障感知恢复,持续跟踪强化学习及 Agentic AI 等方向的技术发展,并推动形成平台产品能力。 3. 负责大模型推理Token工厂服务设计,持续优化推理服务性能,降低Token生产成本。 4. 负责大规模异构算力调度架构设计,实现训练、微调、推理等工作负载的统一算力管理,结合训练与推理业务特点设计算力调度策略,提高 GPU 利用率、集群吞吐和整体算力投入产出比。 5. 支持重大客户、重点项目的技术交流、方案设计及架构咨询,能够完成从客户需求到平台产品能力的抽象和沉淀,推动产品从规划、研发到规模化商业落地。 【任职要求】 1. 计算机、人工智能等相关专业,具备8年以上云计算、AI平台相关工作经验;具备云原生架构能力,深入理解 Kubernetes、Volcano、Service Mesh等技术体系,具有3年以上AI Infra相关经验。 2. 熟悉大模型训练技术体系,对DeepSpeed、Megatron-LM 等技术框架有实际经验或深入理解,熟悉大模型微调技术、强化学习及 Post-training 技术体系,熟悉 RLHF、RLAIF、Reward Model、PPO、DPO、GRPO 等相关方法,理解其训练流程、算力特点及平台工程需求。 3. 深入理解大模型推理服务架构,理解KVCache、Continuous Batching、Paged Attention、量化、Speculative Decoding 等关键优化技术,能够从计算、显存、网络和存储等维度分析大模型推理性能瓶颈,并提出性能优化思路。 4. 具备较强算力平台及调度框架架构能力,理解大模型算力集群、GPU 资源池化、vGPU 调度、分布式训练调度及推理服务调度,熟悉 Ray、Kubeflow、Volcano、Kueue、Slurm 等 AI 计算与调度框架。 具备以下一项或多项经验者优先: 1. 有大型智算云或企业级 AI 平台产品/架构经验优先; 2. 有万卡级算力集群、智算中心或大规模异构算力平台相关经验优先; 3. 有大模型预训练、SFT、RLHF/DPO/GRPO 、Agentic-RL等真实项目经验优先; 4. 有大规模在线 LLM 推理平台建设及性能优化经验优先;

最后确认在招:2026-09-01 19:01:36 · 来源平台:beisen