新华三集团 · 社会招聘
智算云MaaS平台架构师(J18842)
杭州 ·经验不限·学历不限
北京市·杭州市·郑州市·成都市
薪资面议
前往 新华三集团 官网投递
职位描述
1. 负责 MaaS 平台产品与技术架构及演进路线设计,构建覆盖模型开发、训练、微调、强化学习、评测、部署、推理及模型服务的全生命周期平台。
2. 负责大模型后训练服务规划,主导大模型分布式训练故障感知恢复,持续跟踪强化学习及 Agentic AI 等方向的技术发展,并推动形成平台产品能力。
3. 负责大模型推理Token工厂服务设计,持续优化推理服务性能,降低Token生产成本。
4. 负责大规模异构算力调度架构设计,实现训练、微调、推理等工作负载的统一算力管理,结合训练与推理业务特点设计算力调度策略,提高 GPU 利用率、集群吞吐和整体算力投入产出比。
5. 支持重大客户、重点项目的技术交流、方案设计及架构咨询,能够完成从客户需求到平台产品能力的抽象和沉淀,推动产品从规划、研发到规模化商业落地。
【任职要求】
1. 计算机、人工智能等相关专业,具备8年以上云计算、AI平台相关工作经验;具备云原生架构能力,深入理解 Kubernetes、Volcano、Service Mesh等技术体系,具有3年以上AI Infra相关经验。
2. 熟悉大模型训练技术体系,对DeepSpeed、Megatron-LM 等技术框架有实际经验或深入理解,熟悉大模型微调技术、强化学习及 Post-training 技术体系,熟悉 RLHF、RLAIF、Reward Model、PPO、DPO、GRPO 等相关方法,理解其训练流程、算力特点及平台工程需求。
3. 深入理解大模型推理服务架构,理解KVCache、Continuous Batching、Paged Attention、量化、Speculative Decoding 等关键优化技术,能够从计算、显存、网络和存储等维度分析大模型推理性能瓶颈,并提出性能优化思路。
4. 具备较强算力平台及调度框架架构能力,理解大模型算力集群、GPU 资源池化、vGPU 调度、分布式训练调度及推理服务调度,熟悉 Ray、Kubeflow、Volcano、Kueue、Slurm 等 AI 计算与调度框架。
具备以下一项或多项经验者优先:
1. 有大型智算云或企业级 AI 平台产品/架构经验优先;
2. 有万卡级算力集群、智算中心或大规模异构算力平台相关经验优先;
3. 有大模型预训练、SFT、RLHF/DPO/GRPO 、Agentic-RL等真实项目经验优先;
4. 有大规模在线 LLM 推理平台建设及性能优化经验优先;
最后确认在招:2026-09-01 19:01:36 · 来源平台:beisen