直招.cv

← 返回职位列表

阿里云智能 社会招聘

阿里云智能-技术服务经理TAM-互联网KA客户-北京

北京 ·2年以上·本科

北京

职位描述

1. 企业级 AI Agent 工程落地指导: 作为客户 AI 应用技术服务的第一责任人,深入理解客户业务场景与技术痛点,主导Agent等工程全链路落地服务:从 RAG 构建、知识库向量化、Prompt Engineering 调优,到多 Agent 协作编排、工具链集成与 Function Call调试,确保 AI Agent 在生产环境高效运行。 2. 大模型训练与推理全链路架构设计,负责从数据到模型端到端技术支持:数据侧:设计数据采集、清洗、标注流程,搭建高质量训练数据 Pipeline; 训练侧:基于 PAI 平台进行模型微调(SFT/RLHF)、LoRA 适配、分布式训练集群调度; 推理侧:优化推理性能(KV Cache、Flash Attention)、推理服务弹性伸缩、Tokens成本治理 3. AI 云原生稳定性保障: 从客户架构视角出发,通过自动化巡检、AIOps 工具链推动问题主动发现与风险预防。构建 AI 云原生全链路可观测体系,覆盖 SaaS 层(百炼/通义)、PaaS 层(PAI/DashScope)、IaaS 层(GPU 实例/高速网络)。结合大模型业务的高并发、长文本等流量特征,制定 GPU 算力集群的弹性扩缩容策略。负责推理延迟优化、显存 OOM 治理、模型服务灰度发布、模型流量调度、算力混沌工程、故障快速定位与 RCA 沉淀。 4. 卓越架构护航从公共云企业客户的业务视角出发,基于云上卓越架构最佳实践,主导客户云系统的持续诊断与重构。围绕高性能、高可用、安全合规、运维提效与成本精细化管理五大维度,推动架构的标准化与现代化升级。攻坚 AI 基础设施与传统业务系统的异构集成难题。设计并落地云上弹性伸缩方案,确保大模型/AI 业务在云端环境下的无缝对接、平滑扩缩容与极致弹性。 【任职要求】 1. 2年以上泛娱乐、零售、金融、教育等行业大型互联网应用(含AI原生应用)或集团型企业应用的研发、架构设计、监控方案、Devops、AIops、维护、高可用改造方案经验。 2. 熟悉Agent开发框架及工具(LangChain/Dify/LlamaIndex/百炼等),模型推理框架(vLLM /sglang),模型训练框架(LlamaFactory、swift等),具备GPU集群调度、资源隔离、显存优化相关经验,能够解决大规模算力下的性能瓶颈与稳定性问题。 3. 熟悉主流大模型推理框架(如 vLLM, Triton Inference Server, TensorRT-LLM, TGI 等)。 4. 了解 NVIDIA GPU 底层架构及分布式通信机制(如 NVLink, NCCL, RDMA/RoCE 高速网络)。 5. 熟悉JAVA、Python、GO其中一门开发语言,熟悉常见中间件、数据库、大数据组件,如Redis、Nacos、K8s、Kafka、spark、flink等,具有2年以上软件开发经验优先。 6. 具备大模型、云原生、大数据、数据库、网络、中间件等领域中的一项或多项技术理解和应用经验,有阿里云公共云产品相关使用运维经验优先。 7. 熟悉云原生的系统架构设计方法,有应用与数据迁移改造方案设计实施经验优先。 8. 具有优秀的沟通技巧、团队合作经验、敬业精神和学习能力。 9. 具有较强的抗压能力和执行力,并能接受一定频率的出差。 加分项: 1. 有ACP(阿里云认证工程师)、ACE(阿里云认证高级工程师)者优先。 2. 熟悉阿里云 AI 产品矩阵(如 PAI 机器学习平台、百炼大模型平台)或具有相关云厂商 AI 基础设施研发经验。 3. 对大语言模型(LLM)的量化(AWQ/GPTQ)、KV Cache 优化(如 PagedAttention)有一定了解。 4. 具备极强的复杂问题排查能力,有处理过 GPU OOM、CUDA/算子报错、NCCL 通信超时或死锁等 AI 典型故障的实战经验者优先。

官网刷新:2026-08-10 · 最后确认在招:2026-09-03 22:49:47 · 来源平台:alibaba