直招.cv

← 返回职位列表

阿里云智能 · 其他 社会招聘

阿里云智能-技术服务工程师-全栈TAM - 北京

北京 ·3年以上·本科

北京

需本科学历,3年以上泛互联网行业应用研发或架构经验,熟悉AI开发框架及GPU优化,精通JAVA/Python/GO

职位描述

客户贴身技术服务 • 技术问题处置:持续关注并分析客户用云技术问题,通过对客户业务的深入理解协助客户完成技术案例的快速高效处置。 • 需求追踪:在各行业结合客户业务场景和云产品使用情况,对客户使用情况和需求进行正确分析,挖掘真实产品需求并协助产品持续优化。 稳定性支持与保障 • 应急保障:重大故障问题的应急处置,协助业务快速恢复,故障逃逸等保障工作 • 风险巡检:针对客户使用云产品,进行使用负载,业务容量,风险事件,变更通知等巡检 • 主动服务:结合客户云上业务,制定关键架构监控和告警方案,实现智能监控和预警,提升客户的业务效率和用户体验。 • 全链路评估:对客户业务全链路调用评估,结合业务调用的云上/云下一体化风险评估,关键链路使用建议和风险提醒 • 高可用演练:围绕架构高可用方向,配合客户进行极端场景的高可用演练,模拟故障场景,演练业务逃逸实施并参与总结 • 活动护航:客户重大业务高峰活动护航,包括活动业务架构梳理,前置产品风险巡检,性能压测,故障演练,驻场保障等 云上业务治理与优化 • 用云优化:对客户新产品选型、产品使用方式、支撑行业最佳实践方案,规避通用行业客户使用误区,提炼围绕客户的最佳用云实践方案 • 云上资源管理:协助客户进行云上资源管理,业务资源使用率分析、容量管理和弹性伸缩方案保障 • 卓越架构支持:围绕卓越架构目标,对安全合规、稳定性、成本优化、高效性能方案等全方面优化工作支撑 服务保障 • 服务管理:为客户在云上使用过程中制定合理的服务及交流渠道,提供线上,现场,多项目多部门关键人员的服务交流方案支持,确保关键事件及重点项目的进展信息有效性,推进项目进展顺利落地。 • 项目支持:在客户使用云产品期间根据需求提供多样化的技术保障专项,并结合云产品特性和客户使用情况制定对应技术方案执行路线,保障技术专项的有效交付。 • 满意度保障:为企业客户满意度负责,从问题快速解决到项目平稳交付,并持续提供有效的云上使用建议和稳定性保障方案整体提升客户用云满意度。 【任职要求】 1. 2年以上泛娱乐、零售、金融、教育等行业大型互联网应用(含AI原生应用)或集团型企业应用的研发、架构设计、监控方案、Devops、AIops、维护、高可用改造方案经验。 2. 熟悉 AI Agent开发框架及工具(LangChain/Dify/LlamaIndex/百炼等),模型推理框架(vLLM /sglang),模型训练框架(LlamaFactory、swift等),具备GPU集群调度、资源隔离、显存优化相关经验,能够解决大规模算力下的性能瓶颈与稳定性问题。 3. 熟悉主流大模型推理框架(如 vLLM, Triton Inference Server, TensorRT-LLM, TGI 等)。 4. 了解 NVIDIA GPU 底层架构及分布式通信机制(如 NVLink, NCCL, RDMA/RoCE 高速网络)。 5. 熟悉JAVA、Python、GO其中一门开发语言,熟悉常见中间件、数据库、大数据组件,如Redis、Nacos、K8s、Kafka、spark、flink等,具有2年以上软件开发经验优先。 6. 具备大模型、云原生、大数据、数据库、网络、中间件等领域中的一项或多项技术理解和应用经验,有阿里云公共云产品相关使用运维经验优先。 7. 熟悉云原生的系统架构设计方法,有应用与数据迁移改造方案设计实施经验优先。 8. 具有优秀的沟通技巧、团队合作经验、敬业精神和学习能力。 9. 具有较强的抗压能力和执行力,并能接受一定频率的出差。 加分项: 1. 有ACP(阿里云认证工程师)、ACE(阿里云认证高级工程师)者优先。 2. 熟悉阿里云 AI 产品矩阵(如 PAI 机器学习平台、百炼大模型平台)或具有相关云厂商 AI 基础设施研发经验。 3. 对大语言模型(LLM)的量化(AWQ/GPTQ)、KV Cache 优化(如 PagedAttention)有一定了解。 4. 具备极强的复杂问题排查能力,有处理过 GPU OOM、CUDA/算子报错、NCCL 通信超时或死锁等 AI 典型故障的实战经验者优先。

官网刷新:2026-09-07 · 最后确认在招:2026-09-07 20:21:02 · 来源平台:alibaba