阿里云智能 社会招聘
阿里云智能-服务器AI互连技术开发专家-上海/北京
北京 ·5年以上·本科
北京·上海
薪资面议
前往 阿里云智能 官网投递
职位描述
● 参与超节点集群推理训练性能调优:深入AI大模型训练/推理业务场景,针对高密度并行算力流量与内存扩展访存特征,定位并解决性能瓶颈。
● 可靠性与稳定性体系建设,涵盖异常流量抑制、自愈机制设计,系统性降低组网故障概率。构建质量保障体系,设计多级流量优先级调度、拥塞调度。
● Scale-Up通信软件优化,包括软件研发与交付,如推理卡间通信、KV Cache优化。
● 评测体系与极限验证:搭建数据面性能基线、面向通信库、池化内存扩展评测体系,为软件迭代与架构演进提供量化依据。
● 参与具备竞争力的下一代基础设施架构定义:结合GPU互连技术演进与AI算力业务需求,参与下一代Scale-Up超节点互连架构、内存池化方案及数据面协议的设计与预研。
【任职要求】
● 计算机、软件工程、电子科学与技术、人工智能等相关专业。
● 5年以上软件研发或系统架构设计经验,精通C++或Python等编程语言,具备扎实的底层系统开发能力。
● 具备丰富的性能分析与优化经验,能独立完成系统性能瓶颈定位及调优。
● 有强烈的技术热情和好奇心、自驱力和学习力;具备良好的分析与解决问题能力、沟通以及团队合作能力;有创新热情,积极乐观,能够持续推动问题的解决和突破。
● 掌握AI基础知识,熟练使用主流AI Coding工具,熟悉AI驱动的研发流程并能融入个人工作流;有AI相关开发工具应用研发经验者优先,持有阿里云ACA/ACP/ACE认证证书者优先。
加分项(满足一个或多个)
● 熟悉AI推理或者训练框架,或有大规模集群性能调优实战案例者优先。
● 有GPU集群通信优化经验,熟悉集合通信库底层原理者优先。
● 熟悉网络监控指标体系、可观测平台、告警治理与基线建设者优先。
● 有高速接口性能优化经验,熟悉Scale-Up互连,或PCIe、RDMA、CXL技术者优先。
● 熟悉互连Fabric 组网、路由协议与集群管控方案者优先。
● 熟悉大集群网络稳定可靠性容灾者优先。
● 有CUDA编程及GPU内存访问优化经验者优先。
官网刷新:2026-08-30 · 最后确认在招:2026-09-03 22:49:47 · 来源平台:alibaba