阿里云智能 · 校园招聘
智算网卡与协议栈竞争力构建-阿里星/A Star
杭州 ·经验不限·学历不限
北京·杭州
薪资面议
前往 阿里云智能 官网投递
职位描述
随着AI大模型参数规模迈向万亿级,算力集群已从“千卡”向“万卡”演进,网络通信成为制约大模型训练效率的核心瓶颈。本团队正承担面向下一代大模型的超低延迟、高吞吐、高稳定性的RDMA网络全栈解决方案的重点项目。我们需要具有深厚理论功底和极强工程落地能力的博士人才,共同攻克RDMA网卡架构及智能传输层协议等“无人区”难题,定义未来智算网络的行业标准。
您将作为核心骨干,深度参与以下一个或多个方向的研究与落地:
1、RDMA网络及网卡架构研发:
· 参与新一代高性能RDMA网卡(RNIC)的架构定义与逻辑设计,优化数据包处理流水线。
2、智能传输层协议攻关(核心重点):
· 拥塞控制:研发基于实时遥测数据的新型拥塞控制算法,解决大模型流量突发导致的Incast问题和队头阻塞。
· 多路径传输:设计基于流/包粒度的多路径负载均衡算法,提升复杂拓扑下的带宽利用率。
· 可靠性机制:研究RDMA网络下的快速重传、前向纠错(FEC)及故障自愈机制。
【任职要求】
基本要求
1、获得计算机科学与技术、计算机网络、通信工程、电子工程等相关专业博士学位。
2、在顶级会议或期刊(如SIGCOMM, NSDI, ISCA,SC, HPCA, ATC, IEEE/ACM ToN等)以第一作者身份发表过高水平论文者优先。
核心技能(满足其一即可,多项兼备者极佳)
1、网络协议栈深度理解:精通TCP/IP、RDMA/RoCEv2、InfiniBand协议细节,对拥塞控制(DCQCN, HPCC, TIMELY等)有深入研究;
2、分布式系统经验:熟悉NCCL、RCCL、MPI等通信库源码,有大规模分布式训练系统优化经验者优先;
3、硬件/底层开发能力:有DPDK、SPDK、eBPF等内核旁路技术开发经验;
4、算法与仿真能力:具备极强的数学建模能力,熟练使用NS-3、Omnet++或自研仿真器进行网络性能评估。
综合素质
1、对AI基础设施领域充满热情,具备敏锐的技术洞察力,能够独立思考并定义前沿问题;
2、具备优秀的代码能力(C/C++/Go/Python),不仅限于理论研究,更渴望将算法落地到实际产品中;
3、良好的沟通协作能力,能够跨团队(算法、芯片、系统、业务)推动复杂项目进展。
最后确认在招:2026-09-01 19:06:52 · 来源平台:alibaba