阿里巴巴|基于 AI-native 的智算稳定性研发创新-阿里星/A Star

阿里巴巴 · 阿里云 · 北京/杭州 · 更新时间:2026-07-30

岗位职责

【岗位背景】 随着AI服务的增加、算力集群从“千卡”向“万卡”演进,算力骨干网的规模也在变大变得更为复杂。网络稳定性已经成为 AI 发展的核心瓶颈。本团队意在利用 AI 大模型技术针对基础设施网络稳定性运维进行智能运维系统的建设,包括 AI-based 网络变更方案生成检测,AI-based 网络配置风险预防,以及 AI-based 故障日志关联分析做到无人值守智能化根因定位等。 【岗位职责】 您将作为核心骨干,深度参与以下一个或多个方向的研究与落地: 1、网络变更过程的 AI-native 异常/性能拖慢等根因定位问题; 2、智算网络在训练/推理过程的被动监控以及 AI 分析; 3、智算网络主动探测包括 pingmesh 等机制的异常检测进行 AI 分析。

任职要求

1、获得计算机科学与技术、计算机网络、通信工程、电子工程等相关专业博士学位; 2、在顶级会议或期刊(如SIGCOMM, NSDI 等)以第一作者身份发表过高水平论文者优先。 核心技能(满足其一即可,多项兼备者极佳) 1、网络协议栈深度理解:精通TCP/IP、RDMA/RoCEv2、InfiniBand协议细节,对拥塞控制(DCQCN, HPCC, TIMELY等)有深入研究; 2、对网络配置、BGP 以及基础的网络运维有深入理解; 3、面向 AI 的微调后训练等经验。 综合素质 1、对AI基础设施领域充满热情,具备敏锐的技术洞察力,能够独立思考并定义前沿问题; 2、具备优秀的代码能力(C/C++/Go/Python),不仅限于理论研究,更渴望将算法落地到实际产品中; 3、良好的沟通协作能力,能够跨团队(算法、芯片、系统、业务)推动复杂项目进展。

阿里巴巴校园招聘:基于 AI-native 的智算稳定性研发创新-阿里星/A Star岗位来自阿里巴巴招聘官网,具体内容以阿里巴巴招聘官网为准。