在今年WAIC展会上,超节点成为热词。华为的昇腾950超节点、阿里磐久AL128超节点、沐曦的曦景S系列超节点、中兴通讯的OEX超节点......几乎所有底座厂商,都在谈论并且推出超节点产品。

作为英伟达在2023年就提出的概念,超节点在行业内并不是一个新词汇。它通过将内部GPU进行高速总线互联,支撑起更大的计算任务,加速GPU之间的参数交换和数据同步,缩短大模型的训练周期。

英伟达的这一开拓,也将芯片厂商过去卖GPU的概念,变化成为通过AI超级计算机提供算力基础。

而国产芯片厂商纷纷入局,这背后既有需求发生的改变,也有国产AI芯片厂商竞争正在从单点突破走向系统协同,从芯片竞争走向AI基础设施竞争的产业逻辑变化。

“时间到了”,超节点火了

当展台上出现大量小型数据中心一样的超节点柜机时,大多数人都会有个疑问:什么是超节点?

超节点的核心,是把原本分散的众多AI芯片,通过超高速互联、统一软件和系统调度,组成一台“超级计算机”。其重点不在于有多少GPU的堆叠,而是这些GPU之间能不能通过有效通信,像同一块高性能GPU一样协同工作。

之所以超节点在今年的WAIC上成为热词,在行业人士看来,是因为“时间到了”。

从行业趋势来说,英伟达在提出超节点概念时就已经提到,随着大模型从训练模型转向推理模型,单块GPU的性能已经不够用了,边际效应正在逐渐显现,需要通过系统集成之间的信息互联去支撑更大的算力需求。

从国内现实来说,国内芯片厂商也直面和英伟达单颗GPU之间存在较大差距。