立足娱乐圈·争做八卦帝!

徽声在线

AI算力新篇章:超节点时代来临,国产厂商能否引领变革?

来源:未知 作者:佚名 发布时间:2026-07-18 02:33:53

近期,“超节点”概念为何突然成为科技圈的焦点?自今年年初以来,这一术语几乎成了国产算力产业中最炙手可热的词汇。

7月17日,2026世界人工智能大会(WAIC)在上海盛大开幕。在会上,华为、中兴通讯、天数智芯等科技巨头纷纷展示了他们的超节点产品。走进世博展览馆H2馆的华为展区,一台体积庞大的昇腾950超节点映入眼帘,瞬间吸引了众多参观者的目光。

“超节点”究竟要解决什么问题呢?想象一下,一千个人同时解答一道数学题,如果每计算一步,这一千个人都必须停下来,等待所有人对完答案,才能继续下一步,那么人数越多,解题速度反而可能越慢。答案不在于增加人数,而在于如何让这一千个人像一个人一样心意相通,协同工作。这正是“超节点”的核心理念,它并非指新的芯片或模型,而是一种算力组织方式的革命性变革。过去,AI集群的基本单元是单台八卡服务器,跨服务器通信成为了一大瓶颈。而“超节点”则通过高速互联和统一内存语义,将分散在数十台服务器中的成百上千张芯片整合到一个低延迟、高带宽的域内,使它们能够像一张芯片一样协同工作。

过去,算力竞争的核心在于谁能制造出更快、更强的芯片;而如今,这个问题已经演变成一个更为复杂、更具系统性的挑战:如何让成百上千张芯片真正像一张芯片那样协同工作?

超节点,正是这场系统级竞争的集中体现。

WAIC直击:超节点成为展会亮点

在本届WAIC上,华为首次展示了支持1024张NPU(神经处理单元‌)高速互联的昇腾950超节点(Atlas 950 SuperPoD)真机,并首次披露了去年发布的昇腾384超节点已累计规模商用750多套,显示出强大的市场影响力。

中兴通讯则联合曦智科技、壁仞科技、沐曦股份、燧原科技、天数智芯等企业,共同打造了国产高性能Matrix超节点;中科曙光也首发了scaleX十万卡超智融合集群系统,这是目前国内规模最大的AI4S计算集群,彰显了国产算力的崛起。

国内头部GPU厂商壁仞科技也带来了多款超节点方案,包括16卡、128卡以及1024卡超节点。其中,16卡和128卡超节点采用电互联技术,而1024卡超节点则采用了光互联技术,展现了技术的多样性。

另一家GPU厂商天数智芯也展示了其超节点产品。据悉,天数超节点主要面向大模型训练与高并发推理场景,以国产通用GPU为核心,实现了144芯高速全互联。通过高带宽互联、统一资源调度和软硬件协同优化,提供了稳定、可靠、可扩展的高质量算力。

天数智芯工作人员向徽声在线记者透露,公司的超节点采用了144芯电互联技术。

在世博展览馆H2馆的华为展区,20个机柜整齐排列。两边各有8个计算柜,中间是4个灵衢机柜。计算柜的最上层是电源模块,中间层正面是光模块和LPO(光模块剔除了DSP芯片)的插槽,后方则是正交结构的CPU刀片、NPU刀片以及交换网板,最下层为液冷模块,设计精巧且高效。

记者来到昇腾950超节点的后方,发现华为采用了透明机柜设计,以便展示机柜内部结构。机柜内并非由传统的服务器组成,而是由一个个NPU抽屉和CPU抽屉组成。一个机柜拥有16块CPU和64块NPU,每个抽屉内放置8个NPU模组。这些CPU抽屉和NPU抽屉也被称为CPU计算刀片和NPU计算刀片。徽声在线记者观察到,其机柜内部正交架构思路与英伟达相近,但采用了无背板正交直连设计,与英伟达的正交背板方案有所不同。

对于为何选择打造如此庞大的超节点,而不是利用传统的Scale out组计算集群,华为工作人员解释道:“装在一个POD(超节点)里面,带宽会更大。因为现在大模型推理对带宽的要求非常高。”

随着Agent和大模型推理的盛行,AI的瓶颈逐渐从计算转向了存储和互联(通信)。那么,超节点内部又是如何实现高效互联的呢?

工作人员向记者介绍,每一块NPU上都配置了两块交换芯片。8卡NPU计算刀片内部采用全电互联技术。计算刀片的背面通过高速铜缆接口与交换网板连接。一排排交换网板负责机柜内部的互连。交换网板的后方是光模块和LPO插槽,光模块和LPO的尾部是长长的光纤线,这些光纤线通向灵衢机柜,由光来负责机柜与机柜之间的互连。灵衢机柜内部则是OCS全光交换机。

简而言之,机柜内部采用电互连技术,而机柜与机柜之间则采用光互连技术。

与英伟达超节点相比,华为950超节点的独特之处在于Scale up内部的光互联技术。英伟达超节点Scale up内部主要由正交背板实现电互连,而华为则实现了Scale up的部分“以光代电”,提高了互联效率。

模型规模扩大,真正堵点并非算力

回溯三年前,大模型如同一辆加速的赛车,驶入了一场无法停歇的极限竞赛。彼时,超节点还不是一个被反复提及的名词。尽管模型已经开始加速膨胀,但无论是参数规模还是训练方式,都没有真正触碰到传统算力架构的天花板。然而,随着大模型以近乎垂直的指数曲线演进,从数十亿参数直奔万亿参数而去,牌局开始发生改变。

今年4月发布的DeepSeek V4采用了约1.6万亿参数的MoE(混合专家)架构,如此庞大的参数量意味着模型训练过程中已经不可能依赖单卡完成,而必须拆分到大量GPU或NPU上共同执行。问题不在于模型的大,而在于大带来的代价。

此前,一家超节点厂商工作人员向徽声在线记者举了一个生动的例子:如果把模型训练理解为很多人一起完成一道数学题,那么过去可能只有十几个人,每个人负责一部分内容,最后再汇总结果;而现在,更像是上千个人共同完成一本书,每写完一句,都需要彼此同步一次,再继续下一步。

计算可以并行,但同步无法省略。当GPU数量不断增加时,真正限制训练效率的已经不再只是计算能力,而是通信能力。此前一场展会上,华为超节点展区工作人员曾向记者解释,如果计算节点之间的带宽不足,在模型训练或者推理过程中,GPU(或NPU)很可能一直处于等待状态。当互联带宽提升之后,这种等待时间就会大幅缩短,算力利用率也随之提高。

于是,竞争的焦点发生了位移,从比拼计算能力变成了比拼连接紧密程度。互联成为了新的战场。芯片、交换机、光互联、散热、电源、软件调度等都开始成为决定最终性能的关键角色。从这个意义上说,超节点并不是某一种单独的新产品,而更像是一种新的基础设施形态。

模型越大,对超节点的需求就越强烈。壁仞科技AI框架架构副总裁丁云帆也提到,当前AI发展面临三大核心挑战:模型参数从千亿迈向数万亿、Agent等应用场景要求百万级上下文长度、推理和训练都需要成千上万张GPU协同工作。仅凭单张GPU的算力性能已经难以独立承载上述复杂任务。在此背景下,如何实现海量GPU高效协同运行,使之如同一台一体化超级计算机开展工作,正是超节点架构着力破解的核心难题。

清微智能研发副总裁李彬在接受徽声在线记者采访时表示,超节点技术本身并不是新技术,多年前就已经存在。“过去超节点没有热起来,是因为模型还不够大,模型能力和计算需求还不足以‘填满’整个超节点提供的算力供给。”他说,随着模型从百亿参数、千亿参数快速发展到万亿参数,大模型对集中式算力的需求快速提升,超节点才真正迎来了应用场景。

一个变革性的方案就像一艘巨轮,只有潮水足够高时,它才会浮起来。

从拼单卡到拼系统:技术路线的分野

当互联成为核心战场时,不同的技术路线便开始分野。而英伟达与国产厂商,恰恰站在了岔路口的两端。

作为当下全球商用超节点主流方案厂商,英伟达最早提出了超节点(SuperPod)的概念。其GB200、GB300 NVL72整机柜方案也成了行业对标的范本。然而,与国产厂商不断向384卡、4096卡迈进不同,英伟达目前的单柜规模仍停留在72张GPU左右。

为什么没有继续扩大规模呢?问题并不在GPU本身,而在互联技术上。英伟达目前主要依赖NVLink电互联技术完成GPU之间的数据交换,但电互联技术存在天生的距离限制:传输距离超过约一米时,损耗会明显增加,稳定性也会受到影响。因此,英伟达选择了一种相对集中的方案:在一个机柜内把通信效率做到极致。

国产超节点则是在逼仄的现实中走出了另一条路。

由于先进制程、HBM等核心环节受到限制,国产AI芯片在单点性能上追赶国际顶尖产品的道路注定崎岖。于是,一场思路的根本性转变发生了:不再执拗于让单颗芯片成为无敌的勇士,而是试图用系统工程的红利来弥补单点能力的不足。

华为是这条路的坚定践行者。通过Scale Up技术堆叠更多计算资源实现整体算力的跃升。与此同时,尝试用全光互联这根纽带完成机柜间的高速连接,以期打破距离魔咒、扩大超节点规模、让GPU的等待时间无限逼近于零。

互联的边界就是算力的边界。快思慢想研究院院长田丰认为:“华为超节点核心是万卡级昇腾NPU集群,配套灵衢高速互联、OCS全光交换、液冷、800G/1.6T光模块、高速算力交换机;节点内部(卡间)走灵衢UB总线+铜缆/短距光互联,节点之间(机柜间)用OCS全光交换机替代传统电交换机。”

不过,田丰也指出:“OCS目前仍有MEMS、液晶、压电、硅波导四条技术路线并行发展,每条路线的延迟、带宽、切换速度各有不同。毫秒级切换的MEMS满足AI集群的Flow(数据流)级流量调度需求,但对突发性通信的适应仍不如电交换灵活。这个技术鸿沟如何填补是产业当前的待解题。”

李彬则认为,美国长期限制先进工艺出口加之摩尔定律逐渐逼近极限,仅依赖制程升级已经越来越难实现算力的大幅提升。因此未来提升性价比更重要的是架构创新而不是继续在线宽上竞争。

不过无论是强调通信能力还是系统集成,在单卡性能短期难以平视对手的背景下,通过系统设计、通信架构、集群组织方式的创新依然能打开优化的空间。

超节点为何尚未成为大模型标配?

尽管越来越多厂商把超节点视为推理时代的核心基础设施,无论是PD分离、LPU(语言处理单元)还是算力池化、光互联等技术,其最终目标都指向同一个方向:降低用户等待第一个Token(词元)的时间。

这也是为什么DeepSeek将未来服务价格下降与昇腾950超节点量产联系在一起。4月DeepSeek在发布V4预览版时提到:受限于高端算力供给,Pro服务吞吐能力仍然有限。预计随着昇腾950超节点批量上市相关服务价格将进一步下降。

对于大模型厂商而言真正决定商业化能力的不只是模型性能还有每生成一个Token需要付出多少成本。

尽管产业热度不断升温但超节点距离大规模接管训练任务仍有一段路要走。

李彬认为未来算力成本下降将来自两个维度:一是模型算法不断优化使得同样智能水平的模型成本越来越低;二是芯片和系统架构持续提升效率让同样硬件能够完成更多任务。

这是超节点试图回答的核心问题:在模型能力持续提升的情况下如何用更低的成本把越来越集中的算力需求组织起来。

当然超节点还没有解决所有问题。

训练效率仍需进一步验证;软件生态仍在建设之中;开发者的迁移成本则像无形的阻力拖慢变革的脚步;不同技术路线之间也还远未到胜负分晓的时刻。

但有一点已经越来越清晰:未来的AI竞争正在从单颗芯片的竞争演变为整个系统工程能力的竞争。

对于整个产业而言超节点或许不会直接决定最终胜负但它正在改变竞争的方式。这场竞争已经不再只是关于一张芯片而是关于如何让成千上万张芯片真正像一张芯片那样工作。

又回到最初的问题:一千个人一起做一道数学题如果每计算一步一千个人都必须停下来等待所有人都完成计算、对完答案再继续下一步那么人数越多等待彼此的时间反而越长。

数量在某些时刻可能变成效率的敌人而在超节点这场战役中组织的艺术正在尝试让计算的轰鸣声吞没等待的沉默。

    责任编辑:
    德媒曝勒沃库森加入伊劳拉争夺战 水晶宫面临强劲对手

    2026-05-23

    英国《电讯报》披露勒沃库森正接触伯恩茅斯主帅伊劳拉,这位西班牙教头同时受到水晶宫追捧,德甲劲旅或后来居上完成截胡。 ... [详细]

    当F1车手邂逅世界杯贴纸:跨界创意引发热议

    2026-05-21

    2026美加墨世界杯临近,帕尼尼推出史上最大规模世界杯贴纸系列。F1车迷创意跨界,将热门车手融入世界杯贴纸设计,引发广泛关注。五星体育抖音商城热销中,不容错过! ... [详细]

    世界杯D组深度解析:技术流与身体流的终极对决

    2026-06-04

    世界杯D组呈现技术流与身体流的鲜明对比,土耳其技术优势明显,美国东道主身份成X因素,巴拉圭南美风格或成奇兵,澳大利亚身体流难敌强敌 ... [详细]

    英超财务危机全面爆发:亏损暴增600%背后的三大致命伤

    2026-07-09

    德勤报告揭示英超2024-25赛季创纪录亏损,转会市场失控、债务攀升、联赛分配失衡成三大主因,独立监管机构或成破局关键。 ... [详细]

    卡塞米罗深情告别曼联:离队后将成为球队忠实球迷

    2026-04-13

    卡塞米罗即将告别曼联,他深情表示最怀念球迷们的无条件支持,并承诺离队后将成为球队忠实球迷。 ... [详细]

    图酷

    图说天下

    资讯排行

    首页 - 娱乐圈事 - 体育圈事 - 两性情感 - 星座命运 - 奇闻怪事 - 历史故事 - 科技资讯 - 图说天下 - 知识百科 - 图酷 - 娱乐八卦 - 开云体育登录_官网入口_安全便捷 - 乐鱼体育_乐鱼APP_体育赛事_在线娱乐平台
    电脑版 | 移动端
    Copyright © 2002-2019 徽声在线 版权所有
    删帖请联系邮箱:[email protected]