讲师中心 微信公众号
AI工具推荐 视频效率加速

WAIC观察:“大家伙”集体登场,超节点何以成为国产算力下一张底牌?

风萱吖_9918

风萱吖_9918

发布时间:2026-07-22 08:57:36

|

352人浏览过

|

来源于php中文网

原创

“这里面到底装了多少张gpu?”“为什么要做这么大的机柜?”在今年世界人工智能大会(waic 2026)主展区——上海世博展览馆内,几排高达两到三米、通体漆黑的机柜前始终围满了观众。

有人凑近细看液冷管道的走向,有人举起手机拍摄机柜顶部盘绕如蛛网般的高速线缆,还有人紧追展台工作人员追问:这一整柜的算力,究竟能干些什么?

华为Atlas 950 SuperPoD、中兴OEX、阿里云真武M890×磐久AL128……基础设施类产品极少能在展会上成为焦点,但超节点却成了例外。

四天展期里,《IT时报》记者走遍全场,深入采访多家已布局超节点的芯片与设备厂商,试图厘清一个核心问题:这个一年前还仅在少数企业内部流传的新概念,为何突然跃升为全行业的共同战略选择?

目标一致,路径各异

若说去年WAIC上,超节点尚属个别企业的前沿探索;那么今年,它已演变为国产算力阵营的集体行动纲领。

从华为、壁仞、燧原、中兴通讯、沐曦股份,到中科曙光、阿里云、百度智能云,几乎所有主流国产算力厂商都将超节点置于展台最核心位置。这也印证了WAIC释放出的关键信号:全球AI竞争主战场正加速向底层基础设施迁移,而超节点,正是支撑未来AI发展的关键底座。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

WAIC观察:“大家伙”集体登场,超节点何以成为国产算力下一张底牌?

方向虽同,技术路径却各不相同。

华为坚持一体化集成路线。本次首次公开亮相的昇腾950超节点(Atlas 950 SuperPoD),由1024张计算卡构成,配备256TB统一内存,NPU端到端时延压缩至3微秒以内;借助统一内存编址技术,千余张计算卡可协同运作,宛如一台巨型单机。

WAIC观察:“大家伙”集体登场,超节点何以成为国产算力下一张底牌?

《IT时报》记者在展场看到,整套系统几乎占据整面墙体,远观如一道沉稳厚重的“黑色算力墙”。而1024卡,只是起点。据现场工程师介绍,昇腾950超节点最高支持8192颗芯片互联,未来甚至有望扩展至超50万卡规模的超大规模集群。

相较华为的封闭集成,中兴则选择了更开放的架构策略。其OEX平台兼容CPU、GPU、交换芯片、智能网卡等多种异构硬件,联合壁仞科技、沐曦股份、燧原科技、天数智芯等国产芯片力量,共建可插拔、可组合、可演进的国产超节点生态底座,让用户能依据业务特性灵活配置芯片组合,在性能与成本之间实现最优平衡。

WAIC观察:“大家伙”集体登场,超节点何以成为国产算力下一张底牌?

壁仞科技则聚焦于互联能力突破。依托自研BLink2.0互连协议,1024张GPU可共享同一内存空间,形成一个逻辑上统一调度的“超级GPU”,从而支撑更大规模模型的训练与推理任务。同时,该公司首次提出“NPO光互连+分布式解耦架构”,旨在突破传统铜缆在带宽密度、传输时延与物理距离上的多重瓶颈。

当AI重心从训练逐步转向推理,TPU正悄然成为超节点赛道中的另一支主力。

作为国内TPU代表厂商,中昊芯英此次正式发布新一代“须臾”AI芯片:混合精度浮点算力达896TFLOPS,8-bit推理峰值达1792TOPS;相比同档竞品,“须臾”单芯片功耗降低约50%。

凭借TPU原生面向AI负载优化的架构设计,单个超节点最高支持2048颗芯片直连,可高效承载万亿参数大模型训练、多智能体协同决策及海量并发推理任务。

中昊芯英创始人杨龚轶凡向《IT时报》记者表示:“GPU脱胎于图形渲染场景,其底层架构并非为大规模神经网络并行计算而生,在芯片级互联方面天然存在局限;而TPU从诞生之初就围绕大模型训练与高密度神经计算构建,因此更契合超节点所需的高带宽、低时延、强扩展性,也更容易迈向万卡级集群。”

除芯片厂商外,云服务商亦将超节点视为AI时代新型基础设施的核心单元。阿里云展出由真武M890芯片与磐久AL128超节点组成的端到端算力系统:真武M890基于平头哥自研并行计算架构,集成144GB高带宽显存,片间互联带宽高达800GB/s,全面适配大模型训练、推理及智能体应用等多元场景。

百度则展示基于昆仑芯P800打造的天池算力矩阵,支持256卡超节点,并具备向数十万卡集群持续扩展的能力,全面兼容文心、DeepSeek、智谱、MiniMax等主流开源与闭源大模型。

WAIC观察:“大家伙”集体登场,超节点何以成为国产算力下一张底牌?

尽管方案百花齐放,但WAIC 2026传递的信息已然明确:国产算力竞争的主战场,已从单芯片性能比拼,全面转向整套计算系统的综合能力较量。

模型演进,“倒逼”超节点落地

为何今年所有玩家都押注超节点?答案不在展馆,而在模型本身。

“超节点并非凭空出现的概念,而是大模型发展到当前阶段的必然产物。”壁仞科技AI框架副总裁、AI软件首席架构师丁云帆在接受《IT时报》等媒体采访时指出。

在全球大模型以季度为单位快速迭代的节奏下,国产算力的竞争范式正在重构。受限于先进制程工艺,当前国产GPU在单芯片算力层面仍与国际领先水平存在3至5年的代际差距,短期内依靠单点突破实现反超并不现实。

与此同时,Agentic AI浪潮席卷而来,大模型呈现三大结构性变化,每一项都在强力驱动超节点走向规模化部署。

第一是MoE(专家混合)架构普及叠加Agent技术爆发。过去的大模型更像一个整体黑箱,每次推理均需调用全部参数;如今越来越多模型采用MoE结构,按需激活不同“专家”子网络。虽然计算效率提升,但GPU间的通信频次与数据量呈指数级增长。“专家并行对互联带宽要求极高,一旦通信链路跟不上,再强的芯片也会被‘锁死’。”丁云帆强调。

Unified LLM Gateway - One API for 70+ AI models. Route to GPT, Claude, Gemini, Qwen, Deepseek, Grok and more
Unified LLM Gateway - One API for 70+ AI models. Route to GPT, Claude, Gemini, Qwen, Deepseek, Grok and more

统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。

下载

第二是模型参数持续膨胀。千亿级曾是大模型门槛,如今万亿级已成为新基准。7月16日发布的Kimi K3,参数规模达2.8万亿,刷新全球开源模型纪录。业内普遍预测,未来几年5万亿参数模型或将陆续登场,对单一集群的算力吞吐能力提出更高要求。

第三是上下文长度不断拉长。代码Agent、科研Agent等新型智能体应用兴起,单次任务需处理的Token数量成倍增加——输入的文档、输出的代码层层叠加,对显存容量与实时算力的需求较以往高出一个数量级。

一边是单芯片性能提升遭遇物理天花板,一边是用户对模型能力的期待持续攀升,超节点由此从“可选项”变为“必选项”。

光互连,2028年或成标配

然而,当算力衡量标准从单芯片峰值转向系统级有效算力时,真正的挑战,深藏于机柜内部。

1024张GPU组成超节点后,决定其真实效能上限的,不再是某颗芯片跑得多快,而是互联带宽、网络拓扑、软件调度与系统协同能力。换言之,能否把一堆芯片真正捏合成一个高效运转的整体,比每颗芯片快多少更为关键。

但这同时也意味着系统构建难度呈指数级上升——尤其当GPU数量从百级跃升至千级、万级时,通信瓶颈成为最大拦路虎。

过去几十年,GPU间主要依赖铜缆传输电信号。但随着800G、1.6T高速互联时代到来,电信号传输距离急剧缩短、功耗持续攀升,铜互连正逼近物理极限。“铜缆已难以支撑下一代超节点需求。”一位现场技术人员坦言。

破局之道,在于“以光代电”。当前光互连主要有四大技术路径:传统可插拔(FRO)、线性直驱(LPO)、近封装光学(NPO)和共封装光学(CPO)。

丁云帆透露,今年以来产业界关注焦点已明显从相对成熟的FRO与LPO,转向更具前瞻性的NPO与CPO,其中NPO正成为产业链协同攻关的核心方向。

相较于传统光模块,NPO将光引擎部署在GPU或交换芯片附近,大幅压缩电信号传输路径,省去高功耗DSP芯片,在带宽、时延、功耗与成本之间取得更优平衡,且传输距离可拓展至数百米,更契合未来超大规模超节点部署需求。

据集邦咨询预测,CPO/NPO市场规模将从2025年的约1亿美元,飙升至2030年的390亿美元以上——五年内增长近400倍,阿里巴巴、腾讯等头部企业已将NPO列为近中期重点部署方向。

因此,本届WAIC上,《IT时报》记者明显感受到:无论是光模块厂商、交换机厂商,还是其他上下游伙伴,纷纷亮出NPO相关产品、解决方案,或至少明确公布技术演进路线。尽管多数仍处于研发或样机阶段,但整个产业已进入协同推进的关键期。

丁云帆认为,从技术角度看,国内已具备NPO产品研发的基础能力,不存在不可逾越的技术壁垒。真正需要的是时间沉淀与工程验证,预计未来一到两年内,相关产品将陆续推出并进入实际场景测试。

但在CPO领域,国内布局者仍属少数。

一方面,CPO需将光引擎直接集成至计算芯片内部,对芯片设计、先进封装、制程工艺等提出极高要求,技术复杂度远超NPO;目前部分先进工艺环节,国内与国际领先水平仍有差距。

另一方面,涉及产业分工重构。若效仿英伟达模式,将计算与光互连完全集成于一颗芯片,原本属于光模块厂商的价值空间将被芯片厂商吸收,引发产业链利益再分配。

中国现阶段更适合走生态共建之路。”丁云帆指出,在NPO架构下,GPU厂商、交换机厂商、光模块厂商等均可发挥各自优势,在产业链中找准定位,共享产业发展红利,从而构建更健康、更具韧性的国产AI算力生态。

当前行业整体仍处于技术攻坚与样机验证阶段。壁仞科技计划于明年推出基于NPO的超节点产品,并逐步投入真实生产环境运行。随着产业链日趋成熟,预计至2028年前后,NPO光互连有望成为AI超节点的主流连接方案。

规模化落地,中国步伐更快

如果说通信与光互连是超节点的“筋骨”,那么决定其能走多远的,是另一个高频词——工程化。本届WAIC上,无论智能体工厂、大模型厂商,还是AI for Science科研平台,被问及最大挑战时,“系统工程”几乎成为统一答案。

杨龚轶凡举例说明:当海量芯片组成统一集群,并需同时承载多家客户业务时,如何降低分布式计算过程中的通信开销,是超节点必须攻克的核心难题;此外,多租户场景下的数据隔离与隐私保障、万卡集群带来的散热压力,以及分布式调度、集群运维、故障自愈等软件能力,同样亟待同步突破。

“超节点之争,本质是一场全产业链协同之战。”杨龚轶凡表示。决定超节点上限的,不只是芯片本身的性能,更取决于网络互联、散热系统、软件调度等系统级能力,以及上下游厂商的协同深度。封装、交换机、光模块、液冷、服务器、调度中间件……这些过去分散在不同环节的技术,如今因超节点被前所未有地紧密耦合在一起。

耐人寻味的是,在丁云帆看来,超节点规模化扩展的速度,国内甚至快于海外。正因单卡算力存在客观差距,国内产业界才更迫切地寻求系统级创新来弥补短板。这并非一次孤立的技术跃迁,而是一场覆盖全链条的体系化突围。

这也是杨龚轶凡坚定选择TPU路线的重要原因:作为专用AI架构,TPU所需适配的算子数量远少于通用GPU,使本土厂商有机会在特定垂直领域快速追赶,走出一条“换道超车”的可行路径。

四天展会落幕,这些沉默矗立的黑色“算力墙”,已被无数观众存入手机相册。或许多年之后回望,这些影像将成为中国AI发展历程中,一段珍贵而坚实的起点。

图片/ IT时报

本文来自微信公众号 “IT时报”(ID:vittimes),作者:贾天荣,36氪经授权发布。

热门AI工具

更多
墨刀AI
墨刀AI Hot

一款AI图像与设计工具,主要用于产品经理的专属智能体,适合需要提升相关任务效率的用户。

超级简历WonderCV

一款AI办公效率工具,主要用于免费求职简历模版下载制作,应届生职场人必备简历制作神器,适合需要提升相关任务效率的用户。

火山引擎

火山引擎是一款面向企业的云计算与AI服务平台。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

Loomy
Loomy Hot

一款AI工具,主要用于科大讯飞发布的桌面级 AI 助理,比 OpenClaw 更易用、更安全!,适合需要提升相关任务效率的用户。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

立刻MV
立刻MV Hot

立刻MV是一款AI文本写作工具,AI 音乐视频(MV)创作工具。

讯飞绘文

讯飞绘文是一款由科大讯飞推出的一站式 AIGC 内容运营平台。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

相关专题

更多
Vibeknow在线使用入口合集
Vibeknow在线使用入口合集

本专题汇总了Vibeknow在线创作视频的官方入口及网页版使用教程,涵盖PPT、PDF、Word等文档一键转讲解视频的核心操作,并整理了免费版水印规则与手机端浏览器访问指南,助你快速将知识内容视频化。

0

2026.09.21

NumPy随机数文件读写与dtype数据类型
NumPy随机数文件读写与dtype数据类型

本专题整理 NumPy 随机数、文件读写与 dtype 数据类型相关教程,覆盖 Generator/random、随机数种子、正态分布采样、npy/npz/CSV/TXT 保存读取、loadtxt/savetxt、memmap、大文件处理、astype 类型转换、结构化 dtype、整数溢出和精度丢失等场景。

0

2026.09.21

NumPy矩阵运算与线性代数计算
NumPy矩阵运算与线性代数计算

本专题整理 NumPy 矩阵运算与线性代数计算相关教程,覆盖矩阵乘法、dot 与 @ 运算符、逆矩阵、行列式、特征值与特征向量、SVD、线性方程组、欧氏距离、矩阵分解和大规模矩阵性能优化等内容,帮助读者掌握 np.linalg 与矩阵计算实战。

0

2026.09.21

NumPy广播机制数学运算与统计分析
NumPy广播机制数学运算与统计分析

本专题整理 NumPy 广播机制、数组数学运算与统计分析相关教程,覆盖广播规则、维度对齐、矩阵与数组加减除法、向量化计算、均值方差、分位数、中位数、直方图和 unique 频次统计等场景,帮助读者掌握 ndarray 高效计算与统计处理方法。

0

2026.09.21

NumPy数组创建索引切片与数据选择
NumPy数组创建索引切片与数据选择

本专题整理 NumPy 数组创建、索引、切片与数据选择相关教程,覆盖 np.array、zeros/ones、多维数组形状、基础切片、花式索引、布尔索引、条件筛选、视图与副本等常用场景,帮助读者系统掌握 ndarray 数据构造与高效提取方法。

0

2026.09.21

Aionclaw智能助手介绍
Aionclaw智能助手介绍

本专题汇总了AionClaw(AI龙虾助手)的功能介绍与在线使用入口。AionClaw是杭州趣猿人工智能有限公司推出的桌面级AI智能体,能直接在电脑上读写文件、运行脚本、操作浏览器,自动交付Word、PPT、Excel等成品。

20

2026.09.20

AionClaw AI智能体与电脑自动化任务执行功能使用教程
AionClaw AI智能体与电脑自动化任务执行功能使用教程

AionClaw专题整理AI智能体与电脑自动化相关功能使用教程,涵盖安装部署、AI任务执行、Skills技能、文件处理、浏览器控制、电脑操作、持久记忆、聊天工具连接以及办公、编程和内容创作等功能,帮助用户快速掌握AionClaw的实际使用方法。

0

2026.09.20

AI视频生成软件推荐
AI视频生成软件推荐

本专题汇总了当前主流的AI视频生成软件推荐与排行榜单,涵盖seko、AniShort、剧云、Lovart、LiblibAI及立刻mv等热门工具。同时整理了各软件在文生视频、图生视频、时长限制、画质表现及免费额度等方面的差异对比,助您快速选对适合创作需求的AI视频生成工具。

200

2026.09.16

ai生成视频的工具免费版合集
ai生成视频的工具免费版合集

本专题汇总了当前免费AI生成视频工具的排行榜与推荐清单,涵盖seko、讯飞智作、AniShort及剧云、Lovart等多模型集成平台。同时整理了各工具的免费额度、输出时长、水印政策及适用场景差异,助您快速选择合适工具开启AI视频创作。

100

2026.09.16

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
腾讯元宝使用手册
腾讯元宝使用手册

共0课时 | 0人学习

DeepSeek手册
DeepSeek手册

共0课时 | 0人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn