经观App

理性 建设性
打开

国产超节点商业化大幕拉开

原创郑晨烨

2026-07-25 16:33:56

国产超节点的技术可行性在过去两年间基本得到了验证,而商业模式的分化才刚刚开始。

经济观察报记者 郑晨烨

在7月17日至20日举行的2026世界人工智能大会(WAIC)上,超节点成为全场焦点。据记者不完全梳理,超过20家企业发布了与超节点相关的产品或方案。

早在2025年9月的华为全联接大会上,昇腾Atlas950超节点首次发布,但当时外界只看到了产品参数和渲染图,真机并未露面。此后近一年,950超节点的实际性能表现、量产进度是否如期推进等,一直是关注国产算力的投资人和产业人士追问的焦点。

“贵百分之一百无所谓,贵百分之两百都无所谓。”

今年7月,一份DeepSeek创始人梁文锋在两个月前举办的投资者交流会上发言的录音文字稿开始在投资圈流传。在这份近四小时的交流记录中,梁文锋谈到华为超节点与英伟达产品的价格差距时作出了上述表态。

梁文锋还就DeepSeek的开源策略、AGI(通用人工智能)技术路线图、API(应用程序接口,外部用户调用AI模型能力的技术通道)定价逻辑以及中美算力差距和国产芯片替代前景等话题发表了看法,其中关于国产算力的评价在网络上引发了广泛讨论。

一位接近DeepSeek投资方的知情人士向经济观察报记者确认了该文字稿的真实性。7月24日,记者亦通过电话和邮件的方式就这份录音文字稿的真实性向DeepSeek方面进行求证,但截至发稿未获回应。

按照梁文锋的说法,华为950超节点在任务层面可以平替英伟达GB200NVL72等同类超节点系统,所有后者能做的任务前者都能做,时延表现一致,代价是4张华为卡的算力约相当于1张英伟达卡,在芯片迭代节奏上落后约两年。

超节点是近年国产算力领域最受关注的产品方向。它通过专用高速总线将数十颗乃至数千颗、数万颗AI芯片连成紧密协同的计算系统,芯片之间的通信带宽可达每秒数百GB乃至TB级、时延低至纳秒级别,使得整柜甚至多柜机器在软件层面表现得如同一台超级计算机。和传统的服务器集群用网线把多台机器连起来相比,超节点内部芯片之间的通信速度接近芯片内部水平,使众多张卡可像一张卡一样协同工作。

随着大模型参数从千亿走向万亿乃至十万亿,传统8卡服务器(一台机器装8颗AI芯片)已无法满足训练和推理的通信需求,超节点成为各家算力厂商的必选项。

从华为已商用超过750套的昇腾384超节点,到今年第四季度计划上市的Atlas950(最大可支持8192卡满配),再到中科曙光刚刚落成的十万卡曙光8000超集群,国产厂商已经回答了顶尖算力产品有没有国产替代方案的问题。

梁文锋作为国内头部大模型公司创始人公开给出“可以平替”的评价,也在一定程度上打消了市场对国产超节点实际可用性的疑虑。但国产超节点的商业模式怎么落地,这个问题才刚刚浮出水面。

此前超节点几乎都以整柜硬件的形式交付给客户,一套系统少则数千万元、多则数亿元,客户需要自己建机房、自己运维,只有大型互联网企业、电信运营商和国家级智算中心才部署得起。

但这个局面正在改变。7月23日,阿里云宣布灵骏真武M890超节点云上算力单元成功适配2.4万亿参数的Qwen3.8模型,并上线百炼平台提供推理服务。

由此,M890成为国内首个在公共云(面向所有用户开放、按需付费的云计算平台,区别于企业自建的私有云)上稳定运行超两万亿参数大模型的超节点产品。用户不用自己购买硬件,在阿里云控制台申请一个64卡全互联的云上算力单元,按小时付费,每小时120元,用完即释放。

同一时期,中科曙光(603019.SH)自己运营的十万卡集群接入国家超算互联网按使用量向全国用户收费;华为云宣布从卖云服务器全面转向按词元(Token)计费。

记者在采访过程中了解到,国产超节点的技术可行性在过去两年间基本得到了验证,而商业模式的分化才刚刚开始,超节点的交付方式正在从单一的整柜硬件销售裂变为多条路径——卖整柜、卖算力、卖词元,不同体量的客户开始有了不同的选择。

从“造出来”到“用起来”

WAIC期间,昇腾Atlas950超节点这款备受期待的产品终于以真机形态首次展出,成为全场关注度最高的展品之一。

记者从华为相关负责人处了解到,现场展出的1024卡版本以单柜64卡为基本单元,可提供1EFLOPS(每秒百亿亿次浮点运算)的FP8(一种AI计算常用的低精度数据格式)算力,配备256TB全局统一内存,芯片之间的往返通信时延低至3微秒。华为还为这套系统自研了名为灵衢2.0的互联协议,把跨卡通信时延从传统网络的2微秒级降至200纳秒级,相当于让上千张卡用同一种“语言”实时对话。另外,满配8192卡的版本计划今年四季度批量上市,华为相关负责人称已有多家头部客户完成锁单。

根据华为相关负责人的介绍,昇腾384超节点是目前国内唯一训练出SOTA(当前最优)模型的超节点,目前已在全球商用超过750套,覆盖互联网、运营商、金融、教育、医疗等行业。

华为还同期展出了Atlas850E风冷超节点,采用自研VCE(蒸汽腔均热)相变散热技术,可在标准风冷机房里直接部署,无需液冷改造,主要面向推理场景,为没有液冷条件的企业降低了部署门槛。

中科曙光要验证的是另一个维度的问题——当国产芯片的规模从千卡扩展到十万卡,系统还能不能长期稳定运行?

7月10日,曙光8000(登峰)十万卡超集群在郑州落成运行,同步接入国家超算互联网,成为中国首个全国产十万卡AI超集群。这套系统搭载海光信息(688041.SH)的DCU芯片,配合曙光自研的高速互连网络。

中科曙光高端计算总工程师卜景德告诉经济观察报记者,从万卡到十万卡不是简单增加机器,十万卡系统瞬间启动时对电网的功耗冲击远超万卡,整个系统有30亿个部件,任何一个微小的波动都会影响全局稳定性,网络故障恢复必须做到秒级。

散热同样是工程难题。中科曙光副总裁曹振南介绍,曙光8000采用三层循环冷却方案,最内层用特殊液体蒸发带走芯片热量,最外层直接接入郑州当地湖水进行自然散热,整套主机系统不需要传统空调,PUE(一种衡量数据中心能源利用效率的指标,数值越接近1说明能源浪费越少)控制在极低水平。

根据中科曙光方面的介绍,上线首周,曙光8000即满负载运行,日均处理作业超过15万个,峰值突破50万个。如果将这些算力全部用于大模型推理,可以同时支撑超过百万人向AI提问,并实时获得回复。

在接受记者采访时,中国计算机学会(CCF)高性能计算专委会秘书长谭光明亦提到,曙光8000对AIforSci-ence(用AI做科学研究)的价值尤为突出,它为国内的超智融合研究提供了一个此前不具备的大规模真实验证平台。

在华为和曙光两家头部厂商之外,超节点的热度在整个产业链上蔓延。根据记者的不完全统计,本届WAIC上超过20家企业发布了超节点相关方案。

比如,中兴通讯(000063.SZ)联合壁仞科技、沐曦股份(688802.SH)、燧原科技、天数智芯等多家国产GPU厂商推出了支持多芯片混插的Matrix超节点;紫光股份(000938.SZ)旗下新华三(主营企业级IT基础设施)发布了可从32卡灵活扩展至16384卡的UniPoDS80000系列;沐曦股份则发布了以64卡为基本规格的曦景S600。

综合以上情况可以发现,围绕超节点有三条技术路线正在形成:以华为为代表的全栈自研路线,从芯片到互联协议到软件栈全部基于华为自研;以中兴、新华三为代表的兼容路线,支持多家厂商的GPU混插部署;沐曦、燧原等芯片厂商联合整机厂走的联合创新路线。

不只是硬件在推进,软件生态的验证也在同步展开。

摩尔线程(688795.SH)创始人张建中在WAIC分论坛上提出了“词元时代”的概念框架,并将算力基础设施划分为模型训练工厂、词元生产工厂和智能体生产工厂三类。

根据张建中的介绍,摩尔线程已在基于自研GPU芯片MTTS5000搭建的万卡集群上,从零开始完成了一个2360亿参数MoE(混合专家,一种让大模型只激活部分参数来提升效率的架构)模型的完整训练,训练质量可对标国际主流水平。

这亦是国产GPU厂商首次公开展示如此规模的模型训练实践成果,一定程度上回应了市场对国产芯片能否训出大模型的疑虑。

在本届WAIC期间,鹏城实验室和全球计算联盟联合发布《超节点定义与实践白皮书》,首次给出了超节点的正式定义,即物理上由多个计算节点通过高效互联协议紧密连接组成,具备跨物理节点的统一内存编址能力,逻辑上具备“一台计算机”特征的计算系统。

白皮书同时明确了超节点的三大核心技术特征,分别是内存语义互联、统一内存编址、超低时延超大带宽。其中,“统一内存编址”被视为判断一个系统是否属于真正超节点的关键门槛——只有所有芯片能像共享同一块内存一样读写数据,才能消除芯片间的通信瓶颈,否则系统规模再大,计算效率也上不去。白皮书提出,未来两到三年,全球AI基础设施竞争的主线将从单颗芯片的性能比拼升级为系统级工程能力的竞争。

梁文锋对国产超节点生态的看法比行业共识更为积极。在前述投资者交流会上,他表示,DeepSeek训练V3模型时已几乎不依赖英伟达的软件生态,而是基于自研的TileLang高级编译器完成了全部工作。

在他看来,英伟达CUDA软件生态的护城河正在被快速瓦解,原因有三个:AI本身可以写代码来重建生态,TileLang等高级编译语言大幅降低了开发门槛,GPU从游戏卡衍生的架构耦合正在被解绑。

“国产AI芯片的硬件和生态都已没有根本性障碍,唯一的瓶颈是产能。”梁文锋在上述投资者交流会上还透露,华为目前给DeepSeek的产能约为1.6万张卡,互联网大厂则是十几万张。

梁文锋同时还将中国与美国在AI领域的差距概括为“落后一到两年,只用它二十分之一的算力”。在他看来,这个差距主要由算力资源的不对等造成,而非人才或技术路线的差异。

三条路径卖算力

超节点不只是AI芯片的简单堆叠,一套完整的系统还包括高速交换网络、液冷散热、高压供电以及将这些部件集成到整柜中的系统工程。

以英伟达为参照,其上一代GB200NVL72(英伟达2024年推出的72卡整柜超节点)售价约300万美元(约合人民币2100万元),今年量产的新一代VeraRubinNVL72单柜物料成本进一步攀升至780万美元。

国产超节点没有公开的标准售价,但中国移动今年的集采提供了一个参照——776套超节点计算节点设备,5家厂商的报价均在20亿元以上。不过,中国移动采购的是384卡规格的计算节点,并非整柜系统,实际部署时还需要配套交换柜、光模块和液冷基础设施,一个完整的384卡超节点落地总成本远高于此。

对于电信运营商和互联网大厂来说,这是可以承受的基础设施投入,但AI算力的客户远不止这些大买家。高校实验室、AI创业公司、中小开发团队同样需要顶级算力,只是用量有限,也承担不起高额的一次性投入。

这种需求规模的落差,正在推动超节点的交付方式分化为至少三条路径,既面向不同体量的客户,也对应不同的盈利逻辑。

第一条路径是卖整柜硬件。

华为昇腾超节点目前主要采用这种模式,以整柜形式交付给客户,客户在自己的数据中心部署运营。买家主要是三大电信运营商、大型互联网企业和国家级智算中心。这些机构有机房、有运维团队、有持续的算力需求,买硬件自建是最经济的选择。

比如,中国移动今年3月启动的超节点集中采购,是目前公开信息中规模最大的单笔超节点订单,也是三大电信运营商在集团层面首次大规模采购超节点设备。此次集采共涉及776套超节点计算节点设备和6208张AI加速卡,全量锁定华为CANN(昇腾计算架构)生态。根据中标候选人公示,河南昆仑、长江计算、华鲲振宇、宝德计算机、华启智慧5家厂商入围,报价集中在20.59亿至20.70亿元之间,最高与最低仅差0.11亿元。

一位长期关注国产算力领域的投资人告诉记者,这种极度接近的报价反映出硬件环节的利润已经被压得很薄,但首期硬件交付并不是这种模式利润的主要来源。超节点把液冷散热、高速交换、电源管理等模块整合进了交付范围,后续的系统扩容、维保和驻场服务的毛利率通常在40%以上,远高于首期硬件。

公开信息显示,三大电信运营商2026年算力资本开支合计超过800亿元,其中中国移动算力网络投资378亿元,同比增长62.4%。

值得一提的是,梁文锋在前述交流中也透露,DeepSeek的算力集群全部是自建的,买卡的投资回报远高于资金留在账上。“我把钱变成卡,十个月就能收回成本,肯定是能买到多少就买多少。”梁文锋说。

第二条路径是自建自运营。

曙光8000走的就是这条路,十万卡集群不是卖给某个特定客户的,是中科曙光自己运营的。这种模式依托国家超算互联网运行。超算互联网是科技部推动建设的一张全国性算力调度网络,目标是把全国30多个超算中心和智算中心连起来,让用户在平台上下单就能按需使用算力,不用关心算力来自哪个物理机房。

今年7月13日,超算互联网在郑州上线了核心节点,定位为全国算力的中央调度枢纽。平台注册用户目前已突破140万,采用“普惠+市场”双轨定价,科研用户注册即可获得免费算力额度,商业客户按市场价计费。

记者从中科曙光方面了解到,曙光8000在郑州落成后直接接入了这张网络,面向全国科研机构和企业提供算力服务,定价从每卡时(一张AI芯片运行一小时的计费单位)1.2元到3.5元不等,科研机构可享受最高50%的普惠补贴,补贴后最低每卡时不到1元。上线首周,排队等待使用的算力需求已超过集群总规模的3倍。

这条路径的盈利逻辑和卖硬件截然不同。前述投资人指出,卖硬件是项目制收入,一台服务器卖出去就结束了,毛利率在20%左右,且受客户资本开支周期波动影响;运营算力是持续性收入,只要集群利用率保持在较高水平,综合毛利率可以做到40%以上。

中科曙光2025年年报显示,算力服务收入占比已从2023年的12%升至37%,成为增长最快的业务板块。

浙商证券计算机首席分析师刘雯蜀说,算力厂商如果能把盈利模式从一次性的硬件销售转向持续性的算力服务,就可以获得更持续的现金流。同时,集群运维托管、词元使用效率提升等增值服务也有望进一步拉高毛利率。

第三条路径是公共云。

阿里云M890超节点云上算力单元把超节点做成了按需取用的云服务,64卡全互联的云上算力单元每小时120元,平均每卡时不到2元,同时支持按任务包和按词元调用量计费。

阿里云弹性计算产品线负责人吴结生在WAIC期间表示,当一个万亿参数的大模型需要更高效的推理,当训练任务动辄横跨成百上千张卡,真正的答案是把芯片、服务器、网络、存储凝聚成一个整体,提供一台能训练、能推理、能被开箱即用的“AI超级计算机”。

在阿里云的设计中,用户不需要自己去买硬件、建机房,只需要在云平台上开通,就能直接获得一个超节点计算环境来跑大模型。

华为云也在朝类似方向演进。华为云CEO张平安此前曾公开表示,华为云已从卖云服务器的IaaS(基础设施即服务)模式全面转向卖词元的MaaS(模型即服务)模式。公开数据显示,华为云基于昇腾384超节点推出的CloudMatrix384(华为云超节点云服务的产品名称)每百万词元成本约为1.8元,在国产算力方案中具备较强的价格竞争力。

当然,上述几种路径之间也存在交叉互渗。比如,华为既通过整柜销售服务于运营商,又通过华为云的MaaS模式服务中小客户;曙光既自己运营算力集群,也向其他智算中心销售超节点硬件和整体解决方案。

或者说,不同路径面向不同客户形成了分层结构:大型运营商和互联网企业有机房、有团队、有持续需求,买整柜自建最经济;中型企业和科研机构算力需求波动较大,按需租用可以避免重资产投入和设备闲置;中小开发者在公共云上按小时付费,几百块钱就能用上此前只有大厂才能接触到的顶级算力,灵活方便。

向“训推一体的通用算力底座”演进

算力能不能持续高效运转,正在成为决定这个市场能否兑现商业回报的核心变量。

曙光8000上线首周满载是好消息,但并非所有智算中心都有这样的需求支撑。根据工信部7月20日在国新办新闻发布会上公布的数据,截至今年6月底,全国智能算力规模达2185EFLOPS,其中东部地区占比55.9%,西部地区占 32.6%,中部地区仅占10.6%。对此,一位长期关注算力领域的投资人告诉记者,东部智算中心普遍处于高负荷运行状态,而中西部部分智算中心建成后面临客户不足、利用率偏低的情况,算力越高端、密度越大,闲置的成本压力也越大。

智算中心的电费、运维、带宽、折旧等运营成本是刚性支出,集群规模越大每天的固定开销越高,利用率低于一定门槛就意味着持续亏损。尤其是对于刚刚转型为算力运营商的企业来说,如何在建成之后持续找到足够多的客户、维持足够高的利用率,是比技术更难回答的问题。

国家超算互联网正在尝试缓解这种供需的地理错配。

7月13日上线运行的郑州核心节点定位为全国算力的中央调度枢纽,用户不管在哪个城市,接入平台就能按需调用全国的算力资源。在采访过程中,记者了解到,预计2026年底,国家超算互联网年算力交易额就将突破100亿元。另外,落地了中央调度枢纽的河南省也在省级层面建立了算力券机制,每年发放总额不超过5000万元,以降低中小企业的用算成本。

从需求端看,新的应用场景也正在创造增量需求。

海光信息总裁助理兼智能计算产品部总经理杜夏威在接受记者采访时提到,AIAgent(智能体,能自主规划和执行复杂任务的AI系统)的兴起正在改变算力需求结构。过去AI主要用GPU做模型推理,CPU只起辅助调度作用,但Agent在执行一个复杂任务时,需要CPU完成任务编排、工具调用、缓存管理等大量工作,CPU和GPU的算力配比正从过去的1:8向1:1、甚至更高的方向变化。这意味着算力基础设施的需求不是在减少,而是在变得更加多元。

中科曙光AI行业首席工程师李冉亦认为,Agent时代的负载是长链路、高消耗的,要求计算、存储、网络、软件整体协同,曙光的应对方式是围绕超节点打造全链路推理加速方案,从底层算子库到上层模型部署做端到端的全链路优化。

在他看来,超节点正从“训练专用设施”向“训推一体的通用算力底座”演进,应用场景已从大模型训练扩展至推理、Agent、科学计算等更多领域。

工信部信息通信经济专家委员会委员盘和林对经济观察报记者表示,超节点与传统GPU算力集群的本质差异在于是否实现了内存统一编址与垂直扩展级互联。传统GPU算力集群采用横向扩展,时延高、带宽低,而超节点通过构建统一内存编址,时延可低至微秒级,带宽可达每秒TB级别,并可以直接访问跨节点资源。

“简单来说,超节点弥补了国产算力单芯片性能不足的短板,使我们追平全球先进算力水平成为可能。”盘和林说。

不过,在盘和林看来,国产超节点要真正大规模商用,还需要跨越两个障碍。一是生态适配,目前各厂商的超节点之间存在不同的连接协议,如何统一这些协议以充分发挥互联效率,同时针对 DeepSeekV4、Qwen、GLM等主流大模型完成适配并降低开发者的适配门槛、避免重复开发,仍是行业需要解答的问题;二是在提高系统可靠性的同时优化成本,千卡乃至万卡同时接入超节点可能导致系统整体稳定性下降,需要完善故障响应和自愈等配套机制,而算力成本的下降则有赖于节点规模化和单节点成本的持续压降,以此吸引更多AI大模型用户接入超节点网络。

国泰海通证券计算机首席分析师杨林告诉记者,算力竞争的核心范式已从“单卡峰值”转向“系统效率”,价值分配正从“卖卡”向“卖系统、卖能力”全面迁移,光互连、液冷、网络方案、系统集成与调度软件等环节将获得更高的价值权重。

根据华泰证券在相关研报中的测算,2028年中国超节点架构市场规模有望达到3414亿元,2026至2028年复合年均增长率为194%。

郑晨烨

深圳采访部记者 关注新能源、半导体、智能汽车等新产业领域, 有线索欢迎联系:zhengchenye@eeo.com.cn 微信:zcy096x

相关推荐

一位漫画家的AI对抗赛:月入5万元的祝耕夫,决定“摆摊”签绘

蛋白,下一个必争之地

海康威视上半年净利润增近四成 全年营收有望破千亿

免责声明:本文观点仅代表作者本人,供参考、交流,不构成任何建议。