(原标题:华为徐直军演讲干货炸裂:昇腾、超节点、鲲鹏、灵衢大公开)kai云体育app官方登录入口(中国)官方网站 IOS/安卓通用版/手机版
21世纪经济报谈记者倪雨晴 上海报谈
9月18日,华为全连合大会(HC 2025)拉开帷幕,华为副董事长、轮值董事长徐直军在50分钟的演讲中,苦处地详确公开了华为的AI算力邦畿。
(华为轮值董事长徐直军发表主题演讲,图源:华为)
围绕算力中枢,徐直军初次完满公布了昇腾芯片改日三年的迭代道路:从2026年一季度行将推出的Ascend 950系列,到2027年的Ascend 960,再到2028年的Ascend 970,险些以“一年一代算力翻倍”的速率激动。
他胪陈了950系列在低精度数据形式、向量算力、互联带宽以及自研HBM等方面的冲突,并明确芯片硬件执续演进、CANN编译器及Mind用具链全面开源、openPangu基础大模子怒放等四大承诺,以复兴产业界对昇腾生态的期待。
与此同期,Atlas 950、Atlas 960两款超节点家具的初次亮相,也让“万卡超节点,一台计较机”的构想从主张走向实践:8192卡的Atlas 950将于2026年四季度上市,其FP8算力达到8E FLOPS,互联带宽高达16PB/s,全面超越英伟达同期家具;而支执15488卡的Atlas 960更将在2027年把这一记载再次翻倍。
除了智算,华为还将超节点理念拓展至通用计较鸿沟。基于新一代鲲鹏950处理器的TaiShan 950超节点被奉求“斥逐大型机、袖珍机”的厚望,通过分散式GaussDB多写架构,可在无需数据库校正的情况下竣事性能2.9倍提高,告成对标传统数据库和高端行状器市集。
在连合鸿沟,撑执这一切的,是华为自研的“灵衢(UnifiedBus)”互联条约,它在光互联、带宽和时延上的系统性改换,使跨机柜、万卡级的高可靠算力协同成为可能,并已决定从2.0版块起向产业界怒放尺度,意在构建一个确实怒放的超节点生态。
从芯片、超节点到互联条约,从开源怒放到产业生态,华为在HC 2025上展示的不仅是一系列家具,更是一整套面向改日的AI基础步调计谋。算力的基础是芯片,而执续演进的昇腾道路图、怒放的软硬件生态和自研的超节点架构,正在为中国乃至全球AI算力的可执续发展奠定“硬核”根基。
以下为徐直军在华为全连合大会2025上的主题演讲全文:
女士们、先生们,列位老一又友、新一又友,大家上昼好!接待来参加2025年华为全连合大会,时隔一年,很舒坦再次与大家相聚在上海。我想大家齐能感受到,夙昔的一年对通盘AI从业者、关注者来讲是回首深远的一年,DeepSeek横空出世,让天下东谈主民过了一个快意的AI年,也让通盘大模子老练者开启了不知若干个不眠之夜,相易老练方式,复现DeepSeek阻抑,天然也给咱们带来了广阔冲击。从春节运转,到本年4月30日,经由多团队的协同作战,终于使Ascend 910B/910C的推理才智达成了客户的基本需求。
在参加今天的具体分享之前,请允许我转头一下旧年的HC,我讲到了如下几点:
第一、智能化的可执续,开首是算力的可执续;
第二、中国半导体制造工艺将在绝顶万古分处于过期现象;
第三、可执续的算力只可基于本色可获取的芯片制造工艺;
第四、东谈主工智能成为主导性算力需求,促使计较系统正在发生结构性变化;
第五、独创计较架构,打造“超节点+集群”算力科罚决策执续满足算力需求。
但第五点莫得张开讲,原来想讲,但我的团队不同意。今天,我想应用此契机,来把我旧年HC莫得完成的任务完成,也算是答卷。我今天分享的主题是:“以独创的超节点互联技能,引颈AI基础步调新范式”,亦然回答旧年HC提到的第五点:如何独创计较架构,打造 “超节点+集群”算力科罚决策来执续满足算力需求。
在张开今上帝题前,回到DeepSeek对产业界、对华为的冲击,DeepSeek开源后,咱们的客户对华为的昇腾发展指出了许多问题,也充满了期待,并一直在给咱们不停地提建议。为此,经由里面的充分贪图并达成共鸣,咱们于2025年8月5日在北京有益举办了昇腾产业峰会,我代表华为给出了复兴,在座的有的参加了,有的可能莫得参加。今天,我也应用此契机就主要的决定给大家报告一下。主要有四点:
一、华为坚执昇腾硬件变现;
二、CANN编译器和造谣提示集接口怒放,其它软件全开源,CANN基于Ascend 910B/C的开源怒放将于2025年12月31日前完成,改日开源怒放与家具上市同步;
三、Mind系列应用使能套件及用具链全面开源,并于2025年12月31日前完成;
四、openPangu基础大模子全面开源。
接下走动到今天的主题。尽管DeepSeek独创的模式不错大幅减少算力需求,但要走向AGI、要走向物理AI,咱们合计,算力,夙昔是,改日也将继续是东谈主工智能的要津,更是中国东谈主工智能的要津。
算力的基础是芯片,昇腾芯片是华为AI算力计谋的基础。自2018年发布Ascend 310芯片,2019年发布Ascend 910芯片,到2025年,Ascend 910C芯片跟着Atlas 900超节点鸿沟部署,为大家所熟悉。在夙昔几年,客户和伙伴们对昇腾芯片有许多诉求,对昇腾芯片也有许多期待。面向改日,华为的芯片路标是如何蓄意的?想必是大家盛大体恤的话题,可能亦然最体恤的内容。
因此,今天,我就直入主题来先容昇腾芯片偏执路标。我很笃定地告诉大家,昇腾芯片将执续演进,为中国乃至世界的AI算力构筑坚固根基。
改日3年,至2028年,咱们在开拓和蓄意了三个系列,差异是Ascend 950系列,包括两颗芯片:Ascend 950PR和Ascend 950DT,以及Ascend 960、Ascend 970系列,更多具体芯片还在蓄意中。底下我差异先容将近推出的和已蓄意的4颗昇腾芯片。
咱们正在开拓、且行将推出的芯片叫Ascend 950系列。我开首先容一下Ascend 950系列的芯片架构,Ascend 950 PR和Ascend 950 DT共用了Ascend 950 Die。与前一代昇腾芯片比较,Ascend 950 在以下几个方面竣事了根人道提高。
第一,新增支执业界尺度FP8/MXFP8/MXFP4等低数值精度数据形式,算力差异达到1P和2P,提高老炼就果和推理朦拢。并罕见支执华为自研的HiF8,在保执FP8的高效的同期,精度相称接近FP16。
第二,大幅度提高了向量算力。这主要通过三个方面竣事:其一,提高向量算力占比;其二,聘用改换的新同构假想,即支执 SIMD/SIMT 双编程模子,SIMD随机像活水线一样处理“大块”向量,而SIMT便于纯真处理“碎屑化”数据;其三,把内存探询颗粒度从512字节减少到128字节,内存探询更考究,从而更好地支执了翻脸且不连系的内存探询。
第三,互联带宽比较Ascend 910C提高了2.5倍,达到2TB/s。
第四,衔尾推理不同阶段关于算力、内存、访存带宽及推选、老练的需求不同,咱们自研了两种HBM,差异是:HiBL 1.0和HiZQ 2.0。不同的自研HBM与Ascend 950 Die合封,差异组成芯片Ascend 950PR:面向Prefill和推选场景,以及Ascend 950DT:面向Decode和老练场景。
底下差异先容。
开首是咱们的第一颗芯片,Ascend 950PR,主要面向推理Prefill阶段和推选业务场景。开首,咱们发现,跟着Agent的快速发展,输入高下文越来越长,首Token输出阶段占用计较资源越来越多。其次是在电子商务、内容平台、应付媒体等业务应用中,要求推选算法具有更高的准确度和更低的时延,对计较才智的需求也越来越大。推理Prefill阶段和推选算法齐是计较密集型,对计较并行的才智要求高,但对内存探询带宽的需求相对低。通过分级内存科罚决策,推理Prefill阶段和推选算法对土产货内存容量的需求相对也不高。Ascend?950PR 聘用了华为自研的低资本HBM,HiBL 1.0,比较高性能、高价钱的HBM3e/4e,随机大大责怪推理Prefill阶段和推选业务的投资。
这颗芯片将在2026年一季度推出,开首支执的家具形态是标卡和超节点行状器。
接下来这一颗是Ascend 950DT,比较Ascend 950PR,它更瞩目推理Decode阶段和老练场景。由于推理Decode阶段和老练对互联带宽和访存带宽要求高,咱们开拓了HiZQ 2.0,使内存容量达到144GB,内存探询带宽达到4TB/s。同期把互联带宽提高到了2TB/s。其次,支执了FP8/MXFP8/MXFP4/HiF8数据形式。Ascend 950DT 将在2026年Q4推出。
第三颗是在蓄意中的芯片Ascend 960。它在算力、内存探询带宽、内存容量、互联端口数等各式规格上比较Ascend 950翻倍,大幅度提高老练、推理等场景的性能;同期还支执华为自研的HiF4数据形式。它是咫尺业界最优的4bit精度竣事,能进一步提高推理朦拢,何况比业界FP4决策的推理精度更优。Ascend 960将在2027年四季度推出。
终末一颗是在蓄意中的Ascend 970,这颗芯片的一些规格还在贪图中。总体标的是,在各式样的上大幅度升级,全面升级老练和推感性能。咫尺的初步探讨是,比较Ascend 960,Ascend 970的FP4算力、FP8算力、互联带宽要全面翻倍,内存探询带宽至少增多1.5倍。Ascend 970谋划在2028年四季度推出。大家届时不错期待它的惊东谈主明白。
这是刚才先容的昇腾芯片的主要具体规格和路标,总体上,咱们将以险些一年一代算力翻倍的速率,同期围绕更易用,更盛大据形式、更高带宽等标的执续演进,执续满足AI算力不停增长的需求。不错看到,比较Ascend 910B/910C,从Ascend 950运转的主要变化包括:
引入SIMD/SIMT新同构,提高编程易用性;
支执愈加丰富的数据形式,包括FP32 /HF32/FP16/BF16/FP8/MXFP8/HiF8/MXFP4/HiF4等;
支执更大的互联带宽,其中950系列为2TB/s,970系列提高到4TB/s;
支执更大的算力,FP8算力从950系列的1 PFLOPS提高到960的2 PFLOPS、970的4 PFLOPS;FP4算力从950的2 PFLOPS提高到960的4 PFLOPS、970的8 PFLOPS;
内存容量慢慢加倍,而内存探询带宽将翻两番。
有了昇腾芯片为基础,咱们就随机打造满足客户需求的算力科罚决策。从大型AI算力基础步调诞生的技能标的看,超节点照旧成为主导性家具形态,并正在成为AI基础步调诞生的新常态。超节点事实上即是一台能学习、想考、推理的计较机,物理上由多台机器组成,但逻辑上以一台机器学习、想考、推理。跟着算力需求的执续增长,超节点的鸿沟也在执续、快速增大。
本年3月份,华为雅致推出了Atlas 900超节点,满配支执384卡。因为是超节点,这384颗Ascend 910C芯片,随机像一台计较机一样使命,最大算力可达300 PFLOPS。到咫尺为止,Atlas 900依然是全球算力最大的超节点。大家时常听到的CloudMatrix384超节点,是华为云基于Atlas 900超节点构建的云服求实例。Atlas 900超节点自上市以来,照旧累计部署突出300套,行状20多个客户,涵盖互联网、电信、制造等多个行业。不错说,Atlas 900于2025年,开启了华为AI超节点的征途。
今天,衔尾咱们照旧推出或正在研发中的昇腾芯片,我将为大家带来更多超节点和集群家具。咫尺参加今天最情愿东谈主心的时刻,即是新家具发布门径。
今天我要发布的第一款家具,Atlas 950超节点,基于Ascend 950DT打造。
Atlas 950超节点支执8192张基于Ascend 950DT的昇腾卡,是Atlas 900超节点的20多倍,咱们民风称呼的昇腾卡,每张卡对应一颗Ascend 950DT芯片,8192张昇腾卡等同于8192颗Ascend 950DT芯片。
Atlas 950超节点满配包括由128个计较柜、32个互联柜,合计160个机柜组成,占大地积1000闲居米傍边,柜间聘用全光互联。总算力大幅度提高,其中,FP8算力达到8E FLOPS,FP4算力达到16E FLOPS。互联带宽达到16PB/s,这个数字意味着,Atlas 950一个家具的总互联带宽,照旧突出今天全球互联网峰值带宽的10倍多余。
Atlas 950超节点的上市时分是:2026年四季度。
咱们很自满地看到,Atlas 950超节点,至少在改日多年齐将保执是全球最强算力的超节点,何况在各项主要才智上齐远超业界主要家具。其中,比较英伟达雷同将在来岁下半年上市的NVL144,Atlas 950超节点卡的鸿沟是其56.8倍,总算力是其6.7倍,内存容量是其15倍,达到1152TB;互联带宽是其62倍,达到16.3PB/s。即使是与英伟达谋划2027年上市的 NVL576比较,Atlas 950超节点在各方面依然是开首的。
算力、内存容量、内存探询速率、互联带宽等才智的大幅度增强,为大模子老练性能和推理朦拢带来显贵提高。比较华为照旧推出的Atlas 900超节点,Atlas 950超节点的老练性能提高17倍,达到4.91M TPS。通过支执FP4数据形式,Atlas 950超节点的推感性能提高达26.5倍,达到19.6M TPS。
8192卡超节点并不是咱们的特别,咱们还在继续勤奋。我今天发布的第二款超节点家具,Atlas 960超节点。基于Ascend 960,Atlas 960超节点最大可支执15488卡。Atlas 960超节点 由176个计较柜,44个互联柜,共220个机柜,占大地积约2200闲居米。
Atlas 960超节点的上市时分是:2027年四季度。
作陪卡的鸿沟的再次升级,Atlas 960超节点让咱们在AI超节点的上风再度增强。基于Ascend 960,其总算力、内存容量、互联带宽在Atlas 950基础上再翻倍。其中,FP8总算力将达到30E FLOPS,而FP4总算力将达到60 EFLOPS;内存容量达到4460TB,互联带宽达到34PB/s。大模子老练和推理的性能比较Atlas 950超节点,将差异提高3倍和4倍以上,达到15.9M TPS 和80.5M TPS。通过Atlas 950和Atlas 960,咱们关于为东谈主工智能的始终快速发展提供可执续且充裕算力,充满信心。
超节点照旧重新界说AI基础步调的范式,但不单是局限于AI。在通用计较鸿沟,咱们雷同合计,超节点技能随机带来很大的价值。从需求角度探讨,金融中枢业务等咫尺仍然有部分承载在大型机和袖珍机之上,比较普通行状器集群,它们对行状器的性能和可靠性有更高的诉求,通用计较超节点在这两点上正巧切合需求。从技能角度探讨,超节点雷同不错为通算鸿沟注入全新活力。
因此,鲲鹏处理器主要围绕支执超节点,更多核、更高性能等标的执续演进。同期,通过自研的双线程灵犀核,使鲲鹏处理器能便捷支执更多线程。
2026年Q1,咱们将推出Kunpeng 950处理器,包括两个版块,差异是:96核/192线程和192核/384线程;支执通用计较超节点;安全方面新增四层禁绝,成为鲲鹏首颗竣事奥妙计较的数据中心处理器。
2028年Q1,鲲鹏处理器将在芯片微架构、先进封装技能等鸿沟执续冲突要津技能,将再次推出两个版块,差异是高性能版块,96核/192线程,单核性能提高50%+,主要面向AI host、数据库等场景。以及高密版块,不少于256核/512线程,主要面向造谣化、容器、大数据、数仓等场景。
接下来是今天我发布的第三款家具:TaiShan 950超节点,基于Kunpeng 950打造,全球首个通用计较超节点,其最大支执16节点,32个处理器,最大内存48TB,同期支执内存、SSD、DPU池化。
这款家具不单是通用计较鸿沟的一次技能升级,除了大幅提高通用计较场景下的业务性能,还能匡助金融系统破解中枢蜿蜒。面前大型机、袖珍机替换的中枢挑战是数据库分散式校正,而基于TaiShan 950超节点打造的 GaussDB多写架构,无需校正,但性能提高2.9 倍,最终可平滑替代大型机、袖珍机上的传统数据库。TaiShan 950加上分散式GaussDB将成为各样大型机、袖珍机的斥逐者,绝对取代各式应用场景的大型机和袖珍机以及Oracle的Exadata数据库行状器。
除了中枢数据库场景,TaiShan 950超节点在更庸俗的场景里,明白也很亮眼:比如造谣化环境的内存应用率提高20%,在Spark大数据场景,及时数据处理时分镌汰30%。
TaiShan 950超节点上市时分是:2026年一季度,敬请期待。
超节点的价值,不单是体咫尺智算和通算传统业务鸿沟。互联网产业庸俗应用的推选系统,正在从传统推选算法向生成式推选系统演进。咱们不错基于TaiShan 950和Atlas 950打形成混杂超节点,为下一代生成式推选系统掀开全新架构标的。
一方面,通过超大带宽、超低时延互联以及超大内存,混杂超节点组成超大分享内存池,支执PB级推选系统镶嵌表,从而撑执超高维度用户特征;另一方面,混杂超节点的超大AI算力,随机支执超低时延推理和特征检索。因此,混杂超节点是面向下一代生成式推选系统的科罚决策的全新弃取。
大鸿沟超节点把智算和通算的才智齐推向新的高度,同期也对互联技能建议了要紧挑战。华为看成连合鸿沟的素养者,天然不惧挑战。在界说和假想Atlas 950、Atlas 960两个超节点的技能规格时,咱们遭受到了互联技能的广阔挑战,主要在两个方面:
第一是如何作念到长距离而且高度可靠。大鸿沟超节点机柜多,柜间连合距离长,面前电互联和光互联技能齐不成满足需求。其中,面前的电互联技能在高速时连合距离短,最多只可支执两柜互联,而面前的光互联技能天然不错把长距离的多机柜连合在沿途,但无法满足可靠性需求。
第二是如何作念到大带宽而且低时延。面前跨柜卡间互联带宽低,和超节点的需求差距达5倍;跨柜的卡间时延大,面前互联技能最佳只可作念到3微秒傍边,和Atlas 950/960假想需求仍然有24%的差距,其时延照旧低至2~3个微秒时,照旧迫临物理极限,哪怕0.1微秒的提高,挑战齐很大。
华为基于三十多年构筑的技能才智,通过系统性改换,绝对科罚了面前技能存在的问题,超标达成Atlas 950/960超节点的假想需求,使万卡超节点成为可能。
开首,为了科罚长距离且高可靠问题,咱们在互联条约的物理层、数据链路层、集中层、传输层等每一层齐引入了高可靠机制;同期在光路引入了百纳秒级故障检测和保护切换,当出现光模块闪断或故障时,让应用无感;何况,咱们重新界说和假想了光器件、光模块和互联芯片。这些改换和假想让光互联的可靠性提高100倍,且互联距离突出200米,竣事了电的可靠和光的距离。
其次,为了科罚大带宽且低时延问题,咱们冲突了多端口团聚与高密封装技能,以及对等架构和和解条约,竣事了TB级的超大带宽,2.1微秒的超低时延。恰是因为一系列系统性、原创性的技能改换,咱们才攻克了超节点互联技能,满足了高可靠、全光互联、高带宽、低时延的互联要求,让大鸿沟超节点成为了可能。
为了达成Atlas 950/960超节点对互联的技能要求,为了竣事万卡超节点还能是一台计较机,华为独创了超节点架构并独创了新式的互联条约,随机撑执万卡级超节点架构。基于这个互联条约的超节点架构的中枢价值宗旨是:万卡超节点,一台计较机,也即是说,通过该互联条约,把数万鸿沟的计较卡,连合成一个超节点,随机像一台计较机一样使命、学习、想考、推理。
在技能上,咱们总结合计,万卡级超节点架构应该具备6大特征,差异是总线级互联、对等协同、全量池化、条约归一、大鸿沟组网、高可用性。咱们为这个面向超节点的新式互联条约取名“灵衢”,英文称号:UB,UnifiedBus
今天,咱们雅致发布灵衢、UnifiedBus,一个面向超节点的互联条约。
同期,我告示,华为将怒放灵衢2.0技能程序。为什么从灵衢2.0运转怒放?事实上,灵衢的相关是从2019年运转的,因为家喻户晓的原因,先进工艺不可获取,咱们需要从多芯片上冲突,但愿把更多的计较资源连合在沿途。咱们取了一个名字叫UnifiedBus,简称UB,汉文名字“灵衢”,意味着肖似九省正途,竣事大鸿沟算力的联通。基于灵衢?1.0 的Atlas 900超节点自2025年3月运转拜托,于今已商用部署300多套,灵衢1.0技能得到充分考据。在灵衢1.0的基础上,咱们继续丰富功能,优化性能,提高鸿沟,进一步完善了条约,形成了灵衢2.0,前边发布的Atlas 950超节点即是基于灵衢2.0。
咱们合计灵衢2.0具备了怒放的条目,为了更庸俗地促进互联技能发展和产业向上,今天华为决定怒放灵衢2.0技能程序,接待产业界伙伴基于灵衢研发关系家具和部件,共建灵衢怒放生态。
我在旧年HC会上强调过,基于中国可获取的芯片制造工艺,咱们勤奋打造“超节点+集群”算力科罚决策,来执续满足算力需求。今天照旧先容了三个超节点家具。灵衢既为超节点而生,是面向超节点的互联条约,亦然构建算力集群家具最优的互联技能。
接下来为大家带来两个集群家具:开首是,Atlas 950 SuperCluster 50万卡集群!
Atlas 950 SuperCluster集群由64个Atlas 950超节点互联组成,把1万多机柜中的52万多片昇腾950DT组成为一个举座,FP8总算力可达524 EFLOPS。上市时分与Atlas 950超节点同步,即2026年Q4。
在集群组网上,咱们同期支执UBoE与RoCE两种条约,UBoE是把UB条约承载在以太网上,让客户随机应用现存以太交换机。比较传统RoCE,UBoE组网的静态时延更低、可靠性更高,交换机和光模块数目齐更勤俭,是以,咱们推选UBoE。
这即是咱们的Atlas 950 SuperCluster集群。比较面前世界上最大的集群 xAI Colossus,鸿沟是其2.5倍,算力是其1.3倍,是当之无愧的全世界最强算力集群!不管是当下主流的千亿宽广、寥落大模子老练任务,如故改日的万亿、十万亿大模子老练,超节点集群齐不错成为性能强悍的算力底座,高效自如地支执东谈主工智能执续改换。
相应的,在2027年Q4,咱们还将基于Atlas 960超节点,同步推出Atlas 960 SuperCluster,集群鸿沟进一步提高到百万卡级,FP8总算力达到2 ZFLOPS!FP4总算力达到4 ZFLOPS。何况,它雷同也支执UBoE与RoCE两种条约,在UBoE条约加执下,性能与可靠性雷同更优,何况,静态时延和集中无故障时分上风进一步扩大,因此继续推选UBoE组网。通过Atlas 960 SuperCluster,咱们将执续加快客户应用改换,探索智能水平新高。
很舒坦今天给大家带来一系列新家具,咱们但愿和产业界沿途kai云体育app官方登录入口(中国)官方网站 IOS/安卓通用版/手机版,以独创的灵衢超节点互联技能,引颈AI基础步调新范式;以基于灵衢的超节点和集群执续满足算力快速增长的需求,推动东谈主工智能执续发展,创造更大的价值,谢谢!