申耀的科技观察 · 7月2日 · 四川

华为联手鹏城实验室,捅破中国存储IO500天花板

2026年6月24日,德国汉堡,ISC26。

IO500最新榜单公布的那一刻,全球存储行业仿佛安静了下来,因为榜单上那个第一名后面的数字,大到超出了所有人的预期。

以华为OceanStor A800为核心的“鹏城云脑III”系统,以603,334.58分位列榜首,同时拿下Research List与Full List双料第一,带宽达8,291.11 GiB/s,元数据性能达43,903,983.64 kIOP/s。这一总分,刷新了此前纪录的2.8倍——对接664个计算节点、79,680个并行进程,历经13项覆盖多场景的测试用例,测试规模本身已是上一代的两倍有余。

这是什么概念?在此前长期霸榜的“鹏城云脑II”(210,255分)基础上,华为把纪录又推到了新高度。若把视角放到国际老牌选手身上,美国阿贡国家实验室Aurora系统43,218.80分,华为的分数是它的约14倍;德国LRZ SuperMUC-NG系统6,308.87分,华为的分数是它的约96倍。差距之大,一目了然。

同一天,另一家国产厂商中科曙光也凭借其存储系统拿下Production List双榜第一,同样是国产厂商首次登顶。两条赛道、两面旗帜,在同一天升起。而华为所征服的,是IO500中公认最严苛的Research List赛道——这份成绩单意味着,中国存储不仅进入了全球第一阵营,更在这条最硬的赛道上,为自己立下了新的坐标。

603,334.58分,不是终点,而是中国存储的新序章。

01.

Research List,

为何是IO500最硬的骨头?

要理解这份成绩单的“含金量”,首先要看懂IO500的赛道划分。

IO500榜单分为两类:Research List(研究型)和Production List(生产型)。名字仅一字之差,但赛道本质截然不同——Research List就像国产摩托车品牌张雪机车的赛车在世界超级摩托车锦标赛(WSBK)上,通过最专业的赛道挑战摩托车物理极限;Production List则是量产车在测试场上验证长期可靠性。

前者考的是极限,后者考的是稳定,这是两种完全不同的能力维度。

Production List要求系统必须在真实生产环境中稳定运行一年以上,才能参评。中科曙光本次拿下的双榜第一,正是这个赛道的国产首金,重要性不言而喻。

而Research List的考核标准则完全不同。它鼓励采用最激进的前沿架构——无共享架构、KV键值存储后端、大模型推理KV Cache加速——在成百上千个节点的极限规模下,逼近软硬件组合的物理理论峰值。它不问“稳不稳”,只问“能不能跑到头”。

门槛之高,决定了参与者之少。全球敢于在Research List打榜的玩家,寥寥无几。榜上长期活跃的,主要是两支海外主力:Intel DAOS生态(阿贡Aurora、LRZ、剑桥、CINECA等)与WEKA。过去多年,Research高分段基本是DAOS与WEKA的“二人转”,直到鹏城云脑II自ISC23起接过榜首的位置,而这一次,华为OceanStor A800带来的变化,不仅仅是挤进了这个俱乐部,而是把俱乐部的天花板直接掀了。

差距有多大?把榜上海外老牌的几个代表性选手拎出来——美国阿贡Aurora、德国LRZ,再加上DDN Leonardo、WEKA on AWS等,华为一家的分数,比它们全部加总还高出十倍不止。

这就回到了开篇那个比喻的核心:Research List与Production List,赛道不同,衡量标准也不同,它们比的不是谁更优越,而是在各自的赛道上,谁能把本分做到极致。

因此,那些质疑Research List“含金量”不如Production List的声音,或许可以换个角度理解:不是谁更胜一筹,而是赛道本就不同。华为这次,是在那条公认最难的赛道上,给出了一个让所有人重新审视“极限”二字的答案。

02.

AI的下一场战争,

为何在这里提前打响?

看到这里,你可能会问:华为为什么偏要去啃Research List这块最硬的骨头?

答案很简单:不是做不了Production,而是AI的下一场战争,已经在这里提前打响。

所谓“下一场战争”,指的是AI正从“训练时代”迈向“智能体时代”——大模型推理正取代训练成为主流工作负载。训练时代,存储的任务是把海量数据喂给GPU,追求大带宽、大吞吐;而推理时代,核心矛盾变成了“IOPS够不够高、延迟够不够低”。

这一转变,直接改变了存储的需求逻辑。具体而言,推理对存储提出的要求与训练截然不同,主要体现在三个方面:

从“大IO大带宽”转向“小IO高IOPS”,IOPS需求至少达到亿级;

KV Cache检索需要海量的、极其零碎的(小至512字节)高并发随机读取;

性能优先于一切,推理过程中需频繁保存中间状态数据并快速周转,而非持久化保存。

这三点,指向同一个方向,存储的评估标准正在被重写。而这些需求,传统存储架构难以胜任。2026年英伟达GTC大会上,英伟达联合铠侠正式发布了“Storage-Next”倡议,就向整个存储界发出明确信号:随着大语言模型向智能体AI和长上下文演进,传统4KB大块顺序读取模式在AI推理中已彻底失效。

而Research List,恰恰是验证这类前沿能力的试验场——它允许采用最激进的架构,去触碰下一代存储的性能极限。华为选择在这里投入,不是为了刷一个榜单名次,而是为了在下一代AI基础设施到来之前,先把答案跑通。

也正因此,华为此次打榜Research List,本质上是在IO500这个全球最权威的擂台上,提前验证了“Storage-Next”的中国解法。OceanFS文件系统与OceanStor A800存储的组合,原生支持向量检索卸载和KV Cache offload,瞄准的正是下一代AI推理范式的存储需求。

当业界还在争论方向时,华为已经交付了一份经过实战检验的答案,并将它写进了IO500的榜单。

03.

三项代际创新,

如何精准命中AI推理命门?

理解了“为什么打”和“打的是什么”,接下来要回答的是:凭什么能打赢?

众所周知,“鹏城云脑Ⅱ”基于国产AI芯片打造,是国内首个全面自主可控的E级智能算力平台,曾在IO500 Research List上长期霸榜,AIPerf500连续4届第一,本身就是中国高端智算的“老霸主”;而“鹏城云脑Ⅲ”这次的登顶,是关键技术突破后的首次双榜冠军——Research List与Full List同时第一,综合性能较此前最高纪录提升2.8倍,也意味着鹏城实验室在该赛道实现十二连冠。从“单榜领跑”到“双榜领跑”,这是质的跨越,而非量的简单累加。

华为OceanStor A800斩获IO500 Full List(总榜单)第一

华为OceanStor A800斩获IO500 Research List(研究型榜单)第一

那么,支撑这一跨越的根基是什么?是以华为OceanStor A800为核心底座的存算网全栈国产化配置——从芯片、操作系统到文件系统、存储硬件,全部自主可控。而A800之所以能将IO500刷到603,334.58分,根源在于三项代际创新,每一项都精准命中AI推理新范式的痛点:

一是,对等全互联+数控分离:前端共享网卡突破大规模连接瓶颈,数据面由DPU直通SSD,绕过CPU语义转换,单框吞吐量500GB/s。这意味着KV Cache那种“512字节级海量小IO高并发随机读”,可以零拷贝直达介质,不受CPU拖累。对AI推理而言,存储不再成为推理链路上的瓶颈环节。

二是,横竖双向融合扩展:Scale-Out横向与Scale-Up纵向兼备,单集群支持512控制器,聚合带宽突破100TB/s,EB级容量;同时支持DPU、NPU等算力卡卸载,向量检索等核心功能可直接下沉到存储侧。这也是A800能够宣称“业界唯一单存储支持十万卡级集群全互联”的技术底气。对AI推理而言,万卡集群的存储扩展不再受限于单一架构的天花板。

三是,DataTurbo +智能多级缓存:动态目录分片配合条带化并行,将元数据负载打散到全集群;DataTurbo加速引擎专门解决海量小文件增删改查的性能衰减问题——这恰好对应本次IO500元数据子项43,903,983.64 kIOP/s那个数字。对AI推理而言,海量小IO场景下的性能衰减问题已被系统性解决。

这三项创新的价值,不止于IO500榜单上的分数。当全球进入十万卡乃至百万卡时代,存储的扩展性、一致性与故障恢复将迎来全新挑战,而华为OceanStor A800在这次打榜中验证的技术实力,正是下一代AI基础设施所需要的基础能力。

04.

从破纪录到定义标准,

中国存储为何能翻过那座山?

凭借这三项代际创新,中国存储一口气翻越了“三座大山”:

第一座山,是技术代际的跨越。过去国产存储在国际榜单上是“跟跑+单点突破”,鹏城云脑Ⅱ已经证明过单榜霸榜能力;但Ⅲ这次是Research + Full双榜同时第一,且把纪录抬到2.8倍,对应的是架构层面的“对等全互联+数控分离+横竖扩展”三位一体——这不是优化出来的成绩,而是架构换代的结果。

第二座山,是产业闭环的形成。鹏城云脑Ⅱ的标签是“国产AI芯片+E级算力”,存储侧当时尚未完全自主;Ⅲ这次实现了存算网全栈国产化,才真正将“高端智算”的每一环都收回到自主体系内——“全域领跑”的“全域”二字,落在这里。

第三座山,是标准定义权的转移。Research List原本是Intel DAOS生态与WEKA两家轮流坐庄的俱乐部。若对照两家一两年前的旧榜高点(Aurora 32,165、LRZ 3,470),华为这一次的分数分别是它们的18倍和170倍——这也意味着下一代AI存储该往哪走,中国方案已从过去的“答题者”变成了“出题者”之一。

回头来看,这三座山其实对应着三道关卡:技术代际的跨越,让国产存储从跟跑变成领跑;产业闭环的形成,让全栈自主从愿景变成现实;标准定义权的转移,让中国方案从答题者变成出题者。每一座山都不好翻,但翻过去之后,赛道上的风景已经完全不同。

而这一切,源于一个判断:AI的下一场战争,不在训练场,而在推理侧;不在Production List的舒适区,而在Research List的极限赛道。华为用603,334.58分验证了这一点——真正的答案从来不在榜单上,而在万卡集群的机房里,在大模型推理的数据流中。

轻舟已过万重山。在这条最硬的赛道上,中国存储已经把对手甩了一个时代。接下来的赛道与速度,由我们重新定义——把IO500的极限,变成自己的起跑线。

推荐阅读
关注数
2408
内容数
519
专注产业互联网、企业数字化、渠道生态以及汽车科技的 观察和思考。
目录
极术微信服务号
关注极术微信号
实时接收点赞提醒和评论通知
安谋科技学堂公众号
关注安谋科技学堂
实时获取安谋科技及 Arm 教学资源
安谋科技招聘公众号
关注安谋科技招聘
实时获取安谋科技中国职位信息