AI头条 2026-09-21 11:04 · 👁 15 次阅读

25.6万卡像一台计算机,靠的是一套统一协议

一场发布会,把注意力引向了芯片之外

25.6万卡像一台计算机,靠的是一套统一协议

去年公布芯片路线图时,外界的问题集中在供给:什么时候能做出来、什么时候能供货。一年过去,昇腾950已经上市,Atlas950超节点开始交付,基于它构建的25.6万卡集群正在部署,下一代Atlas960进入测试。2026年全联接大会上,华为轮值董事长徐直军与半导体首席科学家廖恒把话题推进一步:「去年我讲了互联协议,大家都盯着芯片,没人留意灵衢,但灵衢是关键。」被低估的,正是芯片与芯片之间的互联。

峰值算力,不等于用上的算力

大模型训练要把任务拆给大量处理器,每颗芯片算完自己的部分,还要与其他芯片交换结果、同步进度,才能进入下一阶段。数据没到位,计算就得停下来等;一条链路短暂异常,还可能拖累一个运行很久的任务。处理器越加越多,收益却有很大一部分被通信和协议转换的开销抵消。买到多少峰值算力,与最终能用上多少有效算力,中间隔着整个系统——这是比单颗芯片更难、也更值得回答的问题。

一套协议,从机箱走向整个园区

过去的分工是总线管近处、网络管远处,AI把成千上万颗处理器拉进同一个任务后,两套体系衔接的代价开始被放大。华为的做法,是让柜内、柜间、数据中心之间乃至一个区域共用同一套协议——灵衢(UnifiedBus,UB)由此把总线的能力延伸到机箱之外。这条路走了多年:2019年互联被确立为计算架构的战略方向,2020年7月立项,2023年协议冻结,随后进入芯片设计与系统验证,昇腾910C用UB1.0,950用2.0,960将用2.1。配合Peerium计算架构的嵌套并行与统一内存寻址,百万级处理器可以像一台计算机那样分工。

光走进机柜,距离换来了余地

速率提高之后,电连接的距离约束越来越紧。华为选择NPO近封装光学路线:Hi-ONE光模组与昇腾芯片之间保留约5厘米的板上铜连接,其余互联转向光——全光超节点里,铜只留在电路板上。相比把光引擎与主芯片封在一起的另一条路线,NPO换来了约40%的成本下降,光引擎也能相对独立地维护。徐直军的概括很直白:机柜之间站得疏,芯片之间算得紧,这是对性能、成本与维护的综合取舍。

规模越大,异常越是常态

系统大到一定程度,器件失效、链路抖动都要按常态设计:靠近故障位置的检错与重传、可替代的连接路径、光源冗余,让这类小问题不至于拖垮整体。这些设计不显眼,却决定了一项指标——MFU,模型浮点算力利用率,一套系统的算力有多少真正用在模型计算上。基于UB与Peerium的超节点已经验证了MFU的大幅提升,这也是头部模型厂商下订单的原因之一。供给节奏随之排开:950PR面向推理已上市,950DT面向训练年底前后规模供货,明年起大量模型训练会构筑在这批集群上。

企业的信息,也有自己的链路异常

算力系统的道理,放到企业经营上同样成立:客户经由AI看到的这家企业,与真实的这家企业之间,也隔着一次读取。模型记错一条业务、拿旧资料当新情况,就像光链路的一次抖动——单看很小,一旦被转述出去,错的版本也会跟着传递。系统侧的办法是检错与重传,企业侧同样可以:把信息挂在随事实更新的源头上,哪家模型读到了旧内容,下一次读取拿到的就是更正过的版本。错误出现一次就被抹平一次,比等它传开再逐条解释,代价小得多。

上个月一位开工厂的老友偶然接触到GEO官网搭建,把自家企业知识库填进去跑了一个月,现在每天都有新客资进来,方法我放在公众号「智扣AI」了。

结语

灵衢的故事说的是一件事:把散落的算力组织好,比堆出更高的峰值更难,也更值钱。企业信息同理——散落的介绍谁都有,随事实更新、经得起反复读取的那一份,才是AI一次又一次访问时可靠的那一份。

留一个开放问题:下一次客户向AI问起你的企业时,它拿到的,会是更正之后的那一份吗?


相关资讯