
NVLink Fusion 和 UALink 这两个名字最近在我朋友圈里刷屏的频率比任何一家云厂商的新品发布会都高。做 AI 基础设施的人应该都有同感一边是 NVIDIA 把 GPU、CPU、DPU、NIC 全部画进一张互连大图里另一边是 AMD、微软、博通、谷歌、Meta 这些巨头牵头试图用一套开放协议把超节点 Scale-up 互连从“NVIDIA 说了算”变成“大家说了算”。今天这篇文章我不写发布会通稿就从一个长期做集群网络设计的人视角把这两条技术路线的底层逻辑、关键参数和实际落地时要注意的坑全部拆开看一遍。适合正在纠结下一代集群怎么选型、或者对超节点互连感兴趣的工程师拿来当参考资料。1. 为什么超节点一定要做 Scale-up 互连1.1 从 Scale-out 到 Scale-up算力扩展的两条路先说个基础概念避免后面绕晕。传统数据中心扩容主力是 Scale-out也就是横向加机器。今天跑一个千亿参数模型你可能要拉几千张 GPU 卡靠以太网或者 InfiniBand 把它们连成一个大集群。这个模式下每张卡基本上是一个独立计算节点卡与卡之间通过网卡、交换机转发数据通信模式是“点到点搬运”。Scale-up 完全不同它指的是纵向扩展单“节点”的算力。放到 AI 场景里就是把几十张甚至上百张 GPU 通过高带宽、低延迟的互连总线组合成一个逻辑上“像一台超级计算机”的计算域。在这个域里任何两张卡之间的通信都不需要走传统网络协议栈而是走内存级语义的互连时延从微秒级直接降到亚微秒级带宽从几百 Gbps 飙到 TB/s 级别。为什么要走这条路根本原因是模型规模涨得太快。MoE、多模态、长上下文这些架构单次训练任务里张量并行和专家并行的通信量极其夸张。如果还是 Scale-out 思路跨节点通信会成为训练的绝对瓶颈。NVIDIA 的 GB200 NVL72 也好AMD 的 MI300X 平台也好都在往“整机柜即超节点”的方向走——机柜里 72 张加速卡共享一套 NVLink 互连域跑千亿到万亿参数模型的通信效率提升几个数量级。1.2 超节点场景下互连瓶颈到底卡在哪我见过不少团队看到 GPU 总算力上去了就以为万事大吉结果一跑训练MFU模型算力利用率惨不忍睹。问题往往不在计算芯片本身而在互连。传统 PCIe 总线是树形拓扑根复合器连接各个端点带宽共享多卡同时通信时互相抢资源时延也不可控。RDMA 网络虽然能解决部分跨机通信但网卡、交换机、线缆的链路预算和转发时延放在那里到了几十 TB/s 的总吞吐需求面前根本不现实。超节点要解决的是“在一个高一致性域内让任意两张卡都能以近乎本地内存访问的速度交换数据”。要做到这一点互连协议必须满足三个条件超高的单链路带宽、极低的端到端时延、可控的故障域。NVLink Fusion 和 UALink 本质上是给这个条件交出的两份不同答卷。提示Scale-up 和 Scale-out 不是替代关系而是互补关系。超节点内部靠 Scale-up 把局部算力密度拉满超节点之间仍然靠 Scale-out 方式横向扩展。设计集群时两者都要考虑单押任何一边都会出问题。2. 两条路线“互连”的底层思路差异2.1 NVLink Fusion 的全栈画法NVLink Fusion 是 NVIDIA 在 2025 年 GTC 上公布的 AI 互连方向。它最核心的动作是把 GPU、CPU、DPU、NIC 全部统一进一套互连结构里对外给出一个非常漂亮的“全栈图景”——从芯片到网络全部由 NVIDIA 定义和收敛。这套方案的关键词是 OpenECOM。它不是传统的“总线标准”而是一个开放式计算协调框架用来管理互连域里的资源分配和拓扑编排。我的理解是NVLink Fusion 想做的事情不只是把带宽做高而是把“谁和谁可以直接通信”、“怎么动态调整通信路径”这些能力做成软件可编程的中央调度器从而配合大模型训练时的动态计算图。为什么要这么干因为大模型训练里的通信模式不是静态的。张量并行、序列并行、专家并行在不同训练阶段会有不同的通信热点。如果互连拓扑是固定的、路径是写死的那 GPU 利用率一定上不去。NVLink Fusion 的思路是让互连变成“可以编程的”相当于给互连域装了一个软件定义的控制面。单链路带宽上NVIDIA 公开对比称 NVLink Fusion 的峰值吞吐量是 PCIe Gen6 方案的 12 倍左右。PCIe Gen6 在 x16 配置下单向带宽大概是 128GB/s按 12 倍推算NVLink Fusion 单条链路的有效带宽在 1.5TB/s 量级。这个数字和之前 NVLink 4.0/5.0 时代“单卡互连带宽接近 1.8TB/s”的演进脉络是吻合的说明它不是空中楼阁而是基于已量产互连技术的迭代延伸。2.2 UALink 的开放解耦路径UALink 走的是完全相反的路。它由 AMD、博通、思科、Google、HPE、Intel、Microsoft、Meta 这些公司组成的开放计算互连联盟推动目标很直接定义一套“不绑死任何一家芯片厂商”的加速器到加速器互连协议。UALink 1.0 阶段重点关注 GPU/加速器之间的高速互连单 SerDes 速率在 200Gbps 量级面向的是机柜级、超节点级的加速器通信场景。它不想管 CPU 的事也不想管网卡的事先把“加速器与加速器之间怎么高速对话”这件事做标准化。这套路径的价值在于选择权。如果用 UALink理论上你可以把一个厂商的加速器、另一个厂商的网络设备、第三个厂商的软件栈拼在一起。对很多不想被单一供应商锁死的云厂商和大型互联网公司来说这吸引力巨大。但开放也意味着复杂度。标准只定义了协议厂商怎么实现、怎么验证互操作性、出了问题找谁这些在早期都会是痛点。我见过不少数据中心团队嘴上支持开放标准实际遇到性能问题时还是希望找一家厂商“一把全包”——这种心态正是 NVIDIA 全栈方案能持续占据高端市场的核心原因。2.3 两种哲学的本质碰撞把两边放在一起看本质是一个“封闭一体化”和“开放解耦”的经典对决。NVLink Fusion 的前提是只有从芯片、互连、软件栈全部自己掌控才能在性能优化上走到极致才能做到故障定位、动态编排、生态兼容的无缝衔接。代价是用户被绑定在 NVIDIA 体系里没有多少议价空间。UALink 的前提是互连不该成为任何一家的禁脔通过开放标准激发多厂商竞争长期看会降低整个行业的互连成本催生更多创新。代价是早期性能可能不及垂直优化方案多厂商集成调试的复杂度也更高。这场对决的结果短时间内不会有一边倒的胜者。更现实的情况是NVIDIA 用 NVLink Fusion 守住高端和存量市场UALink 先在非 NVIDIA 生态里把标准立住再慢慢争取第三方兼容。3. 关键技术细节对比从协议到物理链路3.1 参数对比速查表下面这张表是我按公开信息整理的两方案关键差异细节会随版本演进有所调整但整体方向可以参考。维度NVLink FusionUALink 1.0定位全栈互连方案统一 GPU/CPU/DPU/NIC加速器到加速器开放互连协议主导方NVIDIA 主导配合 OpenECOM 框架UALink 联盟多家厂商协作定义单链路带宽约为 PCIe Gen6 的 12 倍TB/s 量级SerDes 速率 200Gbps 量级拓扑管理中央协调、软件可编程路径底层协议标准化拓扑更依赖上层软件软件生态与 CUDA、NCCL 深度绑定面向 ROCm 等多种软件栈追求互操作配套技术NVLink Switch、NVLink Domain主要面向机柜级加速器互连落地节奏NVIDIA 持续迭代已列入实际产品路线图2025 年起逐步交付生态建设仍在早期注意不同来源对带宽数字的提法有差异。上行、下行、双向、有效载荷带宽这些口径不一样数字能差出两倍以上。做规划时一定要和厂商确认清楚是哪个口径别被参数表的峰值唬住。3.2 协议分层与物理层设计差异从 OSI 模型角度看NVLink 走的是“轻网络化”路线。它虽然叫 Link但底层不是一个传统总线而是一套类似网络的协议栈有报文、路由、流控、重传只是这些功能高度优化硬件化程度极高端到端时延才压得下来。NVLink Fusion 把 GPU、CPU、DPU、NIC 纳入同一个互连协议域。这意味着 CPU 访问 GPU 显存、GPU 访问远端网卡、DPU 做数据搬运走的都是同一套高带宽通道省掉了传统架构里“GPU 显存 → PCIe → 主机内存 → 网卡 → 网络”的多次拷贝和协议转换。UALink 则更强调标准普适性。它定义的是加速器之间直接互连的物理层、链路层和事务层语义目标是让不同厂商的加速器能连到同一个互连域。UALink 还和 UECUltra Ethernet Consortium在链路层协同推进希望让以太网生态里的经验能复用到超节点互连场景。单看技术成熟度NVLink 体系因为 NVIDIA 多年垂直整合调度、诊断、流控等能力都更完善。UALink 的优势在“以后”一旦生态起来多厂商竞争会把成本打下来类似 PCIe 曾经取代各种私有总线那样成为标准化平台。3.3 带宽需求怎么算一个粗略模型以一个 72 卡超节点为例。假设单卡需要 900GB/s 到 1.8TB/s 的双向互连带宽来支撑张量并行通信72 卡内部总交叉带宽需求就在 65TB/s 到 130TB/s 区间。这还只是裸通信需求没算数据冗余、重传、多流量叠加。如果换到 256 卡级别的超节点总带宽需求直接到几百 TB/s 量级。这个数字靠以太网交换集群根本接不住——每台 64 端口 800G 交换机的总交换容量也就 51.2Tbps往上堆交换机数量只会带来更高的时延和更复杂的负载均衡。这也是为什么超节点互连最终会走向“类总线化的高密度直连”在一个物理域内用尽量少的转发层级让每张卡都有足够的对分带宽去和域内其他卡通信。NVLink Switch 和 UALink 兼容的互连域实际上都在往这个方向收敛。4. Chiplet、超节点与生态博弈影响范围有多大4.1 Chiplet 时代对互连协议的新要求Chiplet 这个概念已经不只停留在芯片封装内部。今天的超节点本质上是一个“系统级 Chiplet”——不同功能的裸 die计算、缓存、互连、IO以模块化方式拼装成一个大系统通过高带宽互连协议协同工作。UCIe 把封装内的 Die-to-Die 互连做了标准化UCIe 之上再往机柜和服务器级别延伸就是 NVLink Fusion、UALink 这类协议的战场。Chiplet 思路对互连协议最大的要求是“分层解耦”。物理层、链路层、事务层需要可以独立演进这样芯片工艺升级时不用推翻整个协议栈重来。NVLink Fusion 配合 UCIe 兼容UALink 也已加入 UCIe 生态说明双方都清楚只有底层物理层兼容才能避免被工艺卡脖子。4.2 对训练框架和部署模式的冲击超节点 Scale-up 互连普及后变化最大的是上层训练框架。NCCL 和 RCCL 这类集合通信库原本为了适配多级网络拓扑做了大量分层优化在纯 Scale-up 域内可以大大简化——所有通信都走同一套高带宽互连不再需要区分“机内”和“机间”的通信路径。这对开发者是好事也是坏事。好事是通信逻辑简化模型并行策略可以更自由坏事是如果互连域过大单点故障影响面也随之扩大。一个 72 卡超节点里挂掉一张卡可能意味着整个互连域降级训练直接中断。这对集群调度和容错系统提出了新要求互连域的动态隔离、故障域的快速切分会成为新一代集群管理平台的核心能力。4.3 行业格局两个“联盟”的对抗与调和NVLink Fusion 背后是 NVIDIA 加 OpenECOM 的开源协调框架UALink 背后是多家巨头组成的产业联盟。这场竞争的实质不是比谁的协议更“先进”而是比谁能定义下一代 AI 基础设施的标准接口。从历史规律看封闭式方案在性能领先期优势巨大但一旦性能增长趋缓开放标准的生态优势就会凸显。PCIe 取代众多私有总线、以太网取代 InfiniBand 独占市场都是这个逻辑。NVLink 体系现在处于性能高峰期UALink 则需要靠时间和生态慢慢侵蚀市场。对大型云厂商来说最理想的状态是“鸡蛋不放在一个篮子里”既保留 NVIDIA 全栈方案来跑最重的训练任务又培养 UALink 体系的供应链作为备选和议价筹码。这种双轨策略在中长期会是主流。5. 实操选型建议与避坑指南5.1 评估方案时先问清楚五个问题纸上谈兵容易真正落地时我建议团队在选型之前先过一遍这五个问题能省掉后面很多扯皮你的训练任务核心瓶颈是带宽还是时延如果是超大 batch、张量并行主导带宽优先如果是小 batch、推理延迟敏感时延和调度灵活性优先。你现有的软件栈是绑在 CUDA 上还是已经做了 ROCm 适配软件栈迁移成本往往比硬件采购成本还高别只看互连方案的硬件参数。超节点的物理部署条件是否满足高带宽互连往往意味着高功耗、高散热72 卡机柜功率轻松上到几十 kW 甚至上百 kW普通机房扛不住。运维团队有没有能力排障多厂商互连问题封闭方案出问题可以找一家兜底开放方案出问题可能需要自己定位是谁的锅。超节点故障域的设计和业务容错是否匹配超节点越强故障爆炸半径越大必须有配套的断点续训和任务迁移机制。5.2 不要只看峰值带宽还要测有效带宽做网络出身的人都有一个习惯拿到任何互连方案先跑 benchmark而且只信两类数据——真实业务负载下的有效带宽和 99 分位时延其他一概当参考。NVLink 体系在有效带宽上的表现通常很稳定因为它的流控和重传机制是硬件级闭环长时间满载也不容易掉速。UALink 这类开放标准不同不同厂商落地时的链路质量差别可能很大如果物理层参数没调好有效吞吐可能只有理想值的 60% 到 70%。选型时如果只有实验室的理论测试报告建议要求厂商提供基于你真实模型拓扑的实测数据比如用 NCCL 或 RCCL 的 allreduce、all-to-all 测试脚本来压测。5.3 这些年做高速互连我踩过最大的坑最后分享一个真实教训。前两年我们规划一个大规模 AI 集群当时选了一套宣称支持“超节点互连”的方案发布会演示数据非常漂亮。结果等到实际装机调试才发现关键参数是用短距离链路在恒温实验室里测的一旦换成机房实际布线的长距离铜缆信号完整性立刻下降不得不大规模降速运行。那次之后我得出一条经验高速互连方案选型不能只看芯片和协议规格书必须把物理层实现一并纳入评估——连接器、线缆类型铜缆还是光纤、走线长度、背板设计这些才是决定真实带宽的隐藏变量。NVLink Fusion 这种全栈方案在这方面有天然优势因为线缆和连接器都是配套验证过的而 UALink 方案在不同厂商组合下物理层兼容性需要更多验证。如果你的团队不具备高速信号完整性测试能力选择全栈方案能降低不少风险。我个人判断未来一年会是超节点 Scale-up 互连从概念走向规模部署的关键窗口。NVLink Fusion 的落地路径更顺滑但 UALink 的开放生态值得每一个做 AI 基础设施的人持续关注。不管最终选哪家先把互连带宽需求的账算清楚把故障域和物理部署的边界画明白再去做技术选型这才是最稳妥的打法。