在大模型训练中,8张A100或H100组成的单机算力集群,真正决定训练效率的往往不是单卡浮点性能,而是GPU之间的通信拓扑。大模型动辄需要切分到多卡上进行张量并行、流水线并行或数据并行,梯度同步、激活值传递和参数更新会在GPU之间产生海量通信流量。此时,NVLink链路负责GPU到GPU之间的高速点对点传输,而NVSwitch则承担无阻塞的全互联交换职责。理解8卡A100与H100在NVLink数量和NVSwitch拓扑上的差异,是选对训练服务器的关键一步。

为什么NVLink和NVSwitch对8卡训练如此关键
大模型训练通常无法放进单张GPU显存,需要将模型按层或按张量维度切分到多张GPU上。以张量并行和流水线并行为例,相邻GPU之间每一层前向、反向传播都要传递中间激活值和梯度,通信延迟会直接拖慢整个训练步。如果8张GPU只是通过PCIe总线连接,即使每张GPU算力再高,通信带宽也会成为严重瓶颈。PCIe 4.0 x16的单向带宽约为32GB/s,8卡之间共享PCIe交换结构时,叠加拥塞和多次转发后有效带宽更低,难以支撑千亿参数模型的高频通信需求。
NVLink是NVIDIA专为GPU间直连设计的高速互联技术,单链路即可提供远高于PCIe的带宽。而NVSwitch则把多个GPU的NVLink端口汇聚到专用交换芯片上,构建一个GPU间的全互联网络,使任意两张GPU都能以接近原生NVLink速度进行通信。对于8卡训练服务器来说,NVLink总带宽越大,NVSwitch交换能力越强,单机内部的数据并行all-reduce、张量并行all-gather等集合通信效率就越高,训练吞吐也会越接近理论峰值。
8卡A100的NVLink与NVSwitch拓扑解析
A100 SXM版本是上一代大模型训练的主力计算卡,单卡集成12条NVLink 3.0链路,每条链路支持双向50GB/s带宽,因此单卡NVLink总带宽达到600GB/s。8卡A100服务器通常采用HGX A100 8-GPU基板设计,配备6个NVSwitch交换芯片。每张A100的12个NVLink端口会均匀连接到这6个NVSwitch上,由NVSwitch完成所有8张GPU之间的全互联交换。这种拓扑意味着任意两张A100之间的通信路径都不需要经过CPU或PCIe总线,而是直接通过NVLink和NVSwitch完成,能够有效降低通信延迟并提升多卡扩展能力。
需要特别注意的是,A100存在PCIe版本和SXM版本两种形态。PCIe版本的A100没有完整的NVSwitch互联能力,多卡通信通常依赖PCIe或双卡NVLink桥接,无法在8卡规模上实现全互联。很多标注为8卡A100的服务器,如果采用PCIe版本,实际训练大模型时通信性能会与HGX整机方案相差巨大。因此选购时必须确认服务器是SXM版本并带有6个NVSwitch,而不是只有PCIe插槽的通用服务器。
8卡H100的NVLink与NVSwitch拓扑变化
H100 SXM版本在NVLink互联上进一步升级,单卡集成18条第四代NVLink链路,单链路仍然是双向50GB/s,但链路数量从12条增加到18条,使单卡NVLink总带宽从600GB/s提升到900GB/s。8卡H100服务器典型使用HGX H100 8-GPU基板,只配备4个第三代NVSwitch。与A100使用6个NVSwitch不同,H100的NVSwitch交换芯片单颗端口容量更大,4个NVSwitch即可承接8张GPU的18条链路,并继续维持全互联拓扑。这说明NVSwitch数量并不是越多越好,更重要的是交换芯片端口数量、带宽和总体无阻塞交换能力。
H100的NVSwitch还支持SHARP网络内归约能力,可以在交换芯片中直接完成部分集合通信运算,例如all-reduce中的求和操作,从而进一步减少GPU端的数据往返次数。对于超大参数模型来说,这种能力可以显著降低通信开销,使H100在8卡规模下相比A100更有利于推进张量并行和流水线并行。与此同时,H100 SXM版本的显存升级为HBM3,带宽也大幅提升,能够与更高的互联带宽形成更好的配合。
A100与H100互联参数对比
为了更直观地比较两代8卡服务器的核心通信参数,下面通过表格列出关键差异。
| 对比项 | 8卡A100 SXM | 8卡H100 SXM |
|---|---|---|
| 单卡显存 | 80GB HBM2e | 80GB HBM3 |
| 单卡NVLink链路数 | 12条 | 18条 |
| 单链路带宽 | 50GB/s双向 | 50GB/s双向 |
| 单卡NVLink总带宽 | 600GB/s | 900GB/s |
| NVSwitch数量 | 6个 | 4个 |
| 8卡全互联带宽 | 600GB/s | 900GB/s |
| 典型整机功耗 | 约6.5kW | 约10.2kW |
从表中可以看出,H100在单卡NVLink带宽上比A100高出50%,这意味着在同等通信模式下,H100完成同样大小的梯度同步或激活值交换所需时间更短。不过,H100整机功耗也明显更高,对机房供电、散热和机柜承重都提出更严格要求。A100虽然参数上落后一代,但生态成熟、二手货源充足,对于部分中等规模模型或预算有限的团队仍然具备实用性。
除了带宽指标,还要关注NVSwitch的扩展能力。A100的6个NVSwitch方案在端口数量上有一定冗余,但H100的4个NVSwitch方案凭借更高端口密度反而减少了交换芯片数量,简化了系统设计。因此选购时不应以NVSwitch数量作为唯一依据,而要结合单卡NVLink链路数、总带宽以及是否支持网络内归约等能力综合判断。
选购8卡GPU服务器时的几个关键判断
第一,确认GPU形态是否为SXM或NVL版本。SXM版本是获得完整NVLink和NVSwitch能力的基础,PCIe版本无法实现8卡全互联,只能用于单卡推理或轻量多卡任务。如果服务器产品页只写8卡A100或8卡H100,却没有明确标注SXM或HGX,需要进一步核实具体型号。H100还有一种NVL版本,主要面向双卡或大显存场景,选购8卡训练服务器时仍要优先考虑HGX H100整机。
第二,关注NVSwitch是否原厂集成。HGX基板通常已经包含NVSwitch交换芯片,而某些定制服务器可能采用PCIe扩展或第三方互联方案,这会改变通信拓扑和性能表现。建议优先选择NVIDIA DGX整机或经过认证的HGX服务器,避免自行改装导致NVLink端口未接满、固件不兼容或散热不达标等问题。
第三,评估整机功耗与散热条件。8卡A100整机典型功耗约6.5kW,H100则接近10.2kW,需要数据中心提供足够的单机柜电力容量,并配置风冷或液冷方案。如果机房无法承受8卡H100的发热密度,即使通信拓扑再好,实际训练也会因降频或宕机而中断。此外,多机扩展时还要考虑InfiniBand或RoCE网络,单机内部的NVLink只能解决8卡以内的高速互联,跨机通信仍需要高速网卡配合。
总结
8卡A100与H100服务器的本质区别,并不只是单卡算力代际,而是NVLink链路数量、NVSwitch拓扑以及由此带来的多卡通信效率差异。A100以12条NVLink链路和6个NVSwitch实现了600GB/s的单卡互联带宽,H100则用18条链路和4个第三代NVSwitch把带宽提升到900GB/s,并加入网络内归约能力,更适合超大规模模型训练。选购时应重点确认SXM形态、NVSwitch原厂集成、整机功耗和散热条件,避开只有PCIe插槽的所谓8卡方案。只有把GPU算力和通信拓扑放在同等重要的位置,才能搭建出真正高效的大模型训练服务器。