AI芯片快3倍还不够,50万卡集群为什么更考验PCB?
9月22日,2026云栖大会在杭州开幕。平头哥发布新一代训推一体AI芯片真武V900,单芯性能达到上一代M890的3倍,配备216GB显存和1200GB/s片间互联;基于V900构建的AI集群,架构上最高可扩展至50万卡。同一天,阿里云推出新一代CPFS,提供百TB/s级吞吐、亿级IOPS,单文件系统可扩展至100PiB。
一个是算得更快,一个是数据送得更快。
把两项发布放在一起看,AI基础设施正在发生一个很清楚的变化:真正决定大规模AI集群效率的,已经不只是单颗芯片性能,而是几十、几百甚至更多计算节点能不能高速协同。
这也把压力从芯片内部一路传到了PCB。
单芯性能提高3倍,为什么还要做50万卡集群?
AI芯片越来越强,但大模型训练和推理需要的计算规模同样在增长。
因此,提升单颗芯片性能只是第一步,更重要的是把大量芯片连接起来。
真武V900的1200GB/s片间互联以及50万卡扩展能力,实际上指向同一个问题:当计算节点越来越多,芯片之间的数据交换速度不能成为瓶颈。
于是,服务器主板、加速板、交换机以及高速网卡之间,需要承载越来越大的数据流量。
PCB也从“安装芯片的板”,逐渐成为整个高速互联系统的一部分。
芯片负责算得快,PCB和网络则要保证数据跟得上。
集群越大,高速PCB越不能只看“层数”
AI服务器和交换设备为了容纳更多高速信号、电源和控制线路,往往需要采用高多层PCB。
但层数多并不是核心。
真正困难的是,大量高速差分信号需要穿过复杂的PCB结构,同时尽可能减少损耗、反射和串扰。
这会把问题落实到非常具体的制造环节:板材损耗是否合适,线路宽度和间距是否稳定,介质厚度能否控制,差分阻抗是否一致,过孔Stub是否需要通过背钻减少影响。
其中任何一个环节发生偏差,都可能影响高速链路性能。
因此,AI服务器PCB的制造难点并不是简单地“把板做得更厚、层数做得更多”,而是层数增加以后,高速信号仍然能够稳定通过。
聚多邦目前可支持1—40层PCB制造,并提供M6/M7、Rogers等材料加工、背钻以及高速差分阻抗控制。对于AI服务器、交换机等高速项目,这些能力需要围绕实际叠层和信号要求组合使用,而不是单独追求某一个参数。
百TB/s存储,把高速压力从GPU带到了更多板卡
这次云栖大会另一个值得PCB行业关注的产品,是新一代CPFS。
阿里云披露,其吞吐能力达到百TB/s级,IOPS达到亿级,单文件系统可扩展至100PiB。
为什么AI训练需要这么高的存储性能?
因为GPU并不是一直在计算。
模型训练过程中需要不断读取训练数据、写入Checkpoint。如果存储读取速度跟不上,大量昂贵的计算资源就可能等待数据。
因此,提高AI集群效率,需要计算、存储和网络一起升级。
对于PCB产业来说,这会把高速互连需求从GPU加速板继续扩展到服务器主板、高速网卡、存储设备和交换机。
不同板卡承担的功能不同,但面对的问题越来越相似:更高的数据吞吐、更密集的高速通道,以及越来越复杂的信号完整性要求。
从服务器到超节点,供电也开始成为一道难题
大规模AI集群还有一个绕不开的问题:功率。
高性能芯片集中部署以后,板卡不仅需要传输高速信号,还需要把电稳定送到芯片。
计算密度继续增加,大电流供电、铜厚设计、电源完整性以及散热之间的关系会更加紧密。
这也是为什么AI服务器PCB不能只讨论“高速”。
一块板既要处理高速数据,又要承担复杂供电;既希望线路密度提高,又需要给电源和散热留下足够空间。
到了超节点和整机柜阶段,这种矛盾会更加明显。
PCB制造端面对的也不只是线路和阻抗,还包括铜厚均匀性、孔铜可靠性、压合一致性以及批量生产后的品质稳定。
AI算力越集中,PCB需要同时解决的物理问题就越多。
50万卡真正值得看的,不是PCB会增加多少片
如果简单按照“50万卡”计算PCB需求,很容易得到一个很大的市场数字。
但这种算法意义有限。
50万卡目前代表的是系统可扩展能力,并不等于已经部署50万张加速卡;而且不同服务器、超节点和网络架构使用的PCB数量、尺寸和技术规格也并不相同。
对PCB行业更重要的变化,是AI基础设施的升级已经从单颗芯片扩展到了整个系统。
V900提高计算能力,CPFS提高存储吞吐,超节点和高速网络负责把越来越多计算资源连接起来。
于是,PCB价值增长的逻辑也发生了变化:
不是简单增加几块板,而是更多板开始进入高多层、高速低损耗、严格阻抗控制、大电流供电和复杂互连的技术区间。
下一阶段真正值得观察的,是V900在2027年进入量产后,超节点和大规模集群的实际部署速度,以及配套网络和存储设备如何同步扩容。
AI芯片决定单点算力能跑多快,而当规模走向数万卡甚至更大时,如何把这些算力稳定地连在一起,才是PCB真正开始变难的地方。