从PCB制造到组装一站式服务

智谱GLM-5.3-FlashX上线,国产大模型商业化加速拉动算力基建

2026
09/21
本篇文章来自
聚多邦

模型推理快了5倍,为什么算力集群反而可能越建越大?

9月18日,智谱上线GLM-5.3-FlashX,官方披露其推理速度达到约200 tokens/s,约为GLM-5.3-Flash的5倍。与此同时,智谱将2026年ARR预期由24亿美元上调至30亿美元。中信建投研报还提到,此前上线的10万卡国产芯片推理集群迅速达到满负荷。

一个看起来有些反常的问题随之出现:

模型推理越来越快,为什么还要继续建设更多算力?

答案可能恰恰藏在商业化里。推理效率提高、成本下降以后,AI能够进入更多应用,调用次数也可能随之增加。对PCB产业而言,比“模型参数又大了多少”更值得关注的,是推理正在从少量实验需求变成持续运行的基础设施需求。


推理变便宜,不一定意味着服务器变少

训练大模型更像一次集中建设,而推理则发生在模型投入使用之后。

用户每问一次问题、智能体每执行一次任务、企业每调用一次API,背后都需要推理算力。

如果一次调用成本很高,很多应用很难大规模使用;当模型速度提高、单位成本下降,原本“不值得调用AI”的场景也可能开始接入。

智谱此次同步上调ARR预期,就是一个值得关注的商业化信号。模型真正进入软件开发、办公、智能体和企业服务后,算力需求会越来越多地由“有多少人持续使用”决定。

单次推理效率提高了,总推理量却可能增长得更快。

这也是10万卡推理集群迅速满负荷比单纯的模型跑分更值得硬件产业关注的原因。


10万张芯片之后,PCB承担的是一整套算力网络

10万张芯片并不等于10万块PCB,也不能据此简单计算PCB需求数量。

真正的算力集群是一套复杂系统。

计算芯片需要安装在服务器板卡上,服务器之间需要交换数据,再通过交换机、网卡、光模块、电源等设备连接成完整集群。

规模扩大以后,PCB需求因此分布在服务器主板、加速卡、高速交换设备、电源系统等多个位置。

其中,高多层PCB负责容纳复杂的高速信号和电源网络;HDI可以在有限面积内增加互连密度;高速差分线路则要解决处理器、网络接口等节点之间的数据传输。

所以国产算力集群扩大带来的变化,并不是简单“多用几块板”。

而是计算节点越多,把这些节点连成一个整体的互连系统也越复杂。


芯片数量上去后,最难的是让数据别堵在路上

推理集群扩张还有一个很现实的问题:芯片多,并不代表算力就能按相同比例增加。

大量计算节点需要频繁交换数据,如果网络和互连跟不上,芯片就可能等待数据。

因此,AI基础设施升级正在同时推动服务器内部和服务器之间的高速连接。

到了PCB制造环节,这些高速信号会进一步落实到材料、叠层、线宽线距、阻抗以及背钻等具体工艺。

信号速率越高,线路上的损耗、反射和串扰越值得关注。对于高多层板而言,层数增加以后,压合、钻孔以及层间对准等制造环节也会变得更加复杂。

算力芯片负责“算得快”,PCB和网络则要保证数据“送得上”。

两者缺一不可。


推理集群持续扩容,PCB也要适应“边跑边加”

这和一次性建设传统服务器机房还有一点不同。

当AI应用不断增加,推理集群往往需要根据实际负载继续扩容。第一批服务器上线并不代表建设结束,后面还可能增加新的计算节点、网络设备和配套电源。

制造端因此需要同时面对研发验证和后续批量交付。

聚多邦目前PCB制造覆盖1—40层、1—5阶HDI,并支持高速差分阻抗控制、背钻以及PCB+SMT+PCBA等制造环节。对于算力服务器、高速通信及相关测试控制板卡,这类制造能力对应的正是高密度互连、高速信号以及从样板验证向批量生产过渡的需求。

而真正需要关注的,也不只是某一批板能不能生产出来。

当算力集群持续扩容,PCB制造还要面对不同批次之间的阻抗、孔铜、线路和装配一致性。


国产算力下一阶段,要看的可能是“调用量”

过去观察AI硬件需求,行业习惯看模型参数、训练集群规模和GPU采购量。

大模型进入商业化阶段以后,还需要增加一个指标:模型到底被调用多少次。

如果AI智能体、编程、办公和企业应用持续增加,即使单次推理效率不断提高,总算力消耗仍可能继续增长。

这也是GLM-5.3-FlashX值得PCB行业关注的地方。

它带来的产业问题并不是“模型快5倍,所以PCB也要快5倍”,而是效率提高以后,AI有没有可能被更多人、更高频率地使用。

如果答案持续得到验证,那么算力基础设施面对的就不是一次扩建。

模型越便宜、越好用,调用量越可能上升;调用量越大,支撑这些调用的服务器、网络和PCB,就越需要从“建一批”走向“持续扩”。


the end