5月21日,智谱AI携手驭驯网络与清华大学共同宣布,在GLM-5.1线上生产集群完成新一代网络架构ZCube的规模化部署。令人惊喜的是,整套方案在GPU数量、软件栈及上层应用完全不变的前提下,仅凭网络层重构,就让大模型推理性能再上一个台阶。
实测数据显示,ZCube在GLM-5.1 coding场景下带来三重收益:首先,交换机和光模块采购费用直降33%,显著削减CAPEX;其次,GPU平均推理吞吐提升15%,相当于免费获得额外算力;最后,首token延迟(TTFT)P99指标大幅压缩40.6%,终端用户几乎“零等待”。
对调用智谱GLM大模型API的企业而言,新架构意味着同样规模的硬件可承载更高并发,流量高峰时接口稳定性同步增强。每秒多处理15%请求,不仅提升SLA,也为后续商业扩容留出弹性空间。
行业观察人士指出,当GPU集群进入万卡级别,网络带宽与拓扑往往成为瓶颈。ZCube通过动态路由、负载均衡及协议栈卸载等技术,把数据搬运时间缩到最短,从而让计算核心真正“满血”运行。此举为“后摩尔时代”提供了一条“不加卡、不烧钱”的提效路径。
在生成式AI竞争白热化的当下,智谱用一套“轻资产”网络升级方案,验证了软件定义基础设施的价值。随着ZCube在更多场景复制,大模型服务商或将以更低成本、更优体验加速商业化落地。