采购 AI 服务器时,最常见的提问方式是"这台机器几张卡"。但卡数只是表象,真正决定适配度的,是这台机器要干的事——模型训练和推理部署,对硬件的要求已经分化成两条不同的技术路线。用训练型的思路去采购推理设备,往往会花冤枉钱。
训练:追求的是吞吐与互联
训练的本质是海量数据反复迭代,直到模型收敛。它的负载特征是长时间满载运行、多卡协同、数据批量大。因此训练型 AI 服务器的设计重心在三点:一是卡间互联带宽,多张加速卡之间需要高速通道交换梯度数据,互联带宽不足会让卡数优势打折;二是显存与池化能力,大模型的参数、梯度、优化器状态都要占显存,显存不够就跑不动更大模型;三是扩展形态,从单机 8 卡到超节点、再到整机柜集群,规模扩展时互联架构要能跟上。
这也是近年 AI 服务器架构从"以 GPU 为中心"向"系统级超节点"演进的原因——通过开放互联协议把多张卡组织成统一寻址的计算域,以支撑万亿参数级模型的训练需求。