AI高速互联+交换芯片+超节点,需求持续增长的公司(附名单)
展开
评价AI服务器,以前看GPU数量、单卡算力、显存容量就差不多了,进入超节点和万卡集群以后,只看这些指标已经不够了。大模型训练时,不同GPU需要不断交换参数、激活值和中间结果。推理上下文变长以后,系统还要频繁读取和保存KV Cache。GPU数量越多,需要交换的数据越多,通信等待也越容易成为瓶颈。一旦数据传输速度跟不上,GPU就只能停下来等待。机房里的芯片数量增加了,理论算力提高了,实际完成的训练任
