中国数据中心算力利用率低并不是需求问题,而是结构性的设计问题,这与算力卡性能共同拉大了中美算力差距。
首先说明,数据中心并不是全部用于人工智能,包括了极大的互联网时代遗留。结构性问题很多是前代遗留下来的,非常黑色幽默的是,中国的算力利用低问题并不是“大而整”而是散。
问题的根源大致可以分成四层,需求端太碎,供给端太分散,地理错配,硬件错配。首先说需求太碎和供给端分散的问题,大量企业、政府、国企仍然是自建机房、私有云,在集中的云计算能力上中国远不如美国大企业,所以全国算力资源很难像美国那样高强度统一调度。当算力缺乏问题出现时,美国企业立即构建了“战略同盟”,全美算力可以集中供应大厂。
再说地理错配问题,美国弗吉尼亚形成了一个巨大的网络枢纽,北弗吉尼亚早期就是MAE-East等互联网交换基础设施所在地,之后AWS、Microsoft、Google不断集中建设,产生正反馈,而而中国早期骨干互联网节点集中在北京、上海、广州、成都等城市;呼和浩特、中卫、张北等大型数据中心基地过去反而缺少同等级骨干直联点,所以不仅是“远”。
最后是硬件错配,智算中心会同时存在 NVIDIA、华为昇腾、海光、寒武纪、各种国产加速卡,不同中心甚至不同批次都不一样,芯片型号极其复杂。软件栈、算子、通信库、编译器、框架适配不统一。一个模型在A集群调好了,不一定能直接扔到B集群跑………
除了利用率低外,另一个指标也会严重拉大中美在算力上的差距,那就是性能。单卡算力更低、单位功耗性能更低、集群互联效率更低,这是中国厂商采用中国卡面对的一个巨大的挑战,此外,B300和R系卡的绝大多数流入美国,这些卡带来的性能跃升显著红利主要由美国算力厂商承接,中国可以通过走私得到少部分,但这远远无法和美国算力厂商相比。