7万亿美元即将砸向GPU云,而每一家服务商都被要求在一夜之间把规模做大100倍。这是SemiAnalysis在最新一期周报里抛出的判断,也是他们花三个月实测77家GPU云之后,最想让人正视的现实。 这期节目的阵容是Jordan Nanos主持,对谈Sam Harshe和Pratt Bhatt,两人刚从77家GPU云的测试现场回来。测试内容覆盖了新排名、健康检查、缓存命中率、NCCL、集群上的智能体、一个Linux内核bug、安全性、融资与兜底、H100,以及托管式强化学习训练。 三个月测完77家,测的是什么 ClusterMAX 3.0这次把评测范围拉到了77家服务商。这个数字本身就是信号:GPU云早已不是几家巨头的游戏,而是一个玩家数量快速膨胀、质量却参差不齐的市场。 评测维度里,健康检查和缓存命中率属于基础功,NCCL关系到多卡通信效率,集群上的智能体则指向新的负载形态。一个Linux内核bug被单独拎出来讲,说明在真实压力下,底层软件栈的问题会直接暴露。 安全性和融资兜底被放进同一份榜单,也说明选GPU云不只是比算力,还要比这家公司能不能活下去、出事之后有没有人接盘。 行业里人人都像天才,但利润率是个问号 节目里有一句很扎眼的评价:“眼下这个行业里,几乎每个人看起来都像个天才。”这句话的语境,是GPU云正处在需求爆发的窗口期,谁进场都像是踩对了点。 但紧接着就有人反问:“不可能吧。我还以为做推理业务轻轻松松就能拿到80%的毛利?”这句反问本身就是吐槽——外界对GPU云利润率的想象,和真实经营状况之间,可能隔着不小的距离。 测试团队里有人开玩笑说,从测试开始到现在,这是他第一次见到阳光。这句自嘲背后是三个月高强度实测的强度,也侧面说明这份榜单不是拍脑袋排出来的。 明年选谁,成了真问题 节目里抛出的另一个问题是:“进入明年,你的Vera Rubin要托付给谁?”这个问题把选型焦虑摆到了台面上——当硬件代际在推进,服务商的能力和稳定性直接决定训练任务能不能跑完。 7万亿美元的投入预期,和“一夜之间做大100倍”的要求,构成了这个行业当下最尖锐的矛盾。钱不是问题,能不能接住才是。 77家服务商里,谁的健康检查更稳、谁的缓存命中率更高、谁的NCCL通信更顺、谁在安全性和融资兜底上更靠谱,这些才是决定排名的硬指标。ClusterMAX 3.0给出的,就是这样一份基于实测的答案。 特别