第十一章 Colossus奇迹
一
2024年7月,田纳西州,孟菲斯。
马斯克站在一片刚刚平整完的土地上,面前是一栋还没挂招牌的建筑。
一百二十二天前,这里还是一片空地。
一百二十二天后,这里装着十万块H100 GPU。
他在Twitter上发了一条推文,配了十二张工地照片:
“Colossus is online.”
同一时刻,地球上还有三件事在同步发生。英伟达在圣克拉拉总部的物流中心,最后一批H100正在装车发往孟菲斯,运输车队在101号公路上排了将近一公里。Google在俄克拉荷马州宣布TPU v5p集群全面上线——那是当时Google最大的单体算力投资。而北京海淀区的一栋写字楼里,华为昇腾团队刚刚跑通了第一个国产万卡集群的满负荷测试,没有对外宣布,只有项目组的微信群里发了一场红包雨。
英伟达数据中心官方账号在下面回复:
“世界上最大的GPU超级计算机Colossus,在创纪录的时间内上线了。”
十万块H100是什么概念?
每秒浮点运算能力超过2×10²⁰次。这是当时全球最强的单体AI训练集群,没有之一。
二
Colossus的建设速度,是整个科技史上最快的大型数据中心部署记录。
通常,一个容纳十万块GPU的数据中心,从选址到建成,最快也需要十八个月。
马斯克用了一百二十二天。
他的方法后来被工程界叫做”马斯克式并行”:
同时做所有事情。
电力系统还在审批的时候,土建已经开工了。冷却系统还没交付的时候,服务器架已经竖起来了。十万块GPU的装机顺序,是按照到货时间精确排列的——每一批货到,现场的安装团队立刻开始上架,一块都不等。
xAI的工程团队在那122天里,轮班倒,没有周末,没有节假日。
马斯克在工程现场待了整整七天。他住在孟菲斯郊区的一个酒店里,每天早上六点到工地,晚上十一点离开。
有人拍到他在工地上端着咖啡看图纸的照片。照片里的他看起来比平时更瘦,也更专注。
三
Colossus上线一周后,孟菲斯当地居民开始投诉。
投诉的内容只有一个:噪音。
十万块GPU同时运转,配套的冷却系统需要大量的风扇和冷水机组。这些设备产生的噪音,让距离数据中心不到八百米的居民区,在深夜依然无法入睡。
孟菲斯市议会召开了一次紧急听证会。
马斯克没有出席。他派了一位xAI的政府关系负责人去解释。
解释的内容是:Colossus是一台机器,不是武器。它产生的不是噪音,是算力。它为孟菲斯带来的不是污染,是就业和税收。
居民代表不买账。
一位市议员在听证会上举起了一叠居民签名的请愿书,当众读到:“孟菲斯不是一个你可以随意倾倒噪音和废热的地方。我们欢迎科技,但科技不能把我们的家变成一座工厂。“另一位议员追问xAI代表:数据中心每天消耗多少水?冷却塔的蒸发量对本地水资源的影响评估在哪里?xAI代表翻开手中的文件夹,翻了两页,又合上了。他没有这些数据。
听证会没有达成任何结论。xAI答应安装隔音墙,然后私下里加快了二期扩容的速度——因为他们知道,下一批十万块GPU,三个月后就要到了。
四
2024年8月,黄仁勋在一场投资者大会上说:
“Colossus是英伟达历史上最大的一笔单客户订单。”
他没有说xAI的名字,但所有人都知道他在说谁。
2024年全年,英伟达向xAI供应的GPU总量,超过了它向任何一个其他单一客户的供应量。
这是军火商和争霸者之间最微妙的关系:他们互相需要,但最终会在某个时刻成为彼此的对手。
黄仁勋心里清楚:xAI在Colossus之后,会成为英伟达最重要的客户之一。
但如果马斯克的Dojo最终量产,如果xAI开始用自己的芯片——那个客户,会在一夜之间消失。
Colossus的算力不只用来训练Grok。
马斯克在Colossus一期交付那天,私下对xAI的工程副总裁说了一句话,没有出现在任何发布会通稿里:“这座工厂跑的不只是大模型。Optimus的大脑,也要在这里出生。”
Optimus——特斯拉的人形机器人项目,从2022年AI Day发布以来,一直在用一个相对较小规模的GPU集群跑运动控制模型。那个集群的算力,跟Colossus不在一个量级。用Colossus训练Optimus,意味着一件事:机器人的”大脑”,将不再是手写的控制算法,而是端到端神经网络——跟大语言模型一样的架构,只是输入是摄像头图像,输出是关节力矩。
马斯克没有对外宣布这件事。但xAI内部有人把这句话截图发到了X上。帖子活了四十分钟就被删了。但四十分钟足够让硅谷的同行们开始问同一个问题:如果Optimus的大脑是在Colossus里训练的,那”算力争霸”的终点,不是聊天机器人——是机器人身体。
五
Colossus二期上线的那一天,SpaceX的工程师在孟菲斯数据中心外面发现了一件事。
建筑外围的一圈草坪,颜色比周围更绿。
他们查了记录,发现xAI的设施团队在Colossus二期建设期间,把数据中心产生的废热,接入了孟菲斯市区的供暖系统。
这是全球第一个用AI数据中心废热为城市供暖的案例。
马斯克在内部说:
“每一块GPU都在发热。与其让它白白散掉,不如让它有用。”
孟菲斯市政府后来把这件事写进了年度可持续发展报告。
几个月后,有人在X上问马斯克Colossus的废热利用率是多少。他回了一条四个字的回复:“100% eventually.”这个回复获得了超过二十万次点赞——但孟菲斯的暖通工程师们私下里说,要实现百分之百的热回收利用,需要全市管道系统的全面改造,这不是”eventually”能解决的问题。
那一年,Colossus为孟菲斯市区提供了相当于三千户居民冬季供暖所需的余热。
六
Colossus上线两个月后,xAI的核心创始成员开始离职。
第一个走的人,是Igor Babuschkin——那个从DeepMind跳槽过来,说”我在DeepMind从来没见过AI真正被用上”的人。
他在离职声明里说了一句后来被广泛引用的话:
“我来xAI是为了造最强的AI模型,不是为了建轨道数据中心。”
没有人提到”轨道数据中心”这个词。但所有人都知道他在说什么。
到2024年底,xAI最初的十二位核心创始成员中,已有八位相继离职。
马斯克在一次内部会议上说:
“每个人都有自己的优先项。我尊重他们的选择。但我不会改变方向。”
他的方向是:算力即一切。有了最大的算力集群,就有了最强大的AI。而有了最强大的AI,就有了改变一切的可能性。
这个逻辑,他信。
122天建成的Colossus,是马斯克”速度即一切”哲学的最大实验,也是他与团队之间最大分歧的起点。黄仁勋向xAI提供了最多的芯片,同时在计算另一件事:争霸者的Dojo什么时候会量产,什么时候会不再需要他。
中国的昇腾,在Colossus成为全球头条的那个月,悄悄完成了第一批万卡集群的部署。那件事,没有人报道。Colossus十万块GPU全力运转,一天的耗电量相当于一座五万人口的城镇——同一时间,宁德时代的数据中心储能系统正在商汤科技上海临港AIDC跑通测试。算力吃的不是芯片,是电。
2024年底,三条战线的态势已经清晰: 英伟达仍坐拥芯片市场80%,但Google TPU、亚马逊Trainium开始蚕食。 马斯克建起了全球最大私人算力集群,但他需要更多——他开始看向太空。 中国的昇腾在禁令下完成了第一次量产,代价是整个行业换了一遍软件栈。 没有人赢了。战争还在继续。