跳转到内容
文韬博宇的个人主页
返回

第十一章 Colossus奇迹

· 约 7 分钟

2024年7月,田纳西州,孟菲斯。

马斯克站在一片刚刚平整完的土地上,面前是一栋还没挂招牌的建筑。

一百二十二天前,这里还是一片空地。

一百二十二天后,这里装着十万块H100 GPU。

他在Twitter上发了一条推文,配了十二张工地照片:

“Colossus is online.”

同一时刻,地球上还有三件事在同步发生。英伟达在圣克拉拉总部的物流中心,最后一批H100正在装车发往孟菲斯,运输车队在101号公路上排了将近一公里。Google在俄克拉荷马州宣布TPU v5p集群全面上线——那是当时Google最大的单体算力投资。而北京海淀区的一栋写字楼里,华为昇腾团队刚刚跑通了第一个国产万卡集群的满负荷测试,没有对外宣布,只有项目组的微信群里发了一场红包雨。

英伟达数据中心官方账号在下面回复:

“世界上最大的GPU超级计算机Colossus,在创纪录的时间内上线了。”

十万块H100是什么概念?

每秒浮点运算能力超过2×10²⁰次。这是当时全球最强的单体AI训练集群,没有之一。

Colossus的建设速度,是整个科技史上最快的大型数据中心部署记录。

通常,一个容纳十万块GPU的数据中心,从选址到建成,最快也需要十八个月。

马斯克用了一百二十二天。

他的方法后来被工程界叫做”马斯克式并行”:

同时做所有事情。

电力系统还在审批的时候,土建已经开工了。冷却系统还没交付的时候,服务器架已经竖起来了。十万块GPU的装机顺序,是按照到货时间精确排列的——每一批货到,现场的安装团队立刻开始上架,一块都不等。

xAI的工程团队在那122天里,轮班倒,没有周末,没有节假日。

马斯克在工程现场待了整整七天。他住在孟菲斯郊区的一个酒店里,每天早上六点到工地,晚上十一点离开。

有人拍到他在工地上端着咖啡看图纸的照片。照片里的他看起来比平时更瘦,也更专注。

Colossus上线一周后,孟菲斯当地居民开始投诉。

投诉的内容只有一个:噪音。

十万块GPU同时运转,配套的冷却系统需要大量的风扇和冷水机组。这些设备产生的噪音,让距离数据中心不到八百米的居民区,在深夜依然无法入睡。

孟菲斯市议会召开了一次紧急听证会。

马斯克没有出席。他派了一位xAI的政府关系负责人去解释。

解释的内容是:Colossus是一台机器,不是武器。它产生的不是噪音,是算力。它为孟菲斯带来的不是污染,是就业和税收。

居民代表不买账。

一位市议员在听证会上举起了一叠居民签名的请愿书,当众读到:“孟菲斯不是一个你可以随意倾倒噪音和废热的地方。我们欢迎科技,但科技不能把我们的家变成一座工厂。“另一位议员追问xAI代表:数据中心每天消耗多少水?冷却塔的蒸发量对本地水资源的影响评估在哪里?xAI代表翻开手中的文件夹,翻了两页,又合上了。他没有这些数据。

听证会没有达成任何结论。xAI答应安装隔音墙,然后私下里加快了二期扩容的速度——因为他们知道,下一批十万块GPU,三个月后就要到了。

2024年8月,黄仁勋在一场投资者大会上说:

“Colossus是英伟达历史上最大的一笔单客户订单。”

他没有说xAI的名字,但所有人都知道他在说谁。

2024年全年,英伟达向xAI供应的GPU总量,超过了它向任何一个其他单一客户的供应量。

这是军火商和争霸者之间最微妙的关系:他们互相需要,但最终会在某个时刻成为彼此的对手。

黄仁勋心里清楚:xAI在Colossus之后,会成为英伟达最重要的客户之一。

但如果马斯克的Dojo最终量产,如果xAI开始用自己的芯片——那个客户,会在一夜之间消失。

Colossus的算力不只用来训练Grok。

马斯克在Colossus一期交付那天,私下对xAI的工程副总裁说了一句话,没有出现在任何发布会通稿里:“这座工厂跑的不只是大模型。Optimus的大脑,也要在这里出生。”

Optimus——特斯拉的人形机器人项目,从2022年AI Day发布以来,一直在用一个相对较小规模的GPU集群跑运动控制模型。那个集群的算力,跟Colossus不在一个量级。用Colossus训练Optimus,意味着一件事:机器人的”大脑”,将不再是手写的控制算法,而是端到端神经网络——跟大语言模型一样的架构,只是输入是摄像头图像,输出是关节力矩。

马斯克没有对外宣布这件事。但xAI内部有人把这句话截图发到了X上。帖子活了四十分钟就被删了。但四十分钟足够让硅谷的同行们开始问同一个问题:如果Optimus的大脑是在Colossus里训练的,那”算力争霸”的终点,不是聊天机器人——是机器人身体。

Colossus二期上线的那一天,SpaceX的工程师在孟菲斯数据中心外面发现了一件事。

建筑外围的一圈草坪,颜色比周围更绿。

他们查了记录,发现xAI的设施团队在Colossus二期建设期间,把数据中心产生的废热,接入了孟菲斯市区的供暖系统。

这是全球第一个用AI数据中心废热为城市供暖的案例。

马斯克在内部说:

“每一块GPU都在发热。与其让它白白散掉,不如让它有用。”

孟菲斯市政府后来把这件事写进了年度可持续发展报告。

几个月后,有人在X上问马斯克Colossus的废热利用率是多少。他回了一条四个字的回复:“100% eventually.”这个回复获得了超过二十万次点赞——但孟菲斯的暖通工程师们私下里说,要实现百分之百的热回收利用,需要全市管道系统的全面改造,这不是”eventually”能解决的问题。

那一年,Colossus为孟菲斯市区提供了相当于三千户居民冬季供暖所需的余热。

Colossus上线两个月后,xAI的核心创始成员开始离职。

第一个走的人,是Igor Babuschkin——那个从DeepMind跳槽过来,说”我在DeepMind从来没见过AI真正被用上”的人。

他在离职声明里说了一句后来被广泛引用的话:

“我来xAI是为了造最强的AI模型,不是为了建轨道数据中心。”

没有人提到”轨道数据中心”这个词。但所有人都知道他在说什么。

到2024年底,xAI最初的十二位核心创始成员中,已有八位相继离职。

马斯克在一次内部会议上说:

“每个人都有自己的优先项。我尊重他们的选择。但我不会改变方向。”

他的方向是:算力即一切。有了最大的算力集群,就有了最强大的AI。而有了最强大的AI,就有了改变一切的可能性。

这个逻辑,他信。

122天建成的Colossus,是马斯克”速度即一切”哲学的最大实验,也是他与团队之间最大分歧的起点。黄仁勋向xAI提供了最多的芯片,同时在计算另一件事:争霸者的Dojo什么时候会量产,什么时候会不再需要他。

中国的昇腾,在Colossus成为全球头条的那个月,悄悄完成了第一批万卡集群的部署。那件事,没有人报道。Colossus十万块GPU全力运转,一天的耗电量相当于一座五万人口的城镇——同一时间,宁德时代的数据中心储能系统正在商汤科技上海临港AIDC跑通测试。算力吃的不是芯片,是电。

2024年底,三条战线的态势已经清晰: 英伟达仍坐拥芯片市场80%,但Google TPU、亚马逊Trainium开始蚕食。 马斯克建起了全球最大私人算力集群,但他需要更多——他开始看向太空。 中国的昇腾在禁令下完成了第一次量产,代价是整个行业换了一遍软件栈。 没有人赢了。战争还在继续。