跳转到内容
文韬博宇的个人主页
返回

第八章 Dojo的秘密

· 约 6 分钟

2019年8月,特斯拉内部启动了一个没有出现在任何官方新闻稿里的项目。

项目负责人是一个叫谷俊丽的工程师。她在加入特斯拉之前,是苹果自动驾驶项目的核心成员。

项目内部代号:Dojo。

在日语里,“道场”是修炼的地方。

马斯克给这个项目的定义只有一句话:“训练自动驾驶AI的超级计算机——不依赖英伟达的GPU。”

他说这话的时候,特斯拉Autopilot团队的工程师刚刚完成了一次内部测试:用英伟达的GPU训练一套目标检测模型,跑了整整三天。

马斯克问:“能不能更快?”

工程师说:“可以,但要买更多GPU。”

马斯克问:“多少钱?”

工程师说了一个数字。

马斯克沉默了一会儿,然后说:

“我们来自己造。”

Dojo的研发从一开始就不顺利。

第一个问题:芯片设计。

特斯拉的芯片团队在2019年用了一个大胆的设计:用台积电的先进封装技术,把二十五块芯片集成在一个训练模块里,形成一个超大规模的并行计算阵列。

这个设计在纸面上很强——理论算力是当时最强GPU集群的数倍。但工程实现比预想的难得多。

热管理是第一道坎。二十五块芯片堆在一起,散热量是天文数字。特斯拉的工程师花了八个月,才找到一套可以稳定运行的冷却方案。

第二道坎:编译器。

芯片造出来只是第一步。要让AI训练任务在这块芯片上跑起来,需要重新写一套编译器,把现有的AI框架代码翻译成芯片能理解的指令。这套编译器,特斯拉从零开始写,写了整整一年。

2020年,芯片流片失败。

2021年,第二次流片,仍然有问题。

直到2022年,第一代Dojo芯片才真正完成验收。

从立项到上线,整整三年。预算超支了四倍。

而工程细节里的魔鬼,比时间表和预算更让人头疼。

5×5阵列的二十五块芯片挤在一个训练模块里,相互之间的距离以微米计。这不是简单的”把芯片拼在一起”——每一块芯片都在发热,热膨胀系数不同,温度每升高一度,芯片之间的物理位置就会发生纳米级的漂移。特斯拉的封装团队不得不设计了一套主动热补偿系统:实时监测每一块芯片的温度,动态调整互联信号的时序,补偿热漂移带来的延迟——这个系统本身又消耗了模块总功耗的15%。

更棘手的是供电。二十五块芯片同时满载运转,峰值功耗超过15千瓦——相当于三台家用空调同时全力运转,全部浓缩在一个披萨盒大小的模块里。传统的PCB供电方案根本跑不了这么大的电流密度。特斯拉的工程师反复试了四种方案,最后选了一条没有人走过的路:把供电模块直接集成到芯片封装基板上——用台积电的InFO封装技术,在芯片下方堆叠了一整层电源管理电路。这个方案解决了供电,但大幅提高了封装成本——单个Dojo模块的封装费用,是同期英伟达A100芯片的三倍。

马斯克在验收会上说了一句话:“我需要它明年就能用。”

工程师没有一个人敢接话。

2020年,OpenAI做了一件让整个AI圈重新评估规模效应的实验。

他们用一千七百五十亿参数的GPT-3训练了一个语言模型。

结果震惊了所有人:这个模型展现出了一种前所未有的能力——它不需要专门训练,就能完成翻译、写文章、写代码、做数学题。它能从极少的数据中推断出规律,而这个能力,没有任何人告诉它应该怎么做。

OpenAI把这种现象叫做:涌现。

黄仁勋在看到GPT-3的结果后,立刻给英伟达的工程团队发了一封邮件:

“我们需要为大规模训练优化新的GPU架构。现有的A100不够。”

那是后来H100的起点。

2022年,H100正式出货。这块芯片的单价是三万美元——比一辆入门级宝马还贵。

但订单排到了十一个月之后。

2020年,北京。

字节跳动的会议室里,一块实时数据屏幕正在闪烁。

屏幕上显示的是抖音推荐系统的实时指标:每秒处理请求数、模型推理延迟、GPU利用率。

那个数字让在场所有人倒吸一口凉气:百分之九十八。

GPU利用率已经接近极限。

字节跳动是中国最早大规模部署GPU集群的互联网公司之一——抖音的推荐系统,从2018年开始,就基于深度学习模型运行。但从2020年开始,用户的爆发式增长让算力需求开始指数级上升。

字节跳动的算力团队做了一个内部评估:

2021年的GPU需求,是2020年的三倍。

2022年,是2020年的十倍。

阿里、腾讯、百度,在同一时间收到了同样的报告。

中国互联网公司,第一次集体意识到:算力是一场军备竞赛,而弹药箱快空了。

2020年9月,美国商务部做了第一件事。

他们把华为列入了”实体清单”的升级版:禁止任何使用美国技术的公司向华为供应芯片。

台积电断了供。

华为手机业务在四个月后遭遇了灭顶之灾:芯片库存耗尽,新机无法生产,荣耀品牌被迫出售。

余承东在一次内部会议上说:

“我们设计的芯片,没有人能帮我们造出来。”

这是华为第一次公开承认自己在供应链上的脆弱性。

但没有人知道,禁令还只是一个开始。

华为被断供的同时,小米没有进入实体清单。雷军可以买到英伟达GPU——同一张禁令,把两个中国科技巨头推向了截然不同的命运。一个被逼着从零建软件生态,一个在暗中囤积算力。

这种不对称,后来深刻影响了中国AI产业的格局。

2021年,华为海思做了一个决定。

在所有外部代工渠道被切断之后,海思的工程师团队没有解散。

他们转入了另一个任务:设计下一代昇腾芯片,等待国产替代方案成熟。

海思内部有一句话在那个时期反复出现:

“禁令让台积电断了,但断不了我们手里的设计图。只要设计图在,我们就不会输。”

2021年底,一份关于”国内芯片制造能力”的内部评估报告放到了余承东的桌上。

报告结论:中芯国际的制程能力在当时大约是14nm,距离5nm有三到四代的差距。这个差距,在最乐观的估计下,需要至少五年才能追上。

余承东看完报告,说了一句:

“五年。我们有五年的时间窗口。”

他把报告合上,然后启动了另一件事:在软件层面,为”非英伟达生态”做全面适配。

那是中国AI产业第一次认真面对一个问题:如果有一天,所有美国芯片都不能用了,我们的AI还能跑吗?

三个地方在各自准备一场没有人公开承认的战争。马斯克在弗里蒙特悄悄建Dojo,要在算力上摆脱英伟达的钳制——但工程难度让时间表一拖再拖。中国的互联网公司开始意识到,GPU不是无限供应的弹药,禁令已经打响了第一枪。华为在禁令的废墟上开始重建:不是重建芯片制造,而是重建整个不依赖美国的软件生态。