第八章 Dojo的秘密
一
2019年8月,特斯拉内部启动了一个没有出现在任何官方新闻稿里的项目。
项目负责人是一个叫谷俊丽的工程师。她在加入特斯拉之前,是苹果自动驾驶项目的核心成员。
项目内部代号:Dojo。
在日语里,“道场”是修炼的地方。
马斯克给这个项目的定义只有一句话:“训练自动驾驶AI的超级计算机——不依赖英伟达的GPU。”
他说这话的时候,特斯拉Autopilot团队的工程师刚刚完成了一次内部测试:用英伟达的GPU训练一套目标检测模型,跑了整整三天。
马斯克问:“能不能更快?”
工程师说:“可以,但要买更多GPU。”
马斯克问:“多少钱?”
工程师说了一个数字。
马斯克沉默了一会儿,然后说:
“我们来自己造。”
二
Dojo的研发从一开始就不顺利。
第一个问题:芯片设计。
特斯拉的芯片团队在2019年用了一个大胆的设计:用台积电的先进封装技术,把二十五块芯片集成在一个训练模块里,形成一个超大规模的并行计算阵列。
这个设计在纸面上很强——理论算力是当时最强GPU集群的数倍。但工程实现比预想的难得多。
热管理是第一道坎。二十五块芯片堆在一起,散热量是天文数字。特斯拉的工程师花了八个月,才找到一套可以稳定运行的冷却方案。
第二道坎:编译器。
芯片造出来只是第一步。要让AI训练任务在这块芯片上跑起来,需要重新写一套编译器,把现有的AI框架代码翻译成芯片能理解的指令。这套编译器,特斯拉从零开始写,写了整整一年。
2020年,芯片流片失败。
2021年,第二次流片,仍然有问题。
直到2022年,第一代Dojo芯片才真正完成验收。
从立项到上线,整整三年。预算超支了四倍。
而工程细节里的魔鬼,比时间表和预算更让人头疼。
5×5阵列的二十五块芯片挤在一个训练模块里,相互之间的距离以微米计。这不是简单的”把芯片拼在一起”——每一块芯片都在发热,热膨胀系数不同,温度每升高一度,芯片之间的物理位置就会发生纳米级的漂移。特斯拉的封装团队不得不设计了一套主动热补偿系统:实时监测每一块芯片的温度,动态调整互联信号的时序,补偿热漂移带来的延迟——这个系统本身又消耗了模块总功耗的15%。
更棘手的是供电。二十五块芯片同时满载运转,峰值功耗超过15千瓦——相当于三台家用空调同时全力运转,全部浓缩在一个披萨盒大小的模块里。传统的PCB供电方案根本跑不了这么大的电流密度。特斯拉的工程师反复试了四种方案,最后选了一条没有人走过的路:把供电模块直接集成到芯片封装基板上——用台积电的InFO封装技术,在芯片下方堆叠了一整层电源管理电路。这个方案解决了供电,但大幅提高了封装成本——单个Dojo模块的封装费用,是同期英伟达A100芯片的三倍。
马斯克在验收会上说了一句话:“我需要它明年就能用。”
工程师没有一个人敢接话。
三
2020年,OpenAI做了一件让整个AI圈重新评估规模效应的实验。
他们用一千七百五十亿参数的GPT-3训练了一个语言模型。
结果震惊了所有人:这个模型展现出了一种前所未有的能力——它不需要专门训练,就能完成翻译、写文章、写代码、做数学题。它能从极少的数据中推断出规律,而这个能力,没有任何人告诉它应该怎么做。
OpenAI把这种现象叫做:涌现。
黄仁勋在看到GPT-3的结果后,立刻给英伟达的工程团队发了一封邮件:
“我们需要为大规模训练优化新的GPU架构。现有的A100不够。”
那是后来H100的起点。
2022年,H100正式出货。这块芯片的单价是三万美元——比一辆入门级宝马还贵。
但订单排到了十一个月之后。
四
2020年,北京。
字节跳动的会议室里,一块实时数据屏幕正在闪烁。
屏幕上显示的是抖音推荐系统的实时指标:每秒处理请求数、模型推理延迟、GPU利用率。
那个数字让在场所有人倒吸一口凉气:百分之九十八。
GPU利用率已经接近极限。
字节跳动是中国最早大规模部署GPU集群的互联网公司之一——抖音的推荐系统,从2018年开始,就基于深度学习模型运行。但从2020年开始,用户的爆发式增长让算力需求开始指数级上升。
字节跳动的算力团队做了一个内部评估:
2021年的GPU需求,是2020年的三倍。
2022年,是2020年的十倍。
阿里、腾讯、百度,在同一时间收到了同样的报告。
中国互联网公司,第一次集体意识到:算力是一场军备竞赛,而弹药箱快空了。
五
2020年9月,美国商务部做了第一件事。
他们把华为列入了”实体清单”的升级版:禁止任何使用美国技术的公司向华为供应芯片。
台积电断了供。
华为手机业务在四个月后遭遇了灭顶之灾:芯片库存耗尽,新机无法生产,荣耀品牌被迫出售。
余承东在一次内部会议上说:
“我们设计的芯片,没有人能帮我们造出来。”
这是华为第一次公开承认自己在供应链上的脆弱性。
但没有人知道,禁令还只是一个开始。
六
华为被断供的同时,小米没有进入实体清单。雷军可以买到英伟达GPU——同一张禁令,把两个中国科技巨头推向了截然不同的命运。一个被逼着从零建软件生态,一个在暗中囤积算力。
这种不对称,后来深刻影响了中国AI产业的格局。
七
2021年,华为海思做了一个决定。
在所有外部代工渠道被切断之后,海思的工程师团队没有解散。
他们转入了另一个任务:设计下一代昇腾芯片,等待国产替代方案成熟。
海思内部有一句话在那个时期反复出现:
“禁令让台积电断了,但断不了我们手里的设计图。只要设计图在,我们就不会输。”
2021年底,一份关于”国内芯片制造能力”的内部评估报告放到了余承东的桌上。
报告结论:中芯国际的制程能力在当时大约是14nm,距离5nm有三到四代的差距。这个差距,在最乐观的估计下,需要至少五年才能追上。
余承东看完报告,说了一句:
“五年。我们有五年的时间窗口。”
他把报告合上,然后启动了另一件事:在软件层面,为”非英伟达生态”做全面适配。
那是中国AI产业第一次认真面对一个问题:如果有一天,所有美国芯片都不能用了,我们的AI还能跑吗?
三个地方在各自准备一场没有人公开承认的战争。马斯克在弗里蒙特悄悄建Dojo,要在算力上摆脱英伟达的钳制——但工程难度让时间表一拖再拖。中国的互联网公司开始意识到,GPU不是无限供应的弹药,禁令已经打响了第一枪。华为在禁令的废墟上开始重建:不是重建芯片制造,而是重建整个不依赖美国的软件生态。