跳转到内容
文韬博宇的个人主页
返回

第一章 黄仁勋的豪赌

· 约 9 分钟

2006年,一场没有硝烟的战争悄悄打响。 没有宣战书,没有外交照会,只有一块芯片,和一个没人看好的赌局。 黄仁勋赌的不是市场,是时代。

2006年秋天,加州圣克拉拉,英伟达总部。

会议室没有窗户。白板上写着一个单词:

CUDA。

黄仁勋把笔盖上,转身面向房间里的工程师们。

“你们知道这意味着什么代价吗?”

没人回答。

他们知道。CUDA——Compute Unified Device Architecture,统一计算设备架构。简单说,就是把游戏显卡变成一台通用计算机。为了做到这件事,工程师们要重新设计芯片,在原本用于渲染像素的晶体管旁边,强行插入数百个可编程计算核心。

芯片面积会增大百分之三十以上。功耗飙升。成本陡增。毛利率会跌破35%。

华尔街不会理解这件事。分析师们会写报告,说英伟达放弃了核心市场,去追一个几乎不存在的边缘需求——AI研究者?那是一帮用不起商业软件的穷学生,他们有多大市场?

有人在会议室后排低声说了一个词:“科学慈善。”

没有人笑。

黄仁勋在白板上用笔尖轻轻敲了两下。然后他在白板右下角写下一句英文,盖上笔,走出了会议室:

They need us. ——他们需要我们。

这句话的句式,和1834年一个铁匠站在一辆走了二十米的木轮车前说的不一样,但骨子里是同一个意思:我看见了一件事,别人还没看见。

那年他四十三岁。英伟达成立十三年,股价在二十五美元上下徘徊。他没有告诉任何人,他要用这场豪赌消耗多少钱。

据日后披露的财务数据,CUDA项目每年吞掉的研发费用,大约在五亿美元上下。这个数字,将会持续整整六年。

黄仁勋对”复杂环境”的理解,不是从商学院来的。

九岁那年,他从台湾来到美国,被送进一所很奇怪的私立学校——同学里有很多从少年教养院出来的孩子,打架是日常,规矩是奢侈品。一个瘦小的亚洲男孩,在那样的地方待了两年。他没有学会打架,他学会了另一件事:怎么在混乱中找到自己的位置。

多年后他在斯坦福读电气工程。深夜的实验室里,窗外是加州干燥的星空,他一个人盯着示波器上的波形,手里捏着一块自己设计的电路板。那年在AMD做芯片工程师,工位在一排灰格子隔间的最里面,桌上有三本翻烂的参考手册和一盒没吃完的甜甜圈。

但他心里始终装着那个念头——图形处理器会成为计算机最重要的部件。三十岁那年,他把这个念头从车库带了出来。三个人,没有产品,只有它。

公司叫英伟达。

1990年代,他赌对了。3D游戏和多媒体的爆发,让英伟达的显卡成了每台电脑的标配。订单像洪水一样涌进来,股价连年翻倍,硅谷开始认真打量那个总是穿黑皮衣的男人。

但黄仁勋有一个奇怪的习惯:在一件事最顺的时候,担心它会怎么结束。

2001年,内部会议。他站在投影幕前面,幕布上是一张逐年上升的营收曲线图,陡得像一面墙。他把激光笔关掉,转过身来:“今天的游戏市场,是用来养活下一个英伟达的母鸡。但如果母鸡只会下一种蛋,总有一天,这个蛋没有人要了。”

会议室很安静。没有人知道下一个蛋是什么。

黄仁勋自己也不知道。但他隐约感觉到——那块叫做GPU的芯片,还有别的可能性。

但CUDA的故事,比那间会议室更早。

早在2003年,英伟达有几个工程师悄悄在干一件事:用显卡的并行计算能力来处理科学计算问题。他们发现,某些类型的数学运算,显卡的处理速度比CPU快几十倍——不是因为显卡更聪明,而是因为它有几百个核心同时工作,就像一个工厂里站了几百个工人同时拧螺丝,速度自然快。

问题是,当时的显卡软件完全为游戏设计。研究者想用显卡算数,需要把数学公式”伪装成”渲染命令,才能骗过显卡驱动。这就像你想让工厂生产汽车零件,但工厂只认识”渲染”这个指令,你必须把每一颗螺丝都描述成一个像素,才能让机器动起来。

荒谬,但有人真的在这么干。

黄仁勋听说了这件事,把那几个工程师叫进办公室。他问了一个问题:“如果我们把这件事变得简单,会有多少人愿意用?”

没有人知道答案。

“那就先做,再看。“他说。

但黄仁勋知道一件事:2006年,全球售出了超过两亿块GPU。

这些GPU大部分进了游戏玩家的机箱——《魔兽世界》在2006年有八百万活跃玩家,每一个人的电脑里都有一块GPU在跑。两亿块GPU的规模,意味着英伟达可以把CUDA的研发成本摊薄到每一块消费级显卡的利润里——多收五美元,用户感觉不到,但一年下来就是接近十亿美元的研发投入。

这是《比特创世》里写过的逻辑:PC和游戏产业奠定的半导体供应链,最终成了AI时代的算力底座。黄仁勋没有读过《比特创世》——那本书还没写出来。但他用直觉做到了同一件事:用游戏行业的规模,养活了一个还没有人买单的技术赌局。

这是CUDA项目的起点。2006年,当那个白板上的单词被正式对外宣布时,英伟达的股价几乎没有任何反应。没有庆祝,没有头条,技术媒体给了几段不温不火的报道——大致意思是,英伟达推出了一套给科学家用的显卡软件,具体用处不明。

CUDA正式发布的那个月,在加州圣克拉拉以南一百公里的斯坦福大学,一个叫吴恩达的教授正带着几个学生,试图用显卡来跑神经网络。

神经网络这个词,在2006年是个过气的概念。

它的想法其实很老——1943年,神经科学家和数学家就画出了”人工神经元”的草图,想用数学方程模仿大脑的神经细胞。几十年来,一批批研究者围着这个想法打转,写了大量论文,但没有人能让它真正好用:算法需要的计算量太大,当时的计算机根本跑不动。“神经网络已死”,这是2006年大多数AI研究者的共识。

但吴恩达有一个想法:也许不是神经网络本身的问题,而是算力太少。如果有足够快的计算机,神经网络是不是能活过来?

他找来了英伟达的显卡。

用显卡来训练神经网络——这件事在当时听起来像个笑话,显卡不是用来算数学的,是用来打游戏的。但吴恩达和他的学生发现,神经网络的训练过程,本质上就是一大堆矩阵乘法的重复运算,而这恰恰是显卡最擅长的事情。

他们把神经网络代码改写成显卡能理解的格式,按下了运行键。

训练速度快了七十倍。

吴恩达盯着那个数字,沉默了很长时间,然后对旁边的学生说:“我觉得,我们可能触到了某个东西的边缘。”

那年,他的一个合作者,李飞飞,正在另一个办公室里做一件所有人都觉得无聊透顶的工作:从互联网上收集图片,一张一张地打标签——这是狗,这是猫,这是椅子,这是汽车。她要建一个叫做ImageNet的数据库。没有人知道这数据库有什么用。

吴恩达不知道,他和李飞飞正在给同一颗炸弹拧上引信。六年后,它会爆炸。

同一年的秋天,在离英伟达总部八千公里外的北京,中科院计算技术研究所,一间普通的实验室里。

陈云霁和陈天石是一对兄弟,都在计算所做研究。他们正在研究一个没有人关心的方向:为神经网络设计专用处理器。

这个想法,在2006年同样是个笑话。神经网络已经死了。为一个死掉的算法设计专用芯片,逻辑上就说不通。

但陈云霁不是从神经网络出发的。他是从另一头来的:他发现,通用处理器在做某些特定计算的时候,效率极低——大量的计算资源用来做”通用”所必须的调度和控制,真正做有用计算的部分,其实很少。

如果专门为一类计算设计一块芯片,只做那一类事情,会快多少?

这个问题,没有具体的答案。他写了一份立项报告,递交给所里,申请一点经费,把这个想法往前推一推。

那份报告被批了,经费不多。实验室里没有什么庆祝。这只是一个普通的科研立项,跟其他几十个立项一样,安静地挂在进度表上。

没有人知道,这份报告会在八年后变成一块叫”寒武纪1A”的芯片。没有人知道,那块芯片会在十七年后被一道美国禁令推上战场。

2006年秋天,三件事同时发生在这个星球上。它们之间没有任何联系——至少当时看起来是这样。

黄仁勋走出会议室的时候,走廊里没有别人。他在自动售卖机前停了一下,看了看玻璃上的反光——领带有点歪,眼底有血丝。他伸手把领带正了正,然后继续往前走。身后那间没有窗户的会议室里,白板上的字还没擦。

同一时刻,往南一百公里的斯坦福,吴恩达还坐在电脑前面。显示器右下角跳动着一个数字——七十倍。他已经盯着它看了很久。旁边的学生趴在桌上睡着了,呼吸声夹在显卡风扇的嗡鸣里。吴恩达没有叫醒他。他慢慢合上笔记本电脑,把还没写完的论文草稿压在杯子下面。杯里的咖啡早就凉了。

同一时刻,距圣克拉拉八千公里的北京已经入夜。中科院计算所走廊尽头的灯是声控的,夜够深,自动灭了。陈云霁抬头看了一眼,又低下头。桌上摊着那份立项报告,右上角的归档章印着今天的日期。他在”研究目标”那一栏下面,用铅笔轻轻画了一根线。这笔经费不多,但够让他把那个念头再往前推一推。

他们彼此不认识,不知道对方在干什么。

但他们都触到了同一个东西。

这场战争,就从这里开始。没有宣战书,没有战鼓,只有三间实验室里三盏还亮着的灯。

2006年,没有人谈论AI。

那一年,全世界的注意力都在社交网络上。黄仁勋的注意力在一件更枯燥的事上:怎么让科学家愿意用他的显卡写代码。

而在地球另一端,中国科学院计算技术研究所,几个研究员正在为一件事写报告。这件事叫”神经网络加速芯片”。

没有人注意它。它听起来像是又一个学术圈的自娱自乐。

算力争霸的第一章,就是在这样一个世界里开始的。世界忙着做社交、做搜索、做电商、做视频。而黄仁勋的白板上,写着四个字母:CUDA。

全世界的注意力都在Web 2.0上,没有人抬头看。而算力的雪崩,已经出发了。