第六章 AlphaGo的震撼
一
2016年3月9日,首尔,四季酒店。
李世石在赛前说过一句话:“我会以5比0赢。”
这位三十六岁的韩国九段棋手,是过去十年全球围棋战绩最稳定的人类选手之一。他赢过中日韩几乎所有顶尖棋手,在世界冠军榜上名列前茅。
他对DeepMind说:“让我来替人类测试一下,你们的机器到底有多少本事。”
首局,李世石执黑。
开局前十五分钟,一切正常。李世石落子沉稳,节奏流畅,棋盘上的格局中规中矩。
第三十七手,AlphaGo落下一颗棋子。
李世石的手在棋盘上方悬了一秒,然后收了回去。
他盯着那个位置,看了整整十二分钟。
那颗棋子落在了一个所有人类棋手都会避免的位置——那里看起来既不连接实地,也没有明确的后续手段。按照人类围棋的经验,这是一步臭棋。
但AlphaGo不按人类的经验走。
李世石起身离开座位,在赛场外的走廊里站了很久。没有人知道他那十二分钟在想什么。
最终比分:1比4。AlphaGo赢了。
二
AlphaGo第四局第七十八手,后来有了一个专门的名字:“神之一手”。
那一手,AlphaGo走出了人类围棋两千年来从未有人走出过的棋路。那一步棋让李世石当场陷入长考,让解说员在直播中沉默了整整一分钟,也让全球所有观战的人工智能研究者集体起立鼓掌。
不是因为它赢了。
而是因为它赢得不像机器。
人类棋手在复盘时说:那一步棋,没有任何计算可以解释它。那不是穷举法的胜利,那是——直觉。
黄仁勋在硅谷看完第四局直播,给DeepMind团队发了一封邮件,只有两行字:
“这是GPU的胜利。这是通用计算的胜利。”
他在发给内部高管的后续邮件里补了一句:
“从今天起,每一个国家的政府、科技公司、军方,都会问同一个问题:我们有没有自己的算力?”
英伟达的股价在接下来三个月里涨了百分之四十七。
三
马斯克在AlphaGo和李世石对局的整个五天里,没有出现在任何公开场合。
他在Twitter上连发了十七条动态,其中有一条后来被截图无数:
“我们_call_this的AGI,不是一台会下棋的机器。但棋是一个信号。”
有人指出他打错字了,“call_this”应该是”call this”。他回复说:“不重要。”
AlphaGo首局结束的那个晚上,他给山姆·奥特曼发了一条信息:
“你看到了吗?”
奥特曼回复:“看到了。”
马斯克说:“这不是结束。这是开始。我们需要加快速度。”
从那天起,OpenAI的训练强度翻了一倍。
四
2016年5月,北京。
李彦宏在内部战略会上,收到了一份关于AlphaGo的专题分析报告。
报告的结论只有一句话:“百度已经落后,但落后的幅度可以被压缩。”
李彦宏把报告合上,说了一句后来被百度内部反复引用的话:
“从今天起,百度所有不涉及AI的业务,资源全部压缩。所有涉及AI的业务,资源翻倍。”
那是百度历史上第一次,把”AI”写进了公司的最高优先级。
同一个月,华为海思收到了余承东的内部指令:加快神经网络处理器的研发进度。
指令里有一句话:“AlphaGo证明了一件事:用专用芯片做AI,比用通用芯片快十倍以上。我们不能在这件事上缺席。”
那是麒麟NPU的研发第一次进入华为消费者业务的最高优先级。
五
DeepMind后来做了一件让黄仁勋真正不安的事。
AlphaGo在击败李世石之后,DeepMind团队做了一组内部对比测试:同样的AlphaGo模型,跑在英伟达GPU上,和跑在Google自研TPU上,胜率差距有多大?
答案:换上TPU之后,AlphaGo对GPU版本的胜率超过了80%。
这不是一个微小的提升。这是专用AI芯片对通用GPU的降维打击。
黄仁勋得知这组数据的时间,大约在2016年底。他在内部技术会上说了一句话:“TPU证明了一件事——专用芯片在AI推理上可以碾压GPU。问题是,它能不能扩展到训练?”
如果TPU只能在推理上快,那它的威胁有限——推理是验证已知模型,训练才是创造新模型,训练市场比推理市场大得多。但如果Google继续迭代TPU,如果TPU v2、v3开始支持训练,如果其他公司也开始自研芯片——
英伟达在通用GPU赛道的独霸地位,会出现裂缝。
黄仁勋没有等。他在2017年初启动了英伟达历史上最大规模的架构迭代计划——Volta架构。内部代号是一句话:“让GPU的训练效率,始终比自研芯片快两代。”
专用AI芯片的军备竞赛,从这一组对比数据开始,正式打响。
六
2017年6月,Google的一篇论文在网上公开。
标题:“Attention Is All You Need”。
作者是Google的八位研究员,牵头的是一位叫阿希什·瓦斯瓦尼的年轻人。
论文提出了一个全新的深度学习架构:Transformer,变形金刚。
这个架构的核心思想是:让AI在处理语言的时候,不再一个字一个字地读,而是同时看完整句话,通过”注意力机制”判断哪些词和哪些词最相关。
这个技术后来成了大语言模型的根基。
但在那篇论文发布的时候,Google内部并没有人意识到它意味着什么。
瓦斯wani自己在接受采访时说:“我们当时只是想解决机器翻译的问题。我们不知道它会变成后来那些东西的基础。”
那是2017年6月。
半年后,OpenAI用Transformer架构训练出了第一版GPT。
又过了几个月,百度用Transformer的思路,重写了ERNIE的核心模块。
一年后,Google用Transformer训练出了BERT,在几乎所有自然语言理解 benchmark 上刷新了纪录。
Transformer从一篇论文,变成了一把钥匙,打开了生成式AI的大门。
而Google,把它亲手丢了出去。
七
2017年,华为做了两件事。
第一件事:发布麒麟970。
这是全球第一款内置神经网络处理器(NPU)的移动端芯片。它让手机可以在本地跑AI任务——不需要联网,不需要云端算力,一台Mate 10 Pro可以实时识别十几种物体。
发布会上,余承东亲自演示了NPU的物体识别功能。他对着手机摄像头举起一本书,Mate 10 Pro在三秒内识别出书名。
全场掌声。
但没有人意识到另一件事:这款芯片里搭载的NPU架构,最早的技术来源,正是中科院计算所那个用风扇吹服务器的实验室——寒武纪的前身。
第二件事:华为内部悄悄启动了”达芬奇架构”项目。
这是华为自研AI芯片的真正起点。后来,它有了另一个名字:昇腾。
AlphaGo点燃了三个人。黄仁勋看到了通用GPU的全面胜利,但心里清楚Google TPU已经在路上。马斯克看到了AGI的影子,加快了对OpenAI的投入。李彦宏和余承东看到了同一个事实:中国不能在AI芯片这件事上缺席。
而那篇叫”Attention Is All You Need”的论文,已经悄悄躺在了arXiv的服务器里,等待被更多人发现。