跳转到内容
文韬博宇的个人主页
返回

第一章 不听话的身体

· 约 13 分钟

2015年夏天,加州大学伯克利分校的机器人实验室。 BRETT机器人花了一个小时,学会了把乐高积木装进盒子。 它不是被编程的。它是自己试出来的。 在此之前,机器人只能做”被精确告知”的事情。 在此之后——它们开始学习。 这是具身黎明的第一个信号。 AI不只是想要更快的GPU,它想要一双手。

2015年6月5日,加州波莫纳。

天还没亮,Fairplex展览中心的停车场已经停满了印有大学标志的厢式货车。MIT的车上画着海狸,CMU的车身上贴着”Tartan Rescue”的贴纸,NASA JPL从帕萨迪纳开了不到两小时——他们的机器人装在一个改装过的航空箱里,箱子外面还有”易碎”的标签。

二十五个队伍。来自七个国家。比赛场地是一块模拟灾难现场的场地——断墙、碎石、阀门、电钻,还有几扇普通的门。

比赛规则听起来很简单:让机器人完成人类救援队员能做的八件事。开车、下车、开门、钻墙、爬碎石、上楼梯、关阀门、接水管。每完成一项得分。总分三十二分。

比赛开始。

MIT的机器人走向第一道门。它花了三分钟,才把门推开了一条缝。然后它停下来,重新计算——门后面是另一堵墙,它没有预料到。观众席上有人笑出声。

NASA JPL的RoboSimian——一种四条腿、像蜘蛛一样的东西——试图转动一个阀门。阀门是标准的工业阀门,直径约二十厘米。任何成年人都能单手转开。RoboSimian换了三种握法,电机嗡嗡响了将近五分钟。阀门纹丝不动。

CMU的CHIMP表现最好——至少它有两条手臂和履带脚。但它上楼梯的样子,像一个刚学会走路的小孩第一次面对旋转门。

二十五支队伍。没有一支拿到满分。最高分:八分。总分三十二。

坐在观众席上的Gill Pratt看完最后一个机器人摔倒在碎石堆上,摘下眼镜擦了擦。他是DARPA机器人挑战赛的项目经理。他面前的赛场上,散落着全世界最先进的灾难救援机器人——它们加起来打不开二十扇门。

Pratt后来在一篇论文里写了一段话,被引用了几千次:“我们对机器人的期待,和它们的实际能力之间,隔着一整条认知鸿沟。”

这条鸿沟有一个名字。

1988年,汉斯·莫拉维克在《心智儿童》里写了一句话。

“让计算机在智力测验或跳棋上达到成人水平,相对容易;但让它们具备一岁儿童的感知和运动能力,极其困难——甚至几乎不可能。”

这句话后来变成了一个悖论。

莫拉维克悖论。高等推理——下棋、解数学题、写代码——只需要算力。低级运动——走路、拿起杯子、开一扇门——需要整个物理世界的知识。

AlphaGo可以在棋盘上击败李世石,但它不知道围棋棋子掉在地上会弹起来——因为它在云端,没有手臂。

GPT-4可以通过律师资格考试,但如果把它装进一个机器人里,让它走进一个真实的房间,倒一杯水——它会比任何一个五岁小孩都笨拙。

原因很简单。

人类的大脑皮层花了六亿年进化出语言和逻辑。但人类的身体——手、脚、平衡感、重力的预感、摩擦力的直觉——花了四十亿年。六亿对四十亿。一比七。

一台服务器里的AI只有六亿年的进化遗产。一具机器人需要四十亿年的遗产——它需要对整个世界有直观的认知:一个杯子有多重?一扇门需要多大力气才能推开?楼梯每一级有多高?

所有这些问题,对任何一个人类来说都不需要思考。

但对一具机器人来说,每一个问题都需要从头计算——而且算错一次,后果可能是摔碎自己。

DARPA机器人挑战赛把这四十亿年的差距压缩到了极限:在断墙和碎石之间,世界上最先进的机器人花了整个下午——就为了开一扇门。

波莫纳那场比赛的录像,几个月后在YouTube上变成了一个意外爆款。

不是成功视频。是失败合集。

Atlas机器人在碎石地上走着走着,左脚踩到一块松脱的石头,身体往右倾斜——它试图调整平衡,手臂在空气中乱摆——然后整个身体以一种极其人性的方式,缓缓侧倒。膝盖先着地。然后是手肘。最后是头。整个过程大约四秒钟。视频标题是:“When robots fall”——“当机器人摔倒的时候”。

评论区最热门的回复只有一句话:“它摔得比我前任还像人类。”

六千个赞。

没有人知道,这个摔倒的机器人来自一家叫Boston Dynamics的公司。这家公司成立于1992年,创始人是一个叫Marc Raibert的MIT教授。他在四分之一个世纪里,一直在做同一件事:造一具能像动物一样走路的机器身体。

Atlas是他们的第一款双足人形机器人。液压驱动。身高一米八。体重一百五十公斤。每走一步,身上十几条液压管会发出”嘶嘶”的声音——像一个哮喘病人穿着钢铁战甲。

但Atlas能在碎石上走。这是一个奇迹。

人类在1969年已经把人送上了月球。但到了2015年,人类还没造出一具能平稳走过碎石地的机器身体。莫拉维克悖论——在最意想不到的地方卡住了。

同一场比赛的另一个角落里,坐着一个不起眼的日本团队。来自东京的SCHAFT公司——名字来自德语”动能”。他们的机器人不高大,不像Atlas那样威猛,但有一个特点:它的脚底是平的。当它走路的时候,每一步都稳稳踩在地上,像一个人穿着胶底鞋在湿滑地面上小心翼翼。

SCHAFT最终拿了最高分。日本——一个从阿童木到高达、用漫画画了六十年机器人的国家——在DARPA的赛场上,用一具朴素的、不起眼的身体,打败了美国人所有的钢铁战甲。

赛后,Google默默收购了SCHAFT。

也收购了Boston Dynamics。

那一年,全世界还没有意识到:Google同时在买两样东西。一样是机器人的”灵魂”——控制算法。另一样是机器人的”身体”——液压肌肉。他们想把这两样东西拼在一起,造出世界上第一个”通用机器人”。

但Google不知道的是——在旧金山湾区更南边的地方,另一个硅谷大佬也在想同一件事。

2016年秋天。旧金山半岛某处。

一栋没有标识的小楼。大厅里没有公司铭牌,前台的接待员签了保密协议。访客进门不能带手机。

这家公司叫Neuralink。

马斯克在两年前就开始私下招人了。他找的不是神经科学圈的明星教授——那些人都在大学里有终身教职,没人愿意赌。他找的是一群”还没有成名、但已经不在乎成名”的年轻人。

Max Hodak,杜克大学神经工程实验室出来的,之前在贝莱德做脑机接口研究。Philip Sabes,UCSF的神经科学家,妻子也在同一领域。还有DJ Seo——一个韩裔工程师,大学里自己做过一个可穿戴的脑电图头盔。

马斯克把他们叫到特斯拉工厂旁边的一个小会议室里。没有PPT。没有产品路线图。他在白板上画了一个圈。

“这是你的大脑。“他在圈旁边写了一个词:neural lace——“神经蕾丝”。

这个词来自伊恩·班克斯的科幻小说《文化》系列。在小说里,人类在大脑皮层上植入一层极细的网状电极——一根头发丝的十分之一粗细。它不侵入大脑组织,而是像蕾丝一样贴在大脑血管的外壁上,读取神经信号。

马斯克想把它变成真的。

“我们需要解决的问题有三个。第一,怎么把电极塞进大脑但不造成损伤。第二,怎么让电极待在里面不引发免疫排斥。第三,怎么从电极里读出来的信号——翻译成计算机能理解的语言。”

会议室里安静了五秒钟。

然后Sabes开口了:“第三点目前没人能做到。”

马斯克转过头看着他:“我知道。所以才要我们来做。”

那一年,Neuralink的目标不是造产品。是证明一个概念:脑机接口——用一根线连接你的大脑和一台计算机——在物理上是可能的。

这个目标和DARPA机器人挑战赛的目标,看起来毫无关系。

一帮人在努力让机器人学会开门。另一帮人在努力让计算机学会读大脑。但两件事指向同一个方向:身体。一个人在找能让AI走出服务器的方法。另一个人在找能让人类走进服务器的方法。

两条路,一个交汇点——马斯克在同时铺设碳基和硅基的两端。

2017年冬天。北京。

中国电子学会在北京友谊宾馆开了一场不大的会。会场里坐着几十个人——高校教授、研究所负责人、几个从深圳飞来的创业者。工信部的一位副司长在会上念了一份报告草案。

报告的标题很长:《机器人产业发展规划(2016—2020年)》。

其中有一段话,后来出现在各种机器人产业报告里:

“到2020年,我国自主品牌工业机器人年产量达到10万台,服务机器人年销售收入超过300亿元。”

会场里有一个年轻人。他坐在靠后的位置,手里转着一支笔。他叫王兴兴,上海大学的在读研究生。他正在做一款机器狗——不是波士顿动力那种价值几百万美元的液压怪物,而是一只用电机驱动的、成本控制在五千块钱以内的四足机器人。

他在会场上听完了报告,在笔记本上写了两行字。

“成本。从关节开始。”

六年后,他创立的宇树科技,会成为世界上出货量最高的四足机器人公司——它的机器狗价格是波士顿动力Spot的十分之一。那场在北京友谊宾馆开的会,是中国机器人产业的第一个政策信号。而王兴兴是那批最早捕捉到这个信号的人之一。

但他当时还不知道,Google也在同一年做了一件事——

他们把Boston Dynamics卖了。

2017年6月。日本软银宣布收购Boston Dynamics。

收购价没有公开。但外界估算不超过一亿美元——相当于Instagram售价的百分之一。

Google在2013年买下Boston Dynamics,花了四年试图让它”有用”。他们给Atlas换了电动关节,让它能做后空翻,让Spot学会了上楼梯——但每一个项目结束时,Google的产品经理都会问同一个问题:“这个东西到底能卖给谁?”

没人能回答。

世界上最先进的机器人公司——它的机器人能后空翻、能在雪地上跑、能在崎岖地形上搬运物资——最大的问题是:没有市场。

Marc Raibert一开始不以为然。他觉得Google的管理层不懂机器人。但四年过去了,连他自己也开始怀疑:造一个能跑的机器人——这件事本身有价值吗?还是它只是一个极其昂贵的玩具?

孙正义给了一个报价。Google接受了。

对软银来说,接手Boston Dynamics是一次赌博。孙正义的愿景基金在那一年投了将近一千亿美元——Uber、WeWork、Slack——每一笔都像在赌”下一个十年”。Boston Dynamics是其中最奇怪的一笔:它不是互联网公司,没有用户增长曲线,甚至没有商业模式。它只是世界上最会造机器人身体的公司。

孙正义的想法很简单。日本正在老龄化——护理人员不够,没有人愿意让父母一个人待在家里。总会有那么一天,人类需要机器人来照顾另一些人类。Boston Dynamics的身体造得最好。

但在那一年,没有家用机器人。

Atlas摔在DARPA赛场上的视频还在网上流传。Spot——那个像无头狗一样的四足机器人——第一个客户要到三年后才会出现,是一个核电站。去人类不敢去的地方。不是照顾人。

先驱的命运就是这样。达文波特造出第一辆电动车,只跑了不到二十米。一百七十年后,波士顿动力造出第一台能后空翻的双足机器人——它卖不出去。

但后空翻本身,已经证明了身体是可能的。

余下的问题不是”怎么造”,而是——谁来造它的大脑。

2018年秋天。特斯拉弗里蒙特工厂。

生产线的机器臂正在组装Model 3。每五十三秒,一台车身从焊接车间滑出来。这个节奏是全球最快的——比丰田还快。机器臂全长六米,有七个关节,每一条手臂的造价超过十万美元。它们被关在橙色的安全围栏里——不是因为它们危险,而是因为人类一旦走进去,程序会立即停机。机器臂不知道你在那里。它们只是在重复执行被精确告知的动作:焊到这里,拧到这里,喷到这里。

马斯克站在生产线的二楼,从玻璃窗往下看。

下面没有人。只有机器臂。

他旁边站的是特斯拉工程副总裁德鲁·巴格里诺。巴格里诺后来在一档播客里回忆过那个场景。马斯克看了一段很长的沉默,忽然转头问他:“你能不能把这些手臂从笼子里放出来?”

巴格里诺愣了一下:“放出来干什么?”

“让它们扫地。”

巴格里诺笑了。但他知道马斯克没有在开玩笑。

马斯克从2016年开始就在想这个问题。特斯拉工厂里有几百条机器臂,每一条都只会做一件事——因为它们的大脑只会做一件事。它们没有眼睛,没有触觉,不认得地上的螺丝。如果你把一条机器臂拆下来放在走廊里,它会一直打到墙——然后继续打墙。

但如果——如果给它们一具眼睛、一个大脑、一个能在物理世界里行走的身体呢?

同一年的某个晚上,马斯克在电话里跟团队讲了Optimus的初步设想。团队里有人问:“我们不是造车的吗?”

马斯克反问了一句:“汽车是什么?”

对方愣了一下。

“一具有轮子的机器人。”

电话那头沉默了三秒。没有人反驳。

2022年3月。北京。

工信部发布了《“十四五”机器人产业发展规划》。标题不如第一份规划戏剧化,但内容变了。第一份规划讲的是”产量”——造出多少台。这一份讲的是”核心技术”——国产化率。减速器、伺服电机、控制器——机器人的三大核心部件,“十四五”末期国产化率目标提高到百分之七十以上。

在政策出台的同一个月,宇树的B1机器狗刚刚完成了第一批量产交付——单价一万两千美元,波士顿动力Spot价格的六分之一。王兴兴在接受采访时说了一句话:“我们做的事情和波士顿动力不一样。他们是要证明机器人’可以做什么’。我们要证明机器人’可以用来做什么’。”

这句话是两种文明的缩影。美国在造”先驱”——证明可能性。中国在造”应用”——解决需求。

DARPA的机器人挑战赛已经过去了七年。当年那个摔碎在碎石上的Atlas,后来学会了跑步、后空翻、甚至跳舞。而日本文化线里,1969年的哆啦A梦还在漫画里掏着口袋——“如果有一个机器人朋友,它会帮你做什么?“——这个问题,比”机器人会不会消灭人类”早了十几年进入中国孩子的脑海。

现在,中国的工程师们开始用供应链回答那个童年的问题。

但莫拉维克悖论不会轻易放过任何人。从2015年BRETT机器人第一次自己学会装乐高,到2022年全球最先进的机器人还在为开门这件事较劲——四十年亿的进化遗产,不是七年就能追上的。它需要的不是一家公司。是一个时代。

2022年底。OpenAI发布ChatGPT。

全世界的注意力被吸引到了一行行代码上——AI会聊天了。

但在弗里蒙特工厂的二楼,马斯克没有在看ChatGPT的发布会。

他在看一个早期的FEM模型——一具只有骨架的、用4680电池驱动的双足人形。

它的代号:Optimus。