第 1 章 绪论
这一章要回答两个问题:人工智能是什么,它是怎么走到今天的。

知道更多本章分三节
第一节讲人工智能是什么、从哪里来。第二节讲它内部的三条技术路线。第三节讲它现在走到了哪一步,还有哪些问题没解决。
想一想
你这个学期用过哪些人工智能软件?
这一章要回答两个问题:人工智能是什么,它是怎么走到今天的。

第一节讲人工智能是什么、从哪里来。第二节讲它内部的三条技术路线。第三节讲它现在走到了哪一步,还有哪些问题没解决。
你这个学期用过哪些人工智能软件?
人类文明如果是一天,人工智能出现在最后二十分钟。

以往所有的工具延伸的都是身体,人工智能延伸的是心智。锤子替人使劲,汽车替人走路,而人工智能替人识别、替人判断、替人决定。
从人工智能诞生到大模型爆发,图上隔了将近十九分钟,换算成真实时间是七十年。从大模型爆发到现在,只有一分零九秒。
你手机里哪个软件是在替你做判断,而不只是替你做操作?
图灵把"机器能否思考"换成了一个能够实际检验的问题。

判断一杯水烫不烫,不必先给“烫”下一个严密的定义,也不必去测水分子的平均动能,把手指伸进去就知道了。手指是能实际操作的判据,分子动能不是。图灵给“机器有没有智能”找的,就是这样一根手指。
通过图灵测试只说明从外面已经分辨不出来,并不说明机器真的在思考。今天的对话模型在很多场合已经让人分不出来,但几乎没有研究者会说它们有了人的意识。
你会问一个什么问题,来分辨对面是人还是机器?
智能是学习加上解决问题的能力,把这套能力搬到生命体之外,就是人工智能。

人工智能既不等于算法,也不等于机器人。给你推荐视频的系统、识别银行卡号的系统、预报天气的系统,都在做智能的工作,其中一个机器人也没有。
算法相当于心法口诀,规定内力怎么运转。数据和算力相当于修炼要花的年头和资源,没有它们,口诀背得再熟也用不出来。机器人相当于练功者的身体,是心法最终施展的地方。
心法可以写在书上传给下一个人,而人的本事带不走。这是人工智能与人类智能最大的不同。
让你举一个身边的人工智能例子,你会举什么?
这一年,"人工智能"这个名字被正式定了下来,所以称为人工智能元年。

学习的每一个方面,或者智能的任何其他特征,原则上都可以被精确地描述出来,从而可以造一台机器去模拟它。
这句话把一个哲学猜想变成了工程假设,而工程假设是可以动手去做的。
在此之前,相关研究散落在控制论、自动机理论、复杂信息处理等不同名目底下。有了统一的名称,才有统一的会议、统一的期刊、统一的评价标准,也才申请得到成规模的经费。
照片上这几位当时大多三十岁上下,明斯基二十九岁,麦卡锡二十九岁。
这门学科到今年正好七十岁,你觉得它算年轻还是算老?
靠人一条一条写规则的路走不通,人工智能迎来第一次寒冬。

要给一台从没见过狗的机器写规则,你会写:有四条腿、有毛、有尾巴。可是猫也符合,桌子有四条腿,趴着的狗看不到四条腿,泰迪犬和藏獒的差别比藏獒和狼的差别还大。
每补一条规则就冒出三个新的例外,规则表越写越长,准确率却上不去。人能一眼认出狗,靠的并不是心里存着一张规则表。
图上运行跳棋程序的 IBM 7090 占了大半间屋子,运算能力还不如今天一部普通手机的零头。
如果让你写规则教机器认出一只猫,你会写哪几条?
不再追求通用的智能,先在一个小领域里超过人类专家。

医生问“你为什么要问发烧的事”,系统答“问就是规则告诉我的”。这句话正好说清了专家系统的长处和短处:它能说出自己依据了哪条规则,这一点比今天的大模型还强。它只能说出这个,规则背后为什么成立,它一无所知。
XCON 帮数字设备公司自动配置计算机订单,客户下单后由它决定配哪些板卡、哪些线缆、怎么装才不出错。投入使用后每年省下数千万美元。
机器给你一个结论的时候,你希望它同时告诉你理由吗?
两项技术让神经网络能够做深,也能够看懂图像。

卷子发下来发现最后一道大题错了,你不会把整套知识重学一遍,而是倒着往回找:是最后一步算错了,还是中间设的方程有问题,还是一开始就把题意理解偏了。找到最靠前的那个环节,重点改那里。
看画时拿着取景框从左上角一格一格挪过去,每挪一格记下框里有什么,比如这里有一道边、那里有一个角。
关键在于这个取景框自始至终是同一个。不管猫出现在左上角还是右下角,用的都是同一套判断标准。
一九八六年反向传播就已经有了,为什么深度学习过了二十多年才火起来?
算法、算力、数据三样同时到位,人工智能才真正起飞。

任何一项为零,结果都是零。两次寒冬的根本原因,都可以从这里找到解释。
算法是菜谱,算力是灶火,数据是食材。菜谱再好,没有食材做不出菜,火不够大也做不熟。
一九八六年菜谱就已经写好了,另外两样等了二十年才补齐。
图形处理器原本是为游戏画面设计的,它擅长同时做大量简单的重复计算,而这恰好就是训练神经网络需要的。一个原本用途完全不同的硬件,意外成了人工智能的发动机。
算法、算力、数据,你觉得今天哪一样最紧张?
大模型的新,在于它能听懂指令,也能举一反三。

过去要完成一项工作,得先招人,再按这项工作专门培训几个月,培训完他只会这一件事,换个岗位就得重招重训。
现在是先招进来一个受过完整通识教育的人,交办新任务时只需要把要求讲清楚,必要时给他看两份样例,当天就能上手。
图上 GPT-3 标着 175B Parameters,也就是一千七百五十亿个参数。具体数字不必记,记住“大”这个字是实打实的就行。
你用大模型做过什么事?
让机器同时看图、读字、听声音,理解才靠得住。

听见走廊里有脚步声,知道有人来了,但不知道是谁。只看到一个背影,知道是谁,但不知道他要做什么。把声音、画面、说的话合在一起,才知道是隔壁宿舍的同学抱着一摞书过来还书。
每增加一种模态,能排除掉的误判就多一批。
关键一步是把图像、文字、声音都换算成同一种内部编码。换算完之后,一张猫的照片和“猫”这个字在机器眼里就落在了很近的位置上,处理方式也就没有区别了。
只给你一张照片,不给任何文字,你能判断出照片里的人在做什么吗?
没有标准答案可背的事情,只能靠试出来。

图上“奖惩”给出的是即时反馈,而智能体真正要最大化的,是整局的反馈加起来之后的总和。这两者经常不一致,这也是强化学习最难的地方。
象棋里白送一个车换对方将军入局,这一步在当下看是巨亏,在整局看却是必胜手。只盯着眼前得分的程序永远学不会这种走法,因为它在那一步得到的即时反馈是负的。
尝试是有代价的。自动驾驶系统不可能靠在真实道路上反复出事故来学会开车,所以要先在虚拟环境里练。图上特斯拉的世界模拟器,生成的就是同一个场景在不同视角下的样子。
你学骑自行车的时候,是先看懂原理才会的,还是摔了几次就会了?