人工智能导论 第 1 章 · 第一节
课程第 1 章第一节 章首文明尺度图灵测试什么是AI达特茅斯第一次寒冬专家系统反向传播三大要素大语言模型多模态强化学习
第 1 章 绪论 · 第一节

人工智能的源与流

从图灵的一个问题到今天的三条前沿主线
本 节 知 识 点
  1. 01第 1 章 绪论
  2. 02二十四小时浓缩人类文明发展史
  3. 03图灵与《计算机器与智能》
  4. 04什么是人工智能
  5. 05一九五六年,达特茅斯会议
  6. 06第一次寒冬与复兴
  7. 07第一次复兴:应用突破
  8. 08第一次复兴:技术突破
  9. 09第二次寒冬与第三次兴起
  10. 10大语言模型的认知革命
  11. 11多模态 AI 与跨模态融合
  12. 12强化学习与世界模拟器
01
第 1 章 · 第一节

第 1 章 绪论

这一章要回答两个问题:人工智能是什么,它是怎么走到今天的。

第 1 页课件

知道更多本章分三节

第一节讲人工智能是什么、从哪里来。第二节讲它内部的三条技术路线。第三节讲它现在走到了哪一步,还有哪些问题没解决。

想一想

你这个学期用过哪些人工智能软件?

02
第 1 章 · 第一节

二十四小时浓缩人类文明发展史

人类文明如果是一天,人工智能出现在最后二十分钟。

第 2 页课件

重 点

以往所有的工具延伸的都是身体,人工智能延伸的是心智。锤子替人使劲,汽车替人走路,而人工智能替人识别、替人判断、替人决定。

知道更多这二十分钟里发生了什么

从人工智能诞生到大模型爆发,图上隔了将近十九分钟,换算成真实时间是七十年。从大模型爆发到现在,只有一分零九秒。

想一想

你手机里哪个软件是在替你做判断,而不只是替你做操作?

03
第 1 章 · 第一节

图灵与《计算机器与智能》

图灵把"机器能否思考"换成了一个能够实际检验的问题。

第 3 页课件

关键术语

图灵测试Turing Test
隔着屏幕用文字交谈,一边是人,一边是机器。如果分辨不出哪一边是机器,就认为这台机器具备了智能。

打个比方

判断一杯水烫不烫,不必先给“烫”下一个严密的定义,也不必去测水分子的平均动能,把手指伸进去就知道了。手指是能实际操作的判据,分子动能不是。图灵给“机器有没有智能”找的,就是这样一根手指。

知道更多它判定的是表现,不是内心

通过图灵测试只说明从外面已经分辨不出来,并不说明机器真的在思考。今天的对话模型在很多场合已经让人分不出来,但几乎没有研究者会说它们有了人的意识。

想一想

你会问一个什么问题,来分辨对面是人还是机器?

04
第 1 章 · 第一节

什么是人工智能

智能是学习加上解决问题的能力,把这套能力搬到生命体之外,就是人工智能。

第 4 页课件

关键术语三个词是三层关系,不是同义词

人工智能Artificial Intelligence
最大的范围。凡是让机器表现出智能的方法都算在内。
机器学习Machine Learning
其中一条路线。特点是让机器从数据里自己找规律。
深度学习Deep Learning
机器学习中的一支。用多层神经网络来找规律。今天的大模型属于这一层。

重 点

人工智能既不等于算法,也不等于机器人。给你推荐视频的系统、识别银行卡号的系统、预报天气的系统,都在做智能的工作,其中一个机器人也没有。

打个比方

算法相当于心法口诀,规定内力怎么运转。数据和算力相当于修炼要花的年头和资源,没有它们,口诀背得再熟也用不出来。机器人相当于练功者的身体,是心法最终施展的地方。

心法可以写在书上传给下一个人,而人的本事带不走。这是人工智能与人类智能最大的不同。

想一想

让你举一个身边的人工智能例子,你会举什么?

05
第 1 章 · 第一节

一九五六年,达特茅斯会议

这一年,"人工智能"这个名字被正式定了下来,所以称为人工智能元年。

第 5 页课件

重 点会议申请书里的那句话

学习的每一个方面,或者智能的任何其他特征,原则上都可以被精确地描述出来,从而可以造一台机器去模拟它。

这句话把一个哲学猜想变成了工程假设,而工程假设是可以动手去做的。

知道更多有个名字为什么重要

在此之前,相关研究散落在控制论、自动机理论、复杂信息处理等不同名目底下。有了统一的名称,才有统一的会议、统一的期刊、统一的评价标准,也才申请得到成规模的经费。

知道更多合影里的年纪

照片上这几位当时大多三十岁上下,明斯基二十九岁,麦卡锡二十九岁。

想一想

这门学科到今年正好七十岁,你觉得它算年轻还是算老?

06
第 1 章 · 第一节

第一次寒冬与复兴

靠人一条一条写规则的路走不通,人工智能迎来第一次寒冬。

第 6 页课件

关键术语

机器学习Machine Learning
萨缪尔在跳棋程序上提出的说法。程序通过与自己反复对弈来改进下法,这是机器学习最早的样子。

打个比方为什么规则写不完

要给一台从没见过狗的机器写规则,你会写:有四条腿、有毛、有尾巴。可是猫也符合,桌子有四条腿,趴着的狗看不到四条腿,泰迪犬和藏獒的差别比藏獒和狼的差别还大。

每补一条规则就冒出三个新的例外,规则表越写越长,准确率却上不去。人能一眼认出狗,靠的并不是心里存着一张规则表。

知道更多那台机器有多大

图上运行跳棋程序的 IBM 7090 占了大半间屋子,运算能力还不如今天一部普通手机的零头。

想一想

如果让你写规则教机器认出一只猫,你会写哪几条?

07
第 1 章 · 第一节

第一次复兴:应用突破

不再追求通用的智能,先在一个小领域里超过人类专家。

第 7 页课件

关键术语

专家系统Expert System
把专家的经验写成“若 A 且 B,则 C”这样的规则交给计算机,再由程序逐条匹配、推出结论。

重 点漫画里那句玩笑话

医生问“你为什么要问发烧的事”,系统答“问就是规则告诉我的”。这句话正好说清了专家系统的长处和短处:它说出自己依据了哪条规则,这一点比今天的大模型还强。它只能说出这个,规则背后为什么成立,它一无所知。

知道更多它第一次被证明能挣钱

XCON 帮数字设备公司自动配置计算机订单,客户下单后由它决定配哪些板卡、哪些线缆、怎么装才不出错。投入使用后每年省下数千万美元。

想一想

机器给你一个结论的时候,你希望它同时告诉你理由吗?

08
第 1 章 · 第一节

第一次复兴:技术突破

两项技术让神经网络能够做深,也能够看懂图像。

第 8 页课件

关键术语

反向传播Back Propagation
从输出端的误差出发,一层一层往回推算每个参数该负多大责任,再按责任大小去调整。
卷积神经网络Convolutional Neural Network
用一个小窗口在图片上滑动着提取局部特征,参数少,而且不怕物体换位置。

打个比方反向传播像订正错题

卷子发下来发现最后一道大题错了,你不会把整套知识重学一遍,而是倒着往回找:是最后一步算错了,还是中间设的方程有问题,还是一开始就把题意理解偏了。找到最靠前的那个环节,重点改那里。

打个比方卷积像一个取景框

看画时拿着取景框从左上角一格一格挪过去,每挪一格记下框里有什么,比如这里有一道边、那里有一个角。

关键在于这个取景框自始至终是同一个。不管猫出现在左上角还是右下角,用的都是同一套判断标准。

想一想

一九八六年反向传播就已经有了,为什么深度学习过了二十多年才火起来?

09
第 1 章 · 第一节

第二次寒冬与第三次兴起

算法、算力、数据三样同时到位,人工智能才真正起飞。

第 9 页课件

重 点三大要素是相乘,不是相加

任何一项为零,结果都是零。两次寒冬的根本原因,都可以从这里找到解释。

打个比方

算法是菜谱,算力是灶火,数据是食材。菜谱再好,没有食材做不出菜,火不够大也做不熟。

一九八六年菜谱就已经写好了,另外两样等了二十年才补齐。

知道更多GPU 本来不是干这个的

图形处理器原本是为游戏画面设计的,它擅长同时做大量简单的重复计算,而这恰好就是训练神经网络需要的。一个原本用途完全不同的硬件,意外成了人工智能的发动机。

想一想

算法、算力、数据,你觉得今天哪一样最紧张?

10
第 1 章 · 第一节

大语言模型的认知革命

大模型的新,在于它能听懂指令,也能举一反三。

第 10 页课件

关键术语

少样本学习Few-shot Learning
给模型看两三个例子,它就能照着做同类的题目,不需要为这个任务重新训练一遍。

打个比方相当于换了一种雇人的方式

过去要完成一项工作,得先招人,再按这项工作专门培训几个月,培训完他只会这一件事,换个岗位就得重招重训。

现在是先招进来一个受过完整通识教育的人,交办新任务时只需要把要求讲清楚,必要时给他看两份样例,当天就能上手。

知道更多175B 是什么意思

图上 GPT-3 标着 175B Parameters,也就是一千七百五十亿个参数。具体数字不必记,记住“大”这个字是实打实的就行。

想一想

你用大模型做过什么事?

11
第 1 章 · 第一节

多模态 AI 与跨模态融合

让机器同时看图、读字、听声音,理解才靠得住。

第 11 页课件

关键术语

视觉语言模型Vision-Language Model
能看懂图片视频,也能听懂文字,然后用语言回答。
视觉语言动作模型Vision-Language-Action
看懂之后直接输出动作,中间不再需要人去写控制程序。

打个比方只用一种感官像隔着门缝看人

听见走廊里有脚步声,知道有人来了,但不知道是谁。只看到一个背影,知道是谁,但不知道他要做什么。把声音、画面、说的话合在一起,才知道是隔壁宿舍的同学抱着一摞书过来还书。

每增加一种模态,能排除掉的误判就多一批。

知道更多不同类型的信息怎么凑到一起

关键一步是把图像、文字、声音都换算成同一种内部编码。换算完之后,一张猫的照片和“猫”这个字在机器眼里就落在了很近的位置上,处理方式也就没有区别了。

想一想

只给你一张照片,不给任何文字,你能判断出照片里的人在做什么吗?

12
第 1 章 · 第一节

强化学习与世界模拟器

没有标准答案可背的事情,只能靠试出来。

第 12 页课件

关键术语

强化学习Reinforcement Learning
智能体做出动作,环境返回新的状态和一个奖惩信号,智能体据此调整策略,目标是让长期收益最大。

重 点注意"长期"两个字

图上“奖惩”给出的是即时反馈,而智能体真正要最大化的,是整局的反馈加起来之后的总和。这两者经常不一致,这也是强化学习最难的地方。

打个比方

象棋里白送一个车换对方将军入局,这一步在当下看是巨亏,在整局看却是必胜手。只盯着眼前得分的程序永远学不会这种走法,因为它在那一步得到的即时反馈是负的。

知道更多为什么要造一个虚拟世界

尝试是有代价的。自动驾驶系统不可能靠在真实道路上反复出事故来学会开车,所以要先在虚拟环境里练。图上特斯拉的世界模拟器,生成的就是同一个场景在不同视角下的样子。

想一想

你学骑自行车的时候,是先看懂原理才会的,还是摔了几次就会了?

保山学院·人工智能教研室·曹鼎鼎