人工智能导论 第 1 章 · 第二节
课程第 1 章第二节 三大流派符号主义连接主义行为主义生成的起点LDA 主题模型VAE 与 GANAIGC 爆发
第 1 章 绪论 · 第二节

人工智能的技术版图

三大技术流派,以及生成式人工智能的来路
本 节 知 识 点
  1. 13三大技术流派
  2. 14符号主义
  3. 15连接主义
  4. 16行为主义
  5. 17前 AI 生成时代
  6. 18早期 AI 生成模型
  7. 19AI 生成技术腾飞
  8. 20AI 生成内容爆发
13
第 1 章 · 第二节

三大技术流派

对"智能从哪里来"这个问题,有三种完全不同的回答。

第 13 页课件

重 点图上第一行是关键

符号主义模拟人的心智,连接主义模拟脑的结构,行为主义模拟人的行为。三者不是先后关系,而是同时存在、互相竞争又互相借鉴的三种技术传统。

打个比方同一件事,三种做法

让机器学会走出校园。符号主义给它一张标注清楚的地图和一套通行规则,让它算出路线。连接主义给它看几万段别人走出校园的录像,让它自己总结。行为主义把它放进校园里,走对了给奖励,走错了给惩罚,让它试出来。

三种做法都能走出校园,但它们对“什么叫会认路”的理解完全不同。

知道更多今天三条路已经合流

一个现代的大模型应用,底座是连接主义的神经网络,调用外部知识库和工具的能力来自符号主义,让回答符合人类偏好用的是行为主义的强化学习。

想一想

教一个人认路,你会画地图、带他走一遍,还是让他自己转?

14
第 1 章 · 第二节

符号主义

把知识写成符号,再按逻辑一步一步推出结论。

第 14 页课件

关键术语

符号主义Symbolicism
认为智能的本质是对符号的操作。把知识写成确定的形式,让计算机按逻辑规则去推理。
A* 算法A-star Algorithm
路径搜索方法。每一步都优先考察最有希望的方向,在保证找到最短路径的前提下大幅减少搜索量。

重 点图上那三个数怎么读

从起点走到当前这一格已经花了 5 步,估计从这一格到终点还要 3 步,两个数加起来是 8。这个 8 就是“从这一格走完全程”的下界估计。算法每一步都优先考察这个数最小的格子。

打个比方

在陌生城市找餐厅,你不会把所有街道都走一遍。先看一眼地图,判断餐厅大致在东南方向,然后每到一个路口就优先选朝东南去的路。“大致在东南方向”就是那个估计值。

知道更多照片上这两位

纽厄尔是图灵奖得主,西蒙不但是图灵奖得主,还因为有限理性理论拿了诺贝尔经济学奖。他们的“逻辑理论家”证明了《数学原理》里三十多条定理,其中一条的证明比原书还要简洁。

想一想

导航软件给你规划路线的时候,它把所有可能的路都算过一遍吗?

15
第 1 章 · 第二节

连接主义

不写规则,先搭好结构,再让数据去调整连接的强弱。

第 15 页课件

关键术语

感知机Perceptron
最早的实用神经网络模型。把若干输入各自乘上权重再加起来,超过阈值就输出一。
多层感知机Multilayer Perceptron
在输入和输出之间加入隐藏层,能画出折线和曲线,解决了感知机分不开的问题。

重 点为什么要加隐藏层

感知机本质上只能画一条直线来分割数据,一条直线分不开的情况它就无能为力。加上隐藏层之后网络才能画出折线甚至曲线。图上右边那些 H₁、H₂ 就是隐藏层,“深度”说的正是这个层数。

打个比方知识存在哪里

符号主义存知识像一间档案室,“苹果”这个概念放在编号 A-037 的抽屉里,抽屉坏了这个概念就没了。

连接主义像一张渔网,“苹果”不在任何一个网结上,而是体现在整张网某一片区域的绷紧程度上。剪断几根线,网还在,“苹果”还认得出来,只是稍微模糊了一点。

知道更多为什么模仿大脑

人脑大约有八百六十亿个神经元,它们之间的连接数以万亿计。连接主义相信智能就是这些连接共同作用之后涌现出来的结果,而不是某处存着一张规则表。

想一想

你能写出一条规则,让别人照着就能认出你的笔迹吗?

16
第 1 章 · 第二节

行为主义

不追问它懂不懂,只看它在环境里做得对不对。

第 16 页课件

关键术语

行为主义Actionism
把对外在环境的感知直接映射到行动决策上,研究重点是对环境变化的反应性和适应性。

重 点

图上两台机器相差二十多年,做的却是同一件事:感知环境,然后改变自己的动作。沃尔特的“乌龟”内部只有两个电子管、一个光电管和一个碰撞传感器,却会趋光、会避障、电量低了还会自己回去充电。

打个比方蚂蚁不需要蓝图

蚂蚁脑子里的神经元不到一百万个,远远不够规划一座蚁穴。但每只蚂蚁只遵守几条简单规则,比如闻到同伴留下的气味就跟着走、找到食物就往回留气味。

复杂的集体行为不是被设计出来的,而是简单规则在环境里反复作用之后自己长出来的。

知道更多这条路今天还在走

沃尔特造“乌龟”是在一九四九年,比达特茅斯会议还早七年。第一节讲的强化学习,以及第三节要讲的具身智能,走的都是这条路线的延长线。

想一想

你第一次用一个陌生的软件,是先把说明看完,还是直接点点看?

17
第 1 章 · 第二节

前 AI 生成时代

判别是认字,生成是写字。会认不一定会写。

第 17 页课件

关键术语

判别式任务Discriminative Task
学的是从输入到标签的对应关系,只要在类别之间划出边界就行。
生成式任务Generative Task
学的是数据本身的概率分布,也就是这类东西通常长什么样。

打个比方

认字只要能把“永”和“水”分开就行,你甚至不必记得“永”字每一笔的走向。写字则不同,你必须知道这个字由哪些笔画构成、各占多大位置、先后顺序如何。

会认不一定会写,会写则一定会认。生成式模型要学的东西比判别式模型多得多,这也是它出现得更晚的原因。

重 点三种结构是一路做减法

第一种所有节点互相连接,表达能力最强,但连接数量随节点数平方增长,稍大一点就训练不动。第二种分成可见层和隐藏层,减了一部分负担。第三种规定同一层内部不许连接,计算量大幅下降,这才真的能训练。

知道更多一条反复出现的规律

受限玻尔兹曼机正是二〇〇六年深度学习突破时的关键工具之一。在人工智能史上,“通过增加限制来换取可训练性”这个做法反复出现。理论上最强的结构,往往不是工程上最有用的结构。

想一想

你能认出一首熟悉的歌,也能把它完整唱下来吗?这两件事一样难吗?

18
第 1 章 · 第二节

早期 AI 生成模型

一篇文章不属于某一个主题,而是几个主题按比例的混合。

第 18 页课件

关键术语

隐含狄利克雷分布Latent Dirichlet Allocation
假设每篇文章由若干主题按比例混合而成,每个主题又由若干词按概率组成,据此自动把大量文本归类。

打个比方

一篇报道可能是七成体育、两成经济、一成娱乐。体育那部分高频出现“比赛、球员、夺冠”,经济那部分高频出现“赞助、营收、合同”。

主题和词的对应关系不是人指定的,是模型统计海量文章之后自己找出来的。人只需要给主题起个名字。

重 点观测变量与隐变量

图上左边一列写着观测变量,右边写着隐变量。看得见的是文章里的那些词,看不见的是背后的主题。生成模型要做的,就是从看得见的东西反推看不见的东西。

知道更多这套方法今天还在用

自动给文章打标签、找相似文档做推荐、分析舆情和情感、构建知识图谱,背后常常都有它的影子。

想一想

你刷到的短视频推荐,是怎么知道你可能喜欢这一条的?

19
第 1 章 · 第二节

AI 生成技术腾飞

两条方向相反的路,都通向让机器学会数据长什么样。

第 19 页课件

关键术语

变分自编码器Variational Auto-Encoder
基于概率推断,把数据长什么样直接写成一个概率模型。
生成对抗网络Generative Adversarial Network
基于零和博弈,不写模型,靠两个网络互相对抗把分布逼出来。
自注意力机制Self-Attention
让序列里每个元素都直接与其他所有元素建立联系,不受距离远近影响。

打个比方GAN 像造假币的和验钞的

造假的人做出一批钞票拿去用,验钞员挑出破绽退回来,造假的人据此改进工艺,验钞员又必须学会看更细的地方。若干轮之后做出来的东西已经和真的几乎没有区别,而整个过程里从头到尾没有人给过他一份真钞的制作说明。

打个比方VAE 像看图写话再还原

把一幅画看过之后写成一段文字描述,再让另一个人只照着这段描述把画重新画出来。描述越准确,还原得越像。这段描述就是图上那个 z。

知道更多Transformer 解决了什么

要判断“它已经过期了”里的“它”指什么,模型需要同时看到句子里所有的名词。书会过期,图书馆不会,于是最大的注意力落在“书”上。自注意力让这个判断一步就能完成,不必让信息沿着句子一路传过来。

想一想

你觉得机器画出来的画,算不算原创?

20
第 1 章 · 第二节

AI 生成内容爆发

GAI 是工具,AIGC 是用工具做出来的作品。

第 20 页课件

重 点这两个缩写不能混用

相机是工具,照片是作品。说“这家公司在做 GAI”指的是它在做模型,说“这是一张 AIGC 图片”指的是这张图由模型生成。

知道更多三件事同时发生

大规模生成模型出现,效果第一次达到普通人愿意实际使用的水平。Hugging Face 这类开源平台把模型和数据集集中公开,开发者不必从零开始。GPU 与云计算普及,加上互联网数据指数增长,撑起了超大规模模型的训练。

知道更多右边那张架构图怎么读

图片、音频、文字、视频先各自过一个编码器,再由中间的连接器送进大模型,最后交给生成器输出。不同类型的内容在中间那一段用的是同一套处理方式。

想一想

你用过哪些能生成图片、视频或者音乐的工具?

保山学院·人工智能教研室·曹鼎鼎