本章先解决三个最基础的问题:
AI、ML、DL分别是什么- 它们之间是什么关系
- 机器学习和传统规则编程到底有什么区别
把这三个问题理顺之后,后面再去学回归、分类、聚类、KNN、决策树这些具体算法,就不容易混淆了。
一、AI、ML、DL 分别是什么
1. 什么是 AI
AI 是 Artificial Intelligence,中文叫人工智能。
可以先把它理解成一个总目标:让机器表现出类似人类智能的能力
例如: 理解语言、识别图像、自动决策、完成问答、推荐、预测等任务
所以 AI 是一个总称,范围最大。
2. 什么是 ML
ML 是 Machine Learning,中文叫机器学习。
它是实现人工智能的一条重要路线,核心思想是:不是把所有规则手写出来,而是让机器从数据中学出规律
常见的机器学习算法有:
KNN:常用于分类和简单回归。因为它的思路是“看离我最近的样本是谁”,新数据往往会更像周围相似的数据。- 线性回归:常用于预测连续数值,比如房价、销量。因为它擅长描述“输入变化一点,结果大致跟着线性变化”的关系。
- 逻辑回归:常用于二分类,比如是否流失、是否是垃圾邮件。因为它输出的是某个类别的概率,适合做“是 / 否”判断。
- 决策树:常用于分类和回归。因为它会像人做判断那样一步步按条件分支,结果直观,也容易解释。
- 聚类算法:常用于无监督分组,比如用户分群、相似内容归类。因为它不需要提前给标签,而是直接从数据里找出自然形成的类别。
比如你想做“垃圾邮件识别”,传统做法可能是人工写很多判断规则;机器学习则更倾向于给模型大量样本,让它自己学习“什么样的邮件更像垃圾邮件”。

3. 什么是 DL
DL 是 Deep Learning,中文叫深度学习。
它可以理解为机器学习中的一个重要分支,特点是使用多层神经网络来自动学习更复杂的特征和表示。
它特别擅长处理:图像、语音、文本、多模态数据。
今天的大语言模型、本地图像生成模型,本质上都属于深度学习发展的结果。

二、AI、ML、DL 之间是什么关系
这三个概念是一层包含一层的关系: AI 包含 ML,ML 包含 DL 。
也就是:
- 人工智能是最大范围
- 机器学习是人工智能中的一种实现方法
- 深度学习又是机器学习中的一个重要分支
很多经典算法,例如 KNN、线性回归、逻辑回归、决策树、聚类算法等,都属于机器学习范畴;而图像识别、语音识别、大语言模型等热门方向,通常和深度学习关系更紧密。
三、机器学习和规则编程有什么区别
规则编程是人告诉机器怎么做,机器学习是机器从数据里学会怎么做
两者并不是完全对立,而是适合解决不同类型的问题:
- 规则明确、流程固定的问题,传统编程更直接
- 规律复杂、难以手工总结的问题,机器学习更有优势

规则编程和机器学习详情
1. 规则编程
传统程序开发更像这样:输入数据 + 人工编写规则 -> 输出结果
例如判断一个人是否成年,可以直接写:
if age >= 18:
print("成年")
else:
print("未成年")
这种方式的特点是:
- 规则清晰
- 结果可控
- 适合逻辑明确的问题
但如果问题很复杂,比如“这是不是垃圾邮件”“这张图片里是不是猫”,规则往往很难手工写全。
2. 机器学习
机器学习更像这样:输入数据 + 正确答案样本 -> 模型学习规律 -> 对新数据做预测
也就是说,开发者不再把所有判断规则逐条写死,而是:
- 准备数据
- 给出历史样本和标签
- 让模型从中学习规律
- 再用学到的规律处理新问题

四、机器学习里常见的四种学习方式
理解了机器学习的核心思路后,还要知道它最常见的四种学习方式:有监督学习、无监督学习、半监督学习和强化学习。
1. 有监督学习
有监督学习的特点是:训练集数据同时包含输入特征值和目标值,也就是样本本身带有“正确答案”。
输入特征值 + 目标值 -> 学习映射关系 -> 预测新样本结果
常见任务包括:
- 回归任务:函数的输出是一个连续值,例如房价预测(55、66、98)、销量预测
- 分类任务:函数的输出是有限个离散值,例如垃圾邮件识别、电影类型(恐怖、搞笑、爱情)判断
下面这张表就可以看成一个有监督学习的示意数据集,前面的样本都带有电影类型标签,最后一行需要模型去预测:
| 序号 | 电影名称 | 搞笑镜头 | 拥抱镜头 | 打斗镜头 | 电影类型 |
|---|---|---|---|---|---|
| 1 | 功夫熊猫 | 39 | 0 | 31 | 喜剧片 |
| 2 | 叶问3 | 3 | 2 | 65 | 动作片 |
| 9 | 唐人街探案 | 23 | 3 | 17 | ? |
2. 无监督学习
无监督学习的特点是:训练集数据只有输入特征值,没有目标值,模型需要自己从数据中发现结构和规律。
输入特征值 -> 根据相似性自动分组或提取结构
它常见的任务包括:聚类、降维、异常发现
比如聚类任务,本质上就是根据样本之间的相似性,对样本集进行分类或分组。
可以简单理解为:我们不知道答案,但想让模型自己看看哪些样本更像、能不能自动分成几类。
3. 半监督学习
半监督学习介于监督学习和无监督学习之间。
它的特点是:训练集同时包含含有目标值的样本数据和不含有目标值的样本数据。
少量有标签数据 + 大量无标签数据 -> 共同帮助模型学习
这种方式常见于“标注成本很高,但原始数据很多”的场景,例如图像标注、语音标注和文本分类。
4. 强化学习
强化学习的核心思想是:
让智能体通过与环境不断交互和试错,学习如何获得更高的累计奖励
它通常包含四个关键要素:
- Agent(智能体)
- Environment(环境)
- Action(行动)
- Reward(奖励)
这类方法常用于游戏 AI、机器人控制、自动驾驶、策略优化等场景。

五、机器学习建模的一般步骤
一个常见流程可以概括成下面几步:
1. 获取数据
先搜集与任务相关的数据集,这是建模的起点。
如果数据本身不完整、不相关或者质量太差,后面的模型效果通常也不会好。
2. 数据基本处理
拿到数据后,往往不能直接训练模型,还需要先做基础清洗,例如:
- 处理异常值
- 处理缺失值
- 统一格式
- 去掉明显错误的数据
这一步的目标,是让数据先变得“可用”。
3. 特征工程
实际做的最多的就是这步
特征对模型产生影响;因量纲问题,有些特征对模型影响大、有些影响小。
量纲问题是什么意思?
量纲问题,本质上就是:不同特征的数值范围差太大,模型会误以为“大数字更重要”。
比如一个人有两个特征:
- 身高:
180 - 月薪:
20000
虽然这两个特征都可能有用,但因为 20000 比 180 大太多,很多模型在计算距离、权重或梯度时,会更容易被“月薪”带着走,导致“身高”的作用被压小。
这就像 2 个人比赛拔河,一个人力量是 180,另一个人力量是 20000,结果当然几乎只看后者,前者的影响会被淹没。
所以在特征工程里,常常要做:
- 标准化:把数据拉回到“以 0 为中心、波动差不多”的范围
- 归一化:把数据缩放到一个统一范围,比如
0~1
一句话理解:量纲问题不是特征没用,而是它的数字太小,在计算时容易被别的大数字盖过去。
特征工程的核心,是把原始数据转换成更适合模型学习的输入形式,例如:
- 提取关键特征
- 对类别特征做编码
- 对数值特征做 归一化 或 标准化
- 把原始信息转换成向量或更适合训练的表示
很多时候,特征工程做得好不好,会直接影响模型最终效果。
4. 机器学习建模
在这一步,才是真正选择合适的算法进行训练。
要选哪类算法,通常和任务类型有关:
- 有监督学习:例如分类、回归
- 无监督学习:例如聚类
- 半监督学习:适合少量有标签、大量无标签数据
- 强化学习:适合需要通过交互和奖励学习策略的任务
5. 模型评估
模型训练完成后,还需要评估效果,再决定是否上线或继续迭代。
如果效果不好,通常要回到前面的步骤重新调整,例如:
- 重新清洗数据
- 调整特征工程
- 更换模型或参数
所以建模流程并不是“一次完成”,而是一个不断迭代优化的过程。

六、什么是拟合、欠拟合、过拟合和泛化
在模型评估阶段,经常会接触到这几个概念:拟合、欠拟合、过拟合和泛化。
1. 什么是拟合
“拟合”这个词,用在机器学习领域里,通常表示模型对样本点的贴合情况。
可以理解成:模型学到的规律,和真实数据分布到底有多接近
如果模型完全没有抓住数据规律,就会出现欠拟合;如果模型把训练数据里的细枝末节甚至噪声都记住了,就可能出现过拟合。
- 欠拟合:模型在训练集上表现很差,在测试集上表现也很差
- 过拟合:模型在训练集上表现很好,在测试集上表现很差
这说明模型虽然很会“记住训练题”,但一换到新数据上就不行了。
2. 什么是泛化
泛化指的是模型面对“没见过的新样本”时,依然能够保持较好效果的能力。
可以理解成:模型不只是会做训练集里的题,还能把学到的规律用到新数据上
所以一个真正有价值的模型,不是只在训练集上表现好,而是要有较强的泛化能力。
3. 欠拟合和过拟合为什么会出现
欠拟合像是“没学会”,过拟合像是“学偏了”,泛化好才说明“真正学到了可迁移的规律”
七、AI 发展脉络速览
如果把 AI 的发展简化来看,大致经历了符号主义、统计学习、深度学习和大模型四个阶段:从依靠规则表达知识,到用统计方法解决问题,再到借助数据、算法和算力推动深度学习突破,最终走向以 Transformer、BERT、GPT 为代表的更通用基础模型。近几年的 AI 持续升温,本质上仍离不开 数据、算法、算力 三个关键因素。