机器学习介绍:分清 AI、ML 和 DL

本章先解决三个最基础的问题:

  • AIMLDL 分别是什么
  • 它们之间是什么关系
  • 机器学习和传统规则编程到底有什么区别

把这三个问题理顺之后,后面再去学回归、分类、聚类、KNN、决策树这些具体算法,就不容易混淆了。

一、AI、ML、DL 分别是什么

1. 什么是 AI

AIArtificial Intelligence,中文叫人工智能。

可以先把它理解成一个总目标:让机器表现出类似人类智能的能力

例如: 理解语言、识别图像、自动决策、完成问答、推荐、预测等任务

所以 AI 是一个总称,范围最大。

2. 什么是 ML

MLMachine Learning,中文叫机器学习。

它是实现人工智能的一条重要路线,核心思想是:不是把所有规则手写出来,而是让机器从数据中学出规律

常见的机器学习算法有:

  • KNN:常用于分类和简单回归。因为它的思路是“看离我最近的样本是谁”,新数据往往会更像周围相似的数据。
  • 线性回归:常用于预测连续数值,比如房价、销量。因为它擅长描述“输入变化一点,结果大致跟着线性变化”的关系。
  • 逻辑回归:常用于二分类,比如是否流失、是否是垃圾邮件。因为它输出的是某个类别的概率,适合做“是 / 否”判断。
  • 决策树:常用于分类和回归。因为它会像人做判断那样一步步按条件分支,结果直观,也容易解释。
  • 聚类算法:常用于无监督分组,比如用户分群、相似内容归类。因为它不需要提前给标签,而是直接从数据里找出自然形成的类别。

比如你想做“垃圾邮件识别”,传统做法可能是人工写很多判断规则;机器学习则更倾向于给模型大量样本,让它自己学习“什么样的邮件更像垃圾邮件”。

机器学习图片

3. 什么是 DL

DLDeep Learning,中文叫深度学习。

它可以理解为机器学习中的一个重要分支,特点是使用多层神经网络来自动学习更复杂的特征和表示

它特别擅长处理:图像、语音、文本、多模态数据。

今天的大语言模型、本地图像生成模型,本质上都属于深度学习发展的结果。

深度学习图片

二、AI、ML、DL 之间是什么关系

这三个概念是一层包含一层的关系: AI 包含 ML,ML 包含 DL 。

也就是:

  • 人工智能是最大范围
  • 机器学习是人工智能中的一种实现方法
  • 深度学习又是机器学习中的一个重要分支

很多经典算法,例如 KNN、线性回归、逻辑回归、决策树、聚类算法等,都属于机器学习范畴;而图像识别、语音识别、大语言模型等热门方向,通常和深度学习关系更紧密。

三、机器学习和规则编程有什么区别

规则编程是人告诉机器怎么做,机器学习是机器从数据里学会怎么做
两者并不是完全对立,而是适合解决不同类型的问题:

  • 规则明确、流程固定的问题,传统编程更直接
  • 规律复杂、难以手工总结的问题,机器学习更有优势
图片
规则编程和机器学习详情

1. 规则编程

传统程序开发更像这样:输入数据 + 人工编写规则 -> 输出结果

例如判断一个人是否成年,可以直接写:

if age >= 18:
    print("成年")
else:
    print("未成年")

这种方式的特点是:

  • 规则清晰
  • 结果可控
  • 适合逻辑明确的问题

但如果问题很复杂,比如“这是不是垃圾邮件”“这张图片里是不是猫”,规则往往很难手工写全。

2. 机器学习

机器学习更像这样:输入数据 + 正确答案样本 -> 模型学习规律 -> 对新数据做预测

也就是说,开发者不再把所有判断规则逐条写死,而是:

  1. 准备数据
  2. 给出历史样本和标签
  3. 让模型从中学习规律
  4. 再用学到的规律处理新问题
图片

四、机器学习里常见的四种学习方式

理解了机器学习的核心思路后,还要知道它最常见的四种学习方式:有监督学习、无监督学习、半监督学习和强化学习。

1. 有监督学习

有监督学习的特点是:训练集数据同时包含输入特征值和目标值,也就是样本本身带有“正确答案”。

输入特征值 + 目标值 -> 学习映射关系 -> 预测新样本结果

常见任务包括:

  • 回归任务:函数的输出是一个连续值,例如房价预测(55、66、98)、销量预测
  • 分类任务:函数的输出是有限个离散值,例如垃圾邮件识别、电影类型(恐怖、搞笑、爱情)判断

下面这张表就可以看成一个有监督学习的示意数据集,前面的样本都带有电影类型标签,最后一行需要模型去预测:

序号 电影名称 搞笑镜头 拥抱镜头 打斗镜头 电影类型
1 功夫熊猫 39 0 31 喜剧片
2 叶问3 3 2 65 动作片
9 唐人街探案 23 3 17

2. 无监督学习

无监督学习的特点是:训练集数据只有输入特征值,没有目标值,模型需要自己从数据中发现结构和规律。

输入特征值 -> 根据相似性自动分组或提取结构

它常见的任务包括:聚类、降维、异常发现

比如聚类任务,本质上就是根据样本之间的相似性,对样本集进行分类或分组。

可以简单理解为:我们不知道答案,但想让模型自己看看哪些样本更像、能不能自动分成几类。

3. 半监督学习

半监督学习介于监督学习和无监督学习之间。

它的特点是:训练集同时包含含有目标值的样本数据和不含有目标值的样本数据。

少量有标签数据 + 大量无标签数据 -> 共同帮助模型学习

这种方式常见于“标注成本很高,但原始数据很多”的场景,例如图像标注、语音标注和文本分类。

4. 强化学习

强化学习的核心思想是:

让智能体通过与环境不断交互和试错,学习如何获得更高的累计奖励

它通常包含四个关键要素:

  • Agent(智能体)
  • Environment(环境)
  • Action(行动)
  • Reward(奖励)

这类方法常用于游戏 AI、机器人控制、自动驾驶、策略优化等场景。

图片

五、机器学习建模的一般步骤

一个常见流程可以概括成下面几步:

1. 获取数据

先搜集与任务相关的数据集,这是建模的起点。

如果数据本身不完整、不相关或者质量太差,后面的模型效果通常也不会好。

2. 数据基本处理

拿到数据后,往往不能直接训练模型,还需要先做基础清洗,例如:

  • 处理异常值
  • 处理缺失值
  • 统一格式
  • 去掉明显错误的数据

这一步的目标,是让数据先变得“可用”。

3. 特征工程

实际做的最多的就是这步

特征对模型产生影响;因量纲问题,有些特征对模型影响大、有些影响小。

量纲问题是什么意思?

量纲问题,本质上就是:不同特征的数值范围差太大,模型会误以为“大数字更重要”

比如一个人有两个特征:

  • 身高:180
  • 月薪:20000

虽然这两个特征都可能有用,但因为 20000180 大太多,很多模型在计算距离、权重或梯度时,会更容易被“月薪”带着走,导致“身高”的作用被压小。

这就像 2 个人比赛拔河,一个人力量是 180,另一个人力量是 20000,结果当然几乎只看后者,前者的影响会被淹没。

所以在特征工程里,常常要做:

  • 标准化:把数据拉回到“以 0 为中心、波动差不多”的范围
  • 归一化:把数据缩放到一个统一范围,比如 0~1

一句话理解:量纲问题不是特征没用,而是它的数字太小,在计算时容易被别的大数字盖过去。

特征工程的核心,是把原始数据转换成更适合模型学习的输入形式,例如:

  • 提取关键特征
  • 对类别特征做编码
  • 对数值特征做 归一化标准化
  • 把原始信息转换成向量或更适合训练的表示

很多时候,特征工程做得好不好,会直接影响模型最终效果。

4. 机器学习建模

在这一步,才是真正选择合适的算法进行训练。

要选哪类算法,通常和任务类型有关:

  • 有监督学习:例如分类、回归
  • 无监督学习:例如聚类
  • 半监督学习:适合少量有标签、大量无标签数据
  • 强化学习:适合需要通过交互和奖励学习策略的任务

5. 模型评估

模型训练完成后,还需要评估效果,再决定是否上线或继续迭代。

如果效果不好,通常要回到前面的步骤重新调整,例如:

  • 重新清洗数据
  • 调整特征工程
  • 更换模型或参数

所以建模流程并不是“一次完成”,而是一个不断迭代优化的过程。

机器学习建模的一般步骤

六、什么是拟合、欠拟合、过拟合和泛化

在模型评估阶段,经常会接触到这几个概念:拟合、欠拟合、过拟合和泛化。

1. 什么是拟合

“拟合”这个词,用在机器学习领域里,通常表示模型对样本点的贴合情况。

可以理解成:模型学到的规律,和真实数据分布到底有多接近

如果模型完全没有抓住数据规律,就会出现欠拟合;如果模型把训练数据里的细枝末节甚至噪声都记住了,就可能出现过拟合。

  • 欠拟合:模型在训练集上表现很差,在测试集上表现也很差
  • 过拟合:模型在训练集上表现很好,在测试集上表现很差

这说明模型虽然很会“记住训练题”,但一换到新数据上就不行了。

2. 什么是泛化

泛化指的是模型面对“没见过的新样本”时,依然能够保持较好效果的能力。

可以理解成:模型不只是会做训练集里的题,还能把学到的规律用到新数据上

所以一个真正有价值的模型,不是只在训练集上表现好,而是要有较强的泛化能力。

3. 欠拟合和过拟合为什么会出现

欠拟合像是“没学会”,过拟合像是“学偏了”,泛化好才说明“真正学到了可迁移的规律”

七、AI 发展脉络速览

如果把 AI 的发展简化来看,大致经历了符号主义、统计学习、深度学习和大模型四个阶段:从依靠规则表达知识,到用统计方法解决问题,再到借助数据、算法和算力推动深度学习突破,最终走向以 TransformerBERTGPT 为代表的更通用基础模型。近几年的 AI 持续升温,本质上仍离不开 数据算法算力 三个关键因素。