深度学习概述

从感知机、激活函数到多层感知机与反向传播,系统建立人工神经网络的核心认知,并结合 PyTorch 框架完成张量操作与自动微分实战。

核心认知

深度学习 (Deep Learning) 的本质,就是通过模仿人脑的“多层神经网络”架构,让机器拥有自动提取复杂特征的能力。

一句话理解:传统机器学习像是教小孩认猫(需人工指出猫有耳朵、胡须),而深度学习是给小孩看成千上万张猫的图片,让他在“多层网络”中自己悟出“什么是猫”。

它尤其擅长处理图像、语音、文本等高维复杂数据。

多层神经网络

核心特点

  • 自动提取:摆脱了繁琐的人工特征工程。
  • 层层递进:底层认轮廓边缘,高层认完整物体(多层非线性变换)。
  • 算力与数据驱动:效果好,但极度依赖海量标注数据和强悍算力(如 GPU)。
  • “黑盒”属性:可解释性差,很难解释它具体是依据什么做出决策的。

特征提取

主流架构与应用场景

不同架构的模型,擅长解决不同维度的业务问题:

深度学习模型

  • 计算机视觉 (CV) —— 主力架构:CNN (卷积神经网络) 擅长处理二维空间特征。常见应用包括图像分类(如医疗影像病变检测)、目标检测(如自动驾驶行人识别)、面部识别(如手机解锁)、图像生成(如老照片修复)。
  • 自然语言处理 (NLP) —— 主力架构:Transformer (早期为 RNN) 擅长处理带有上下文的序列数据。常见应用包括机器翻译、情感分析(社交媒体舆情监控)、文本生成(自动写作助手)、智能对话机器人(如 ChatGPT 类应用)。
  • 推荐系统 (RecSys) 根据用户历史行为(购买、浏览、评分)计算偏好,广泛应用于抖音、淘宝、Netflix 的个性化内容分发。
  • 自动驾驶 (Autonomous Driving) 融合 CV(看路)与 DRL(做决策),实现车辆的感知、规划与控制。
  • 医疗健康 (Healthcare) 辅助医生进行疾病筛查(如看 X 光片发现肿瘤)、新药研发与基因序列分析。
  • 工业与制造业 (Manufacturing) 用于产品表面缺陷检测(如流水线挑出残次品)、设备预测性维护(听声音判断机器是否快坏了)。
  • 语音与音频处理 (Speech & Audio) 涵盖语音识别(如 Siri 听懂你的话)、语音合成(文字转声音)以及音乐生成。

应用场景

补充:其他常见模型架构
  • 生成对抗网络 (GAN):包含生成器和判别器,左右互搏,常用于生成极为逼真的图像或视频。
  • 自编码器 (Autoencoders):一种无监督模型,先将数据压缩降维,再尝试从低维还原,常用于特征提取或异常检测。
  • 深度强化学习 (DRL, Deep Reinforcement Learning):结合深度学习(看懂环境)与强化学习(做决策),AI 通过不断试错来获取最大奖励。典型代表是下围棋的 AlphaGo 和自动驾驶决策。
  • 图神经网络 (GNN, Graph Neural Network):专门对付“网状/图状”数据,能精准捕捉节点之间“谁认识谁、谁连接谁”的复杂关系。常用于社交网络分析、知识图谱和分子结构预测。

发展脉络

深度学习的发展并非一帆风顺,而是经历了起伏与爆发:

  1. 早期探索与瓶颈 (1940s-1980s) 提出神经网络雏形与反向传播算法(BP),但受限于当时羸弱的算力和数据量,被 SVM 等传统机器学习方法压制。
  2. 复兴与突破 (2006-2015)
  • 2006年:Geoffrey Hinton 团队提出深度信念网络,标志深度学习复兴。
  • 2012年AlexNet 在 ImageNet 图像分类竞赛中以巨大优势夺冠,引爆了深度学习在计算机视觉领域的狂潮。
  • 2015年:何凯明提出 ResNet(残差网络),解决了网络太深导致梯度消失的问题,让模型可以做到成百上千层。
  1. 全面爆发 (2016 至今)
  • 2016年:AlphaGo 战胜李世石,引爆第三次 AI 浪潮。
  • 2017年:Google 提出 Transformer 架构,奠定大模型基础。
  • 2018年:基于 Transformer 的预训练语言模型(BERT、GPT)问世。
  • 2022年ChatGPT 横空出世,正式开启 AIGC 与大模型时代,人机交互进入新纪元。
扩展:什么是AIGC
AIGC(Artificial Intelligence Generated Content)即人工智能生成内容,即人工智能通过学习大量的数据,来实现自动生成各种内容,如文本、图像、音频、视频等,是继专家生产内容(PGC, Professional Generated Content)、用户生产内容(UGC, User Generated Content)之后的新型内容创作方式。

发展史

主要学习路线

对于想要深入理解大模型底层逻辑的开发者,推荐按照以下路径逐步进阶:

  1. 线性回归 (Linear Regression):一切的基石。先搞懂什么是权重、偏置,以及如何通过“梯度下降”来找最优解。
  2. ANN (人工神经网络):从线性走向非线性。理解多层感知机 (MLP)、激活函数的作用,以及网络是如何通过“反向传播 (BP)”更新参数的。
  3. RNN (循环神经网络):引入“记忆”概念。了解网络是如何处理具有先后顺序的序列数据(如文本、语音)的。
  4. Transformer:当前大模型的绝对核心。理解它是如何用“自注意力机制 (Self-Attention)”取代 RNN,实现高效并行计算并统领 NLP 领域的。

专题概述

ANN(Artificial Neural Network,人工神经网络) 可以看成一组会自动调参数的“非线性函数积木”。它接收输入特征,经过一层层线性变换与激活函数处理,最终输出预测结果。

如果说线性回归只能画一条直线,那么 ANN 的价值就在于:它能通过多层结构 + 非线性激活,拟合更复杂的现实规律。

本专题会按照由浅入深的顺序,逐步搭起 ANN 的知识骨架:

  1. ANN 学习大纲:先建立整体地图,知道这个专题到底要学什么、各个概念之间如何衔接。
  2. 感知机与单神经元:理解神经元、权重、偏置,以及它为什么本质上还是一个函数。
  3. 激活函数:搞清楚为什么网络必须引入非线性,以及 SigmoidTanhReLU 分别解决什么问题。
  4. 多层感知机(MLP):理解多层网络如何组合特征,以及隐藏层到底在“学”什么。
  5. 反向传播与训练闭环:串起正向传播、损失函数、梯度、反向传播和参数更新。

ANN 是进入 CNN、RNN、Transformer 之前必须踩实的地基,建议按顺序逐篇学习。

PyTorch 框架

PyTorch 是目前学术界与工业界最流行的深度学习框架之一。它将数据封装成张量(Tensor)进行处理,并提供灵活高效的工具来构建、训练和部署深度学习模型,尤其以动态计算图和**自动微分(autograd)**闻名。

在掌握 ANN 理论之后,通过 PyTorch 将理论落地为可运行的代码:

  1. 框架简介:认识 PyTorch 的定位、特点、发展历史,并完成安装。
  2. 张量操作:掌握张量的创建、类型转换、数值计算、索引、形状变换与拼接,这是后续一切建模的地基。
  3. 自动微分与模型:理解 autograd 自动求导机制,并结合线性回归完成第一个可训练的模型。

💡 张量是 PyTorch 一切操作的基石,建议在学完 ANN 理论后按上述顺序进入 PyTorch 实战。