刊首 / 思考 / 技术 / 模型理论与基础

深度学习概述

刊出 2026-09-19飞书更新 2026-09-11约 17 分钟在飞书中编辑 ↗
§

从人脸识别解锁手机,到语音助手听懂指令,再到 AI 绘画与对话大模型,深度学习已经不知不觉地渗透进我们生活的方方面面。它被称为人工智能的“第三次浪潮”,也是过去十年最具变革性的技术之一。那么,深度学习究竟是什么?它为什么能取得如此巨大的成功?

一、什么是深度学习

深度学习是机器学习的一个分支,其核心思想是构建包含多个隐藏层的“深度”神经网络,让计算机从海量数据中自动学习特征与规律。与传统方法依赖人工设计特征不同,深度学习采用“端到端”的方式,直接从原始数据(图像像素、文字、声音波形)中逐层抽象出由低级到高级的表征:低层学习边缘与纹理,中层学习部件与形状,高层学习语义概念。

“深度”二字,指的就是网络层数的多少。层数越多,模型理论上能表达的函数越复杂,也就越有能力拟合数据背后隐藏的规律。

从数学视角看,神经网络本质是一个由参数(权重 WW 与偏置 bb)刻画的复合函数。单个神经元的计算可写为 z=Wx+bz = Wx + b,再经非线性激活函数 a=g(z)a = g(z) 输出;整个网络则是这些基本变换的层层复合。通用逼近定理指出,含足够宽度隐藏层的前馈网络可以逼近任意连续函数——而深度让这种逼近更高效:深层网络可以用更少的参数表达复杂的层次结构。

深度学习最核心的贡献是表示学习(Representation Learning):模型不再依赖人工设计特征(特征工程),而是从原始数据中自动学出多层抽象特征——低层对应边缘、纹理等局部模式,高层对应语义概念。这一特性使其在图像、语音、文本等高维非结构化数据上远超传统方法。

AI / ML / DL 关系图

二、发展历程:三起三落的六十年

深度学习并非新鲜事物,它的历史可以追溯到上世纪中叶,经历了多次高潮与低谷。

时间事件意义
1958 年罗森布拉特提出感知机点燃第一波神经网络热潮
1969 年感知机被证明无法解决“异或”问题第一轮寒冬来临
1986 年反向传播算法被重新推广多层网络训练成为可能
2006 年辛顿提出深度信念网络“深度学习”概念正式诞生
2012 年AlexNet 在 ImageNet 竞赛大幅夺冠掀起人工智能革命
2016 年AlphaGo 战胜李世石深度学习进入大众视野
2017 年Transformer 架构提出开启大模型时代
2022 年ChatGPT 发布生成式人工智能全面爆发

每一次低谷都源于算力、数据或算法的瓶颈;而每一次复兴,都伴随着这三者的突破。

回顾这六十年,深度学习的每一次复兴都离不开三大驱动力的协同:数据(互联网与大规模标注数据集如 ImageNet 的出现)、算力(GPU / TPU 等并行计算设备使大规模矩阵运算成为可能)与算法(反向传播、ReLU 激活、注意力机制、归一化等关键突破)。其中 2012 年 AlexNet 的胜利尤为关键——它证明了在足够数据与算力支持下,深度网络可以碾压精心设计的传统特征方法,促使整个领域从“人工特征工程”转向“自动特征学习”。

深度学习发展历程

三、深度学习如何工作

要理解深度学习,先要理解它的基本单元——神经元。

神经网络结构

1. 神经元与神经网络

一个人工神经元接收多个输入,对它们进行加权求和,再经过一个非线性“激活函数”输出结果。大量神经元分层连接,就构成了神经网络。

激活函数的选择至关重要,它决定了网络的表达能力与训练稳定性:Sigmoid σ(x)=1/(1+ex)\sigma(x)=1/(1+e^{-x}) 输出范围 (0,1),但两端梯度趋于 0,容易造成梯度消失;tanh 输出范围 (-1,1),零中心化优于 Sigmoid,但同样存在饱和区;ReLU max(0,x)\max(0,x) 计算简单、激活稀疏,能有效缓解梯度消失,是隐藏层的默认选择,缺点是负数区域梯度恒为 0(“死亡 ReLU”),可由 Leaky ReLU、ELU 等变体缓解;输出层则常用 Softmax 将 logits 归一化为概率分布,用于多分类。

2. 前向传播

数据从输入层进入网络,逐层计算直到输出层,得到预测结果。这个过程被称为前向传播。

工程实现中,前向传播以矩阵运算形式批量执行:第 ll 层的输出为 a(l)=g(W(l)a(l1)+b(l))a^{(l)} = g(W^{(l)} a^{(l-1)} + b^{(l)}),其中 W(l)W^{(l)} 是权重矩阵。一次处理一批(mini-batch)样本而非单个样本,既能充分利用 GPU 的并行矩阵乘法,又能通过批内梯度的平均获得更稳定的梯度估计,这一策略贯穿几乎所有现代训练流程。

3. 损失函数

模型输出与真实答案之间的差距用损失函数衡量,差距越小,说明模型越“聪明”。

针对不同任务需要选择合适的损失函数:回归任务常用均方误差(MSE) L=1ni(yiy^i)2\displaystyle L = \frac{1}{n}\sum_{i}(y_i - \hat{y}_i)^2;分类任务常用交叉熵(Cross-Entropy) L=iyilogy^iL = -\sum_{i} y_i \log \hat{y}_i,配合输出层 Softmax 使用。交叉熵对概率分布的差异敏感,且与 Softmax 组合时梯度形式简洁,训练收敛通常优于 MSE。此外,训练目标往往还会加入正则化项(如 L2 权重衰减),用于抑制过拟合。

4. 反向传播与梯度下降

训练的核心在于“学习”:根据损失的大小,反向逐层计算每个参数应如何调整,再沿梯度方向更新参数。这个过程反复进行成千上万次,模型的准确率随之逐步提升。

反向传播的本质是链式法则:借助计算图从输出层向输入层逐层累积损失对各参数的梯度。层数加深时,梯度连乘可能指数级放大或缩小,分别导致梯度爆炸梯度消失——这是深层网络早期难以训练的根本原因,现代通过合理初始化(Xavier / He)、BatchNorm、残差连接与 ReLU 族激活共同缓解。

梯度下降的迭代公式为 WWηLW\displaystyle W \leftarrow W - \eta \frac{\partial L}{\partial W},其中学习率 η\eta 是训练中最重要的超参数之一。朴素 SGD 收敛慢且易震荡,业界普遍使用带动量的优化器:Momentum 累积历史梯度方向加速收敛;Adam 进一步结合一阶矩(梯度均值)与二阶矩(梯度平方均值)为每个参数自适应调整学习率,是目前训练深度网络的默认选择。实践中常配合学习率调度(warmup、余弦退火等)逐步降低学习率以精细收敛。

简单来说,深度学习就是一个“试错—反馈—调整”的自动化过程,而让它区别于传统算法的,是海量数据、强大算力与精巧架构的共同支撑。

5. 训练优化与正则化

深度模型参数量巨大,极易在训练集上过拟合。常用正则化手段包括:L1 / L2 正则(对权重大小施加惩罚,L2 即权重衰减);Dropout(训练时按概率随机丢弃神经元,迫使网络学习冗余表征);Batch Normalization(对每层输入做归一化,加速收敛并起到一定正则作用);数据增强(对图像旋转、裁剪、加噪等,扩大有效数据规模)。

规范的训练流程还会将数据划分为训练集、验证集与测试集:验证集用于调参和模型选择(含 early stopping),测试集仅在最终评估时使用一次,避免信息泄露导致的评估虚高。

训练闭环流程

四、主流模型架构

Transformer 架构
  • 卷积神经网络(CNN):通过卷积核提取局部特征,是计算机视觉的基石。
  • 循环神经网络(RNN / LSTM):擅长处理文本、语音等序列数据,曾主导自然语言处理领域。
  • Transformer:基于自注意力机制,支持并行计算,是如今大语言模型与多模态模型的共同底座。
  • 生成模型(GAN、VAE、扩散模型):能够“无中生有”,是 AI 绘画、AI 视频背后的引擎。

卷积神经网络(CNN)

CNN 针对图像的空间结构设计了三种核心操作:卷积用一组可学习的卷积核在特征图上滑动,提取局部模式并共享权重,参数量远小于全连接层;池化(最大池化 / 平均池化)对局部区域降采样,扩大感受野并增强平移不变性;全连接层在末端整合特征输出分类结果。经典网络沿“更深 + 残差”的方向演化:LeNet → AlexNet → VGG(小卷积核堆叠)→ ResNet(残差连接 y=F(x)+xy = F(x) + x 解决深层退化问题)。

循环神经网络(RNN / LSTM)

RNN 通过隐藏状态沿时间步传递信息,天然适合文本、语音等变长序列。但长序列上梯度沿时间反向传播会急剧衰减,导致难以学习长期依赖。LSTM 引入遗忘门、输入门、输出门与细胞状态 CtC_t,用门控机制决定信息的写入、保留与读取,显著缓解了长期依赖问题;GRU 是其简化变体,将三门合并为更新门与重置门。

Transformer

Transformer 的核心是缩放点积自注意力:将输入分别投影为查询 QQ、键 KK、值 VV,计算 Attention(Q,K,V)=softmax(QKdk)V\displaystyle \mathrm{Attention}(Q,K,V)=\mathrm{softmax}(\frac{QK^\top}{\sqrt{d_k}})V,使每个位置可以直接关注序列中的任意位置,从而建模长距离依赖。多头注意力并行学习不同子空间的关联;位置编码(正弦函数或可学习向量)弥补自注意力不感知顺序的缺陷。相比 RNN,Transformer 完全并行计算、训练效率高,成为 GPT、BERT 等大模型的统一底座。

生成模型(GAN / VAE / 扩散模型)

生成模型的目标是学习数据分布并采样新样本。GAN 让生成器与判别器零和博弈,生成器力图骗过判别器,训练不稳定且易模式崩塌;VAE 通过编码器将数据映射到隐空间、解码器重建,用重参数化技巧实现可训练,但生成图像偏模糊;扩散模型 先在前向过程逐步加噪直至变成纯噪声,再训练网络学习反向去噪,以马尔可夫链逐级还原,生成质量高,是当前文生图 / 文生视频(如 Stable Diffusion、Sora)的主流技术。

五、深度学习的应用

深度学习的落地是一个系统工程,通常需要数据(采集、清洗、标注)、模型(选型与训练)、算力(训练与推理基础设施)与业务场景(反馈闭环持续迭代)四要素协同;其中推理阶段的模型压缩(量化、蒸馏、剪枝)与端侧部署日益成为工程重点。

  • 计算机视觉:人脸识别、自动驾驶、医学影像诊断。
  • 自然语言处理:机器翻译、智能客服、对话大模型。
  • 语音技术:语音识别、语音合成、同声传译。
  • 推荐系统:短视频、电商、资讯平台的个性化推荐。
  • 科学研究:AlphaFold 预测蛋白质结构、新材料发现、气象预报。

六、挑战与思考

深度学习在创造奇迹的同时,也面临着不容回避的问题。

技术层面还需关注:分布外泛化——模型在训练分布之外的数据上性能骤降;对抗样本——微小且人眼不可察觉的扰动即可让模型出错,暴露出鲁棒性短板;评估基准饱和——在 ImageNet 等基准上精度逼近上限后,如何设计更难的评测与更细粒度的指标成为新问题。

  • 数据与算力的依赖:大模型训练成本高昂,能源消耗与碳排放引发关注。
  • 可解释性:模型如同“黑箱”,人们难以理解它做出判断的依据。
  • 偏见与公平:训练数据中的偏见可能被模型放大,带来公平性问题。
  • 安全与滥用:深度伪造、虚假信息、提示词攻击等风险日益突出。
  • 幻觉问题:大模型可能“一本正经地胡说八道”,生成看似合理实则错误的内容。

七、展望未来

深度学习既不是无所不能的魔法,也不是即将破裂的泡沫。它是一套仍在快速演进的工具与范式。展望未来,几个方向值得期待:多模态融合让模型“眼耳并用”,具身智能让 AI 走进物理世界,AI for Science 加速科学发现,而端侧小模型则让智能走下云端、走进每个人的设备。

更重要的是,随着技术的发展,如何让深度学习更可靠、更公平、更可控,将成为人类与 AI 共同面对的时代课题。深度学习改变世界的旅程,才刚刚开始。

八、后续专题规划

本文作为《深度学习概述》总纲,先建立整体认知框架;后续将按专题逐一展开深入记录,每个专题包含原理推导、关键公式、代码实现与实验笔记:

  • 专题一:神经网络与反向传播——从数学推导到 NumPy / PyTorch 实现
  • 专题二:卷积神经网络与计算机视觉——卷积 / 池化细节、经典网络复现
  • 专题三:序列模型——RNN、LSTM、GRU 与序列预测实践
  • 专题四:Transformer 与注意力机制——自注意力推导、位置编码、从零实现
  • 专题五:生成模型——GAN、VAE、扩散模型的原理与对比实验
  • 专题六:训练优化与调参——优化器、学习率调度、正则化与超参搜索
  • 专题七:大模型与多模态——预训练、微调、RLHF、多模态对齐
  • 专题八:强化学习与具身智能——策略梯度、DQN、PPO 与智能体

本文同步自飞书云文档,原文修改后将于下次同步时自动刊印。

→ 前往飞书查看 / 评论原文