来源:市场资讯

(来源:图灵人工智能)

您想知道的人工智能干货,第一时间送达

打开网易新闻 查看精彩图片

在人工智能与机器学习的讨论中,“深度神经网络”几乎成为了一个流行符号。

然而,剥去工程调参与GPU加速的外壳,深度网络的核心数学结构却异常简洁:一个巨大的复合函数。

打开网易新闻 查看精彩图片

理解这一结构,不仅有助于厘清深度学习为何有效,更能揭示其本质瓶颈与设计哲学。

本文将从函数空间与映射的视角,揭示深度网络如何通过层间复合,实现对高维复杂函数的逼近。

文章速览

ARITCLE CONTENTS

PART .01 >>>

网络即函数

PART .02 >>>

层间信息流

PART .03 >>>

深度与宽度

01

网络即函数

从输入到输出的映射

从数学上看,一个前馈深度神经网络本质上是一个复合函数。

将输入向量 通过 层逐次映射,最终输出 。

这一过程可以写为:

其中第 层可以映射为:

  • 为权重矩阵,

  • 为偏置向量

  • 为逐元素非线性激活函数(如 ReLU、sigmoid、tanh)。

打开网易新闻 查看精彩图片

若记 ,则每一层的前向传播可递推为:

最终输出 。则全连接前馈神经网络的参数化映射为:

这就是深度网络的全部数学本质:它不是一个神秘的黑箱,而是一个参数化的、逐层嵌套的函数的函数。

每一层 可以视为一个参数化映射;整个网络则是在这些映射的复合流形上搜索目标函数。

这一观点极具威力:它将网络设计问题转化为:如何选择映射类 以及复合深度 的问题。

打开网易新闻 查看精彩图片

每一个激活函数 的选择,实际上是在引入一种先验的非线性结构。

如果没有激活函数,多层线性复合退化为单层线性映射,即

此时,网络只能表示线性函数,表达能力坍塌。

因此,非线性激活函数的存在,使得复合映射能够逐层构建复杂的决策边界。而复合的本质,则是用简单映射逐次提升表达的复杂度。

02

层间信息流

层间流动的中间特征

如果说神经网络的数学形式是复合函数,那么自然会引出以下问题:在层与层之间,究竟传递了什么信息?

首先,在形式上,定义第 层的激活向量:

序列 构成了输入样本 在网络中的轨迹。 被称为第 层的中间特征表示(或隐层表示)。

该表示包含了两类信息的叠加:一是来源于输入 的信息,经过逐层变换被提炼和抽象;二是被网络参数所决定的变换结构。

打开网易新闻 查看精彩图片

一个好的特征表示应当满足:对于分类任务,不同类别的 应当在某种度量下彼此远离;对于生成任务, 应当落入一个低维流形,便于采样。

深度学习和表示学习的一个重要观点是:深层网络自动从数据中学习出层次化的特征表示。

在图像分类的卷积网络中,底层(靠近输入)的 通常编码边缘、角点等局部几何结构;

中间层的 或 开始响应纹理、简单图案;高层表示则对语义概念——如车轮、眼睛或文字——“选择性激活”。

打开网易新闻 查看精彩图片

这种层次抽象与人类视觉皮层的腹侧通路存在结构性相似,但本质上是经验风险最小化在自然图像分布上的结果,而不是先验设计。

从信息论角度,信息流动遵循“处理—压缩—抽象”的链条。

记输入 ,第 层表示 ,输出 。前向过程可描述为马尔可夫链:

根据数据处理不等式,互信息满足:

打开网易新闻 查看精彩图片

即网络逐层舍弃与任务无关的输入信息( 下降),同时尽量保留与输出相关的信息()。

最优情况是找到一个表示 ,使得 足够小(压缩),而 足够大(相关)。

这就是信息瓶颈原理:深度网络的中间层在“遗忘”与“记忆”之间权衡。

03

深度与宽度

函数逼近论的权衡

在设计神经网络时,主要超参数之一就是深度(层数 )与宽度(层维度 )的分配。

从函数逼近论角度看,深度与宽度可在“参数效率”与“表达复杂度”之间交换。

考虑一个简单情况:连续函数空间中的逼近问题。

经典结论来自神经网络逼近理论:单隐层网络(宽度足够大)可以逼近任意连续函数(万能逼近定理,Universal Approximation Theorem)。

打开网易新闻 查看精彩图片

然而,该定理并未回答需要多少神经元。对于单隐层网络,在某些情况下逼近一个函数所需的宽度(即神经元的数量)可以按指数增长。

换言之,仅靠宽度扩展,参数数量会爆炸。

深度带来的好处是表达的紧凑性。

数学上可以证明:存在一类函数,用深度为 的网络(每层固定宽度)可以以参数数量 表示,而若用深度为 (如 1 或 2)的网络,所需参数数量为 甚至更多。

例如,考虑一个简单函数:

即所有输入分量的乘积。

用单个隐藏层的 ReLU 网络精确表示该函数,隐藏层神经元数量至少随 指数增长;而用深度 的网络,神经元数量仅多项式增长。

打开网易新闻 查看精彩图片

这一现象被称为“深度分离”(depth separation)。

更一般地,对于某些算子的近似(如多项式、三角多项式或某些谱函数),深度网络可以用远少于宽度网络的参数达到相同精度。

但深度并非没有代价!首先,梯度不稳定——即梯度消失或梯度爆炸——是深层网络原始训练中的主要障碍。

其次,优化难度:损失函数在参数空间中通常高度非凸,且具有许多局部极小值与鞍点。

那么实际的权衡是什么?现代深度学习的实践表明,在固定总参数量的约束下,适当地增加深度往往优于单纯增加宽度。

打开网易新闻 查看精彩图片

残差网络(ResNet)通过恒等跳跃连接彻底改变了超深网络(上百层)的训练可能性,验证了深度是表达效率的关键维度。

另一方面,完全抛弃宽度也不可行:每层需要足够的宽度来保持信息的“容量”,避免瓶颈导致的信息丢失。

一个常见的设计原则是:在早期层(输入附近)保持或缓慢增加宽度,在后期层(输出附近)逐渐减小宽度,整体形成“沙漏”或“金字塔”形状。

结语

深度神经网络的本质是若干个函数通过复合映射构成的“函数的函数”。

这一视角为理解特征表示的演化、信息流动的机理以及深度与宽度之间的权衡提供了统一数学框架。

复合结构带来的表达效率,使得深度网络能以可行参数规模逼近高维复杂函数,这是深度神经网络发展的根本原因。