来源:市场资讯
(来源:图灵人工智能)
您想知道的人工智能干货,第一时间送达
在人工智能与机器学习的讨论中,“深度神经网络”几乎成为了一个流行符号。
然而,剥去工程调参与GPU加速的外壳,深度网络的核心数学结构却异常简洁:一个巨大的复合函数。
理解这一结构,不仅有助于厘清深度学习为何有效,更能揭示其本质瓶颈与设计哲学。
本文将从函数空间与映射的视角,揭示深度网络如何通过层间复合,实现对高维复杂函数的逼近。
文章速览
ARITCLE CONTENTS
PART .01 >>>
网络即函数
PART .02 >>>
层间信息流
PART .03 >>>
深度与宽度
01
网络即函数
从输入到输出的映射
从数学上看,一个前馈深度神经网络本质上是一个复合函数。
将输入向量 通过 层逐次映射,最终输出 。
这一过程可以写为:
其中第 层可以映射为:
为权重矩阵,
为偏置向量,
为逐元素非线性激活函数(如 ReLU、sigmoid、tanh)。
若记 ,则每一层的前向传播可递推为:
最终输出 。则全连接前馈神经网络的参数化映射为:
这就是深度网络的全部数学本质:它不是一个神秘的黑箱,而是一个参数化的、逐层嵌套的函数的函数。
每一层 可以视为一个参数化映射;整个网络则是在这些映射的复合流形上搜索目标函数。
这一观点极具威力:它将网络设计问题转化为:如何选择映射类 以及复合深度 的问题。
每一个激活函数 的选择,实际上是在引入一种先验的非线性结构。
如果没有激活函数,多层线性复合退化为单层线性映射,即
此时,网络只能表示线性函数,表达能力坍塌。
因此,非线性激活函数的存在,使得复合映射能够逐层构建复杂的决策边界。而复合的本质,则是用简单映射逐次提升表达的复杂度。
02
层间信息流
层间流动的中间特征
如果说神经网络的数学形式是复合函数,那么自然会引出以下问题:在层与层之间,究竟传递了什么信息?
首先,在形式上,定义第 层的激活向量:
序列 构成了输入样本 在网络中的轨迹。 被称为第 层的中间特征表示(或隐层表示)。
该表示包含了两类信息的叠加:一是来源于输入 的信息,经过逐层变换被提炼和抽象;二是被网络参数所决定的变换结构。
一个好的特征表示应当满足:对于分类任务,不同类别的 应当在某种度量下彼此远离;对于生成任务, 应当落入一个低维流形,便于采样。
深度学习和表示学习的一个重要观点是:深层网络自动从数据中学习出层次化的特征表示。
在图像分类的卷积网络中,底层(靠近输入)的 通常编码边缘、角点等局部几何结构;
中间层的 或 开始响应纹理、简单图案;高层表示则对语义概念——如车轮、眼睛或文字——“选择性激活”。
这种层次抽象与人类视觉皮层的腹侧通路存在结构性相似,但本质上是经验风险最小化在自然图像分布上的结果,而不是先验设计。
从信息论角度,信息流动遵循“处理—压缩—抽象”的链条。
记输入 ,第 层表示 ,输出 。前向过程可描述为马尔可夫链:
根据数据处理不等式,互信息满足:
即网络逐层舍弃与任务无关的输入信息( 下降),同时尽量保留与输出相关的信息()。
最优情况是找到一个表示 ,使得 足够小(压缩),而 足够大(相关)。
这就是信息瓶颈原理:深度网络的中间层在“遗忘”与“记忆”之间权衡。
03
深度与宽度
函数逼近论的权衡
在设计神经网络时,主要超参数之一就是深度(层数 )与宽度(层维度 )的分配。
从函数逼近论角度看,深度与宽度可在“参数效率”与“表达复杂度”之间交换。
考虑一个简单情况:连续函数空间中的逼近问题。
经典结论来自神经网络逼近理论:单隐层网络(宽度足够大)可以逼近任意连续函数(万能逼近定理,Universal Approximation Theorem)。
然而,该定理并未回答需要多少神经元。对于单隐层网络,在某些情况下逼近一个函数所需的宽度(即神经元的数量)可以按指数增长。
换言之,仅靠宽度扩展,参数数量会爆炸。
深度带来的好处是表达的紧凑性。
数学上可以证明:存在一类函数,用深度为 的网络(每层固定宽度)可以以参数数量 表示,而若用深度为 (如 1 或 2)的网络,所需参数数量为 甚至更多。
例如,考虑一个简单函数:
即所有输入分量的乘积。
用单个隐藏层的 ReLU 网络精确表示该函数,隐藏层神经元数量至少随 指数增长;而用深度 的网络,神经元数量仅多项式增长。
这一现象被称为“深度分离”(depth separation)。
更一般地,对于某些算子的近似(如多项式、三角多项式或某些谱函数),深度网络可以用远少于宽度网络的参数达到相同精度。
但深度并非没有代价!首先,梯度不稳定——即梯度消失或梯度爆炸——是深层网络原始训练中的主要障碍。
其次,优化难度:损失函数在参数空间中通常高度非凸,且具有许多局部极小值与鞍点。
那么实际的权衡是什么?现代深度学习的实践表明,在固定总参数量的约束下,适当地增加深度往往优于单纯增加宽度。
残差网络(ResNet)通过恒等跳跃连接彻底改变了超深网络(上百层)的训练可能性,验证了深度是表达效率的关键维度。
另一方面,完全抛弃宽度也不可行:每层需要足够的宽度来保持信息的“容量”,避免瓶颈导致的信息丢失。
一个常见的设计原则是:在早期层(输入附近)保持或缓慢增加宽度,在后期层(输出附近)逐渐减小宽度,整体形成“沙漏”或“金字塔”形状。
结语
深度神经网络的本质是若干个函数通过复合映射构成的“函数的函数”。
这一视角为理解特征表示的演化、信息流动的机理以及深度与宽度之间的权衡提供了统一数学框架。
复合结构带来的表达效率,使得深度网络能以可行参数规模逼近高维复杂函数,这是深度神经网络发展的根本原因。
热门跟贴