未来技术的尽头
← 返回文章目录

论文导读 · 计算机视觉 · 2026-09-19

ResNet 导读:学习变化量,而不是从头重写

理解残差连接的基本形式,以及为什么“更深”需要配合更容易优化的结构。

本站绘制:输入 x 沿捷径与 F(x) 相加;仅表示维度相容时的基本残差块。
本站绘制:输入 x 沿捷径与 F(x) 相加;仅表示维度相容时的基本残差块。

先区分表达能力与训练难度

He、Zhang、Ren 与 Sun 在 2015 年的论文中研究深层网络的训练问题。残差学习让若干层学习相对输入的变化量,而不是直接学习完整映射;论文给出了更深残差网络的实验。模型能表示某个函数,并不意味着实际训练过程一定容易找到它。

读懂一条捷径

基本形式可以写为 y = F(x) + x。主分支负责变化量,捷径保留输入;相加要求形状兼容,维度改变时需要相应处理。这个结构有助于优化,但不能据此断言深度可以无限增加,或任何数据集上都一定更好。

本站练习:从一个数开始

把 x 暂时看成数字 10,假设目标输出是 12。直接映射需要给出 12,残差写法则给出变化量 2,再与 10 相加。这个例子只是解释“相对输入的变化”是什么意思;它不是神经网络的训练证明,更不能替代梯度和损失函数的分析。

画图时标出形状

尝试画两个方框:一个是主分支,另一个是旁路。在每条线上写上张量形状。如果主分支把通道数或空间尺寸改了,先暂停,想清楚旁路应怎样与它对齐。这个习惯可以把抽象的“残差连接”变成一个能够逐项检查的实现问题。

如果准备做对比实验

可以先列出需要保持一致的条件:数据划分、训练轮数、优化设置和评价方法。若这些条件同时变化,即使结果不同,也很难判断差异是否来自残差结构。本站未进行此项复现;原文实验应结合其数据集和具体模型设置阅读。

参考与延伸阅读

本文为本站整理的中文导读与学习笔记,非原文转载。示意图由本站绘制。