未来技术的尽头
← 返回文章目录

论文导读 · 模型适配 · 2026-09-19

LoRA 导读:用小矩阵表示参数更新

冻结原有权重,只训练低秩增量:从矩阵尺寸看清它节省了什么。

本站绘制:冻结权重 W 与可训练低秩分支 BA,省略缩放系数等实现细节。
本站绘制:冻结权重 W 与可训练低秩分支 BA,省略缩放系数等实现细节。

问题从更新成本开始

Hu 等人在 2021 年提交的 LoRA 论文提出:冻结预训练权重,在选定层中加入可训练的低秩分解来适配任务。其核心可以概括为 W 的更新量由两个较小矩阵的乘积表示。这里减少的是可训练参数,不等于整个基础模型不再占用内存。

看一次矩阵尺寸

若 W 为 d×k,可用 B(d×r)与 A(r×k)的乘积表示增量,r 通常远小于 d 与 k。增量参数量是 r(d+k)。这种受约束的更新是否足够,仍取决于任务、选择的层与训练设置;不能把某次实验的收益当作普遍保证。

本站算例:把抽象符号换成数字

取 d=k=1000、r=8,完整矩阵有 100 万个元素,而两个增量矩阵共有 16000 个元素。这个算例只比较参数个数,没有计算激活、优化器状态和其他组件,因此不能直接转成显存节约比例。练习时可把 r 改成 16,再算一次。

建立一次适配的记录表

建议为每次实验保留基础模型版本、训练数据范围、目标层、秩、学习率和评价样本说明。尤其要把用于检查效果的样本与训练样本区分开,否则模型记住了内容,也可能被误认为获得了更好的泛化能力。此处是阅读后的实验整理建议,并非本站实测结果。

继续阅读原文的顺序

先确认方法中的冻结与可训练部分,再阅读论文如何选择比较对象,最后看局限和不同设置的实验。本站提供的是入门导读与算例,没有托管模型权重,也没有复现论文结果。需要使用具体代码时,还应核对所用实现与论文公式的对应关系。

参考与延伸阅读

本文为本站整理的中文导读与学习笔记,非原文转载。示意图由本站绘制。