FEATURED · 精选文章

大模型基础:AdaLoRA,为什么每一层不该用一样大的秩

发布时间 / 2026/8/18 9:31:01
来源 / 创域科博编辑部
栏目 / 资讯中心
大模型基础:AdaLoRA,为什么每一层不该用一样大的秩 ① 标准 LoRA 的粗糙之处一刀切的秩Transformer 里有很多不同的权重矩阵——每一层的 Attention 里有 Q、K、V、输出投影FFN 里还有两层线性变换。标准 LoRA 给所有这些矩阵都配上同一个秩r比如统一设成 8。但对当前这个任务来说不同矩阵的重要程度天差地别有的矩阵稍微调一调就能带来很大提升有的矩阵调不调几乎没区别。统一的 r 意味着——重要的矩阵可能秩不够用不重要的矩阵却在浪费参数预算。参数预算指的就是这次微调总共愿意花的参数量上限也就是所有矩阵的秩加起来的总数。② AdaLoRA 的做法先给足预算训练中再裁AdaLoRA 不再用 B×A 的形式而是借用矩阵分解里的 **SVD奇异值分解**结构来表示 ΔWΔW P × Λ × QΛ是一个对角矩阵对角线上每个数就是一个奇异值可以理解成每一个秩分量各自的重要程度——这个数越大代表它承载的信息越多。P d_out×4 × 9.1 7.4 2.1 0.8 0 0 0 0 0 0 0 0 0 0 0 0 Λ4×4只有对角线有数 × Q 4×d_in ΔW d_out×d_in图里 Λ 的对角线上就是 9.1、7.4、2.1、0.8 这四个数后面举例子会用到其余格子全是 0——一个 4×4 的矩阵16 个位置里只有对角线上 4 个数在真正起作用。P、Q 两边负责把这几个数铺回原来权重矩阵的形状可以简单理解成P 和 Q 管方向Λ 管每个方向的强度。训练一开始每个矩阵都先给一个比较大的秩预算给足。训练中后期AdaLoRA 会定期给每个奇异值算一个重要性分数大致看这个奇异值本身大小以及它对 loss 的影响把分数最低的奇异值逐步裁剪掉压到 0慢慢裁到总参数量达到预算目标为止——不是一上来就猛裁。裁剪不是均匀地裁——重要的矩阵它的高分奇异值多能留下的秩自然就多不重要的矩阵奇异值大多分数很低很快就被裁得所剩无几甚至裁到 0相当于这个矩阵干脆不参与微调了。③ 举个例子感受一下分配结果假设只有两个矩阵Attention 的 Q 矩阵和 FFN 里的一层起始秩都是 4各有 4 个奇异值。总预算设定为裁到只剩 4 个相当于两个矩阵平均秩为 2每个奇异值算出来的重要性分数分别是矩阵AQ的4个奇异值分数9.1, 7.4, 2.1, 0.8 矩阵BFFN的4个奇异值分数3.2, 1.5, 0.9, 0.3关键一步裁剪不是每个矩阵各留2个而是把两个矩阵的全部 8 个分数按全局高低放在一起排序只留全局最高的 4 个从高到低排序 9.1(A)✓ 7.4(A)✓ 3.2(B)✓ 2.1(A)✓ | 1.5(B)✗ 0.9(B)✗ 0.8(A)✗ 0.3(B)✗ ✓ 保留排进全局前4名 ✗ 裁掉 保留A的3个9.1、7.4、2.1 B的1个3.2 矩阵A最终秩 3 矩阵B最终秩 18 个奇异值的重要性分数全局只留前 4 个 保留线 9.1 7.4 2.1 0.8 矩阵AQ— 最终秩3 3.2 1.5 0.9 0.3 矩阵BFFN— 最终秩1图中蓝色柱子是留下的灰色是被裁掉的。矩阵A的分数普遍更高四个里有三个都排进了全局前四矩阵B只有一个分数够格。同样都从秩4出发最后一个留了3一个只留1——这就是预算按重要性动态分配的意思。同样的参数预算标准 LoRA 是每个矩阵都发 2 份4÷2个矩阵AdaLoRA 是训练完再看谁真正用得上重新分配——总量没变但花得更聪明。④ LoRA vs AdaLoRALoRAAdaLoRA增量表示ΔW B×AΔW P×Λ×Q类SVD各层的秩全部固定为同一个 r按重要性动态裁剪各不相同决策方式训练前人工设定训练中自动调整代价简单但可能错配要算重要性分数训练更复杂⑤ 补充说明AdaLoRA 跟 Adam 优化器不是一回事两个名字都带AdaAdaptive自适应容易联想到一起但管的是完全不同层面的问题Adam 优化器管的是训练时每一步参数怎么更新AdaLoRA 管的是微调时参数预算怎么分配给不同矩阵。不过两者背后其实是同一个思路Adam 给每个参数单独算一个自适应的学习率本质上也是每个方向独立缩放、互不干扰——跟本文②节 Λ 的对角矩阵是同一套逻辑只是 Adam 用来调步长AdaLoRA 用来调秩。回到开头标准 LoRA 给每一层发一样多的预算是因为训练前没人知道哪一层更重要。AdaLoRA 的思路是先按 SVD 形式把每份预算的重要程度暴露出来训练中动态裁掉不重要的部分——参数总量不变但花的地方更值这就是为什么每一层不该用一样大的秩。是不是 so easy。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻