惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Microsoft Azure Blog
Microsoft Azure Blog
WordPress大学
WordPress大学
Google DeepMind News
Google DeepMind News
美团技术团队
大猫的无限游戏
大猫的无限游戏
H
Help Net Security
小众软件
小众软件
aimingoo的专栏
aimingoo的专栏
博客园 - 聂微东
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
M
MIT News - Artificial intelligence
酷 壳 – CoolShell
酷 壳 – CoolShell
博客园 - Franky
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
Microsoft Security Blog
Microsoft Security Blog
F
Fortinet All Blogs
A
About on SuperTechFans
Recent Announcements
Recent Announcements
D
Docker
Vercel News
Vercel News
Engineering at Meta
Engineering at Meta
腾讯CDC
Martin Fowler
Martin Fowler
阮一峰的网络日志
阮一峰的网络日志

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
我是这样理解 LoRA 微调的
AI思·享@蓉77 · 2025-08-26 · via 人人都是产品经理

LoRA 微调到底怎么理解?本文将从“为什么是 LoRA”到“LoRA 怎么做”,系统拆解其核心机制、适用场景与工程优势,并结合实际案例,帮助你建立对 LoRA 的清晰认知框架。

接触 AI 的朋友,大多数人可能都听过目前最热门的参数高效微调方法——LoRA。但它到底是怎么回事,你了解吗?这篇文章就来给大家扫扫盲,从原理、流程到适用场景,帮你构建一个扎实、清晰的基础认知。

什么是 LoRA?

LoRA,全称是 Low-Rank Adaptation,是一种高效的模型微调技术。它的主要目标是:在不影响模型性能的前提下,减少训练参数的数量、降低计算和存储成本

传统的微调方法是:直接修改模型的全部参数或大部分参数,这样做虽然能适应新任务,但带来高昂的计算成本和显存占用。

而 LoRA 的做法是:不去直接修改原始模型的大型权重矩阵,LoRA 会为每一个被微调的矩阵引入一对低秩矩阵的补丁(A 和 B),并训练它们,而不修改原始权重。

用更简单的话来说:

把原始大模型比作发动机,LoRA 就是在选定的关键零部件(那些会影响模型行为的矩阵)分别加装一对“小补丁”,这些补丁分别“修正”这些部件的行为,使整体适配任务需求,但不重造整台发动机。

什么是低秩矩阵?

实际秩(r)表示矩阵中线性无关的行或列的最大数量,即矩阵中有多少独立信息。

原始模型矩阵Ma×b)矩阵,其最大可能的秩 L=min⁡(a,b)。

低秩矩阵:当实际秩 r < L 时,说明该矩阵的信息存在冗余,可由少量独立行/列线性组合而来。

示例说明

考虑一个 10×10 的矩阵:

  • 最大秩L=10;
  • 若其秩为r=3,则仅有3条独立信息,其余行/列可由这3条线性组合得出;
  • 故该矩阵为典型的低秩矩阵。

疑问:

你现在是否会好奇 r 怎么设置?继续往下看为你解答👇

LoRA 微调怎么实现的?

整体流程简介

1、选定模型中需要插入 LoRA 的对应的层的矩阵;

2、把这些矩阵分别“补充”一对新的小矩阵(补丁),叫做A和B(维度是[r, d]和[d, r],r 是秩,d 是原始矩阵的层数);

3、保持原始模型不变(即冻结参数);

4、只微调这两个小矩阵 A 和 B;

5、微调后模型 与 原模型合并。

关键流程拆解

一、怎么选:哪些层、哪些矩阵该插 LoRA?

LoRA 并不是在所有模型层里都加,它是有策略地选择目标层和矩阵来插入的。实际使用中有以下规律:

1、优先选择 Q 和 V

  • Q(Query)和V(Value)是Transformer中Attention的核心;
  • 控制了模型对哪些信息更关注;
  • 插在这里,能有效调整模型的注意力行为,对生成文本影响最大;
  • 也是HuggingFace等平台的主流做法。

2、有时插在前馈网络(FeedForward,MLP)部分的线性层

  • 某些任务下,MLP对语义转换有影响;
  • 插入LoRA可以微调语义加工的过程;
  • 但用得比较少,不是标准做法。

3、不要插在 LayerNorm 或 Embedding 上

  • 这些层参数很少,对模型最终输出的影响也不大;
  • 插入LoRA不仅无效,还可能引起梯度不稳定、性能下降。

一句话总结:该插的插,不该动的别动。二、选择好之后干嘛:补丁长啥样?秩怎么选?

假设你在 Transformer 中选择了 Q 和 V 层进行 LoRA 微调,下面以 Q 矩阵为例说明:1、在 Q 矩阵旁添加可训练补丁假设原始 Q 矩阵有维度 512 x 512 ,LoRA 会插入一对补丁矩阵:

这对补丁相乘后生成的 Q补= QAQB具有与原始 Q 矩阵相同的维度 [512, 512]。

QA:维度为 [r, 512]

QB:维度为 [512, r]

2、冻结原始权重,仅训练补丁在训练过程中,原始 Q 矩阵完全被冻结,只有 QA和 QB(也就是补丁矩阵)参与更新。这样做的目的是将微调集中于“调整特定方向”的任务,避免修改整个大矩阵。

3、秩 r 的选择推荐秩 r 是你指定的小维度,对补丁的表达能力与参数数量起决定作用。经验推荐:

  • r越大:补丁的调节能力更强,但计算与参数量也增多;
  • r越小:参数少、效率高,但可能无法充分调动模型行为。

4、训练与测试流程

  • 在训练阶段,模型只更新补丁矩阵QA、QB;

注:r 往往是事先设定的超参数,而非训练时优化的变量。

三、最后怎么合并:补丁叠加到模型的哪里?

LoRA 微调结束后,一般会把补丁和原始模型合并为一个新模型,方便部署。这里的规则是:

只合并你插入过 LoRA 的位置

  • 没插过的地方(比如你没选的矩阵或层)保持不变;
  • 所以,合并后的模型体积稍微变大,但参数结构基本不变;
  • 效果上,相当于你用LoRA完整调好了那几个关键的“螺丝”。

举例:

  • 原模型是512层;
  • 你只对第400层的Q/V做了LoRA;
  • 合并时,也只合并第400层中的Q/V,其它不变;
  • 其余层结构原封不动。

LoRA 适合用在哪些场景?

从前面的整个流程来看,我自己的理解是:

LoRA 微调的核心,是对模型中某些层的某些矩阵做了补丁式的更新,这样可以让模型在保持原有“核心知识”不变的前提下,更好地适配具体任务。

换句话说,LoRA 不是重造模型,而是对部分结构做了轻量调整,让它更“听话”。

所以到这里,我对 LoRA 的理解是:不改知识,只改表达方式。

基于这个特点,我觉得 LoRA 比较适合以下几类场景:

  • 控制模型说话的语气、语法、输出格式;
  • 让模型把原来就知道的内容,用你希望的方式说出来;
  • 固化一些提示词的效果,避免反复试prompt;
  • 快速把通用模型适配到某个特定领域,比如医疗、法律这类风格明确的任务。

但它也有明显的边界,不太适合做这些事:

  • 教模型全新的知识点(模型原本从未接触过的内容);
  • 建立新的因果推理路径或复杂的逻辑链条;
  • 把模型从一个“知道很多”的通用模型,变成一个“真正理解”的专家模型。

总的来说,LoRA 更像是在已有知识之上做“表达方式的微调”,它不会让模型更聪明,但可以让模型说话更稳、更像你想要的样子。

本文由 @AI思·享@蓉77 原创发布于人人都是产品经理。未经作者许可,禁止转载。

题图来自 Unsplash,基于CC0协议。

该文观点仅代表作者本人,人人都是产品经理平台仅提供信息存储空间服务。