news 2026/10/1 14:22:43

全参微调要 780G 显存,LoRA 只动 0.1% 的参数就敢叫“微调“?——低秩适配一次讲透

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
全参微调要 780G 显存,LoRA 只动 0.1% 的参数就敢叫“微调“?——低秩适配一次讲透

你有个大模型,想在"你的业务"上再训一训,让它懂你的黑话、你的格式、你的脾气。

最"老实"的办法是全参数微调(Full Fine-tuning):把模型所有参数都当作可训练,在你这点数据上再跑一遍。结果你一算显存——光一个 70B 的模型,全参微调就要约 780G 显存(模型 + 优化器状态 + 梯度,一套 Adam 下来是参数的十几倍)。

别说个人了,一般公司的机器都扛不住。

但另一边,又有人拿着几百块的显卡,说自己"微调"了大模型,效果还不错。他们靠的是一样东西,叫LoRA(Low-Rank Adaptation,低秩适配)。

它最狂的地方在于:只训练原模型 0.1% 甚至更少的参数,就能达到接近全参微调的效果。凭什么呢?

先接受一个反直觉的事实:权重更新,很"瘦"

LoRA 的理论起点,是一个叫**低秩(low-rank)**的假设。

大模型微调前后的权重变化量,记作ΔW。LoRA 的核心假设是:这个ΔW虽然是满形状的大矩阵,但它的"信息量"是低秩的——也就是说,它可以被分解成两个小矩阵的乘积:

ΔW = B × A

其中W是d × d的大矩阵,A是r × d,B是d × r,而秩r远小于d。

举个具体数字感受一下:假设d = 4096,ΔW有4096 × 4096 ≈ 1677 万个参数。取r = 16,那么A + B一共只有4096 × 16 × 2 ≈ 13 万个参数。

1677 万 → 13 万,缩了 128 倍。这就是"只动一点点参数"的底气。

为什么"只训 A 和 B"就够?

训练的时候,LoRA 把原模型的权重W冻结(不更新,不计算它的梯度),只在旁边挂一个B × A,微调时只更新A和B。推理时再把它合并回去:

W' = W + B × A

为什么这样做能work?直觉是这样的:大模型经过预训练,已经"知道"了海量的通用知识,W里已经躺着近乎所有需要的信息。微调要做的,往往不是"重新学一遍",而是"在某个方向上小小地调整一下"。而这个"小调整",天然就是低秩的——你不需要把 1677 万个权重都动一遍,动 13 万个,就足以改变模型的行为方向。

省的不只是参数,是钱

LoRA 的收益是全方位的:

全参微调LoRA
可训练参数100%通常 0.1% ~ 1%
显存占用巨大(十几倍参数)极小
训练速度慢快得多
产物一整个新模型一个小小的 LoRA 权重
切换任务重新存一整套换个 LoRA 权重就行

最后两行特别值钱:一个基座模型 + 一堆小小的 LoRA 权重,就相当于"一个底子,无数个分身"。今天做摘要挂一个,明天做客服挂另一个,切换成本几乎为零。

也正因为"省资源",LoRA 常和另一个省资源的技术——量化——配合使用:先用量化把模型压小,再挂 LoRA 微调,普通人也能在单卡上玩起来(为什么大模型从 14G 缩到 4G,还能照样"聪明"?——量化,一次讲透)。

LoRA 教会我们的,不只是技术

LoRA 背后那条"低秩假设",其实挺反直觉的:我们总以为"要改就得全改",但真相往往是——真正需要动的,只是冰山一角。

大到模型微调,小到改一段代码、修一个习惯,都是同一个道理:别一上来就推倒重来,先想想,是不是只要动那 0.1% 的关键处就够了。

当然,LoRA 也不是终点。它之后又冒出了 QLoRA(进一步量化)、DoRA、AdaLoRA 等等,方向都是同一个:用更少的资源,换更接近全参微调的效果。大模型越来越大的时代,"如何便宜地适配"会一直是门显学——下一个比 LoRA 更狠的省法是什么,谁知道呢,但肯定不会太久。

想搞懂 LoRA 里"低秩分解、矩阵秩"这些数学前提,推荐 B站【408实验室】的《机器学习数学基础》补齐底子。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/1 14:21:47

OpenAI DevDay 2026 三连击:Astra 因安全撤回、GPT-6.1 Sol 1/5 价格顶上、dots 全天候智能体上线——企业 AI 架构的三个信号

OpenAI DevDay 2026 三连击:Astra 因安全撤回、GPT-6.1 Sol 1/5 价格顶上、dots 全天候智能体上线——企业 AI 架构的三个信号核心结论:9 月 29 日 OpenAI DevDay 2026,OpenAI 干了一件史无前例的事——旗舰模型 GPT-6.1 Astra 因未通过内部安…

作者头像 李华
网站建设 2026/10/1 14:20:52

深圳机场加急空运、航空货运流程与禁运货物一站式服务商

深圳机场加急空运怎么办理最快?航空货运的完整流程是什么?哪些货物属于禁运范围不能走空运?这三个问题是发货企业和个人咨询航空货运时最常见的疑问。深圳市航宇顺物流有限公司作为深耕珠三角17年的老牌空运公司,围绕这三个高频问题,为大家做一次系统…

作者头像 李华
网站建设 2026/10/1 14:19:46

策略需求文档怎么写?产品经理六段式写法与评审避坑指南

简介:策略产品经理基础知识系列中关于策略需求文档编写的DOCX文档,面向策略产品经理、产品新人及希望系统掌握需求文档写作方法的从业者。文档完整拆解了策略需求文档的核心结构——项目背景、项目目标、需求概述、需求详述、统计与监控需求五大模块&…

作者头像 李华
网站建设 2026/10/1 14:19:23

GitHub 仓库完全指南:从入门到精通的全流程操作手册

1. 引言 GitHub 是全球最大的代码托管平台,也是开发者协作与开源生态的核心枢纽。无论你是刚接触编程的新手,还是希望系统化提升协作效率的资深工程师,掌握 GitHub 仓库的创建、管理与操作流程都是必备技能。读完本文并动手实践,…

作者头像 李华