笔记
0工具
0此页用于记录用户反馈问题后的每一次改进
关于
“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。
md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。
要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。
在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。
要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。
工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。
写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。
适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。
不想公开、只想临时给人看:点“分享”生成一条带密码和有效期的链接,到期自动失效,你也能随时撤销。
你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。
全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。
这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。
不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。
产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。
如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。
趋势
GeoRA: 为RLVR设计的LoRA——ACL 2026杰出论文解析
先说结论:这篇论文拿了 ACL 2026 的 Outstanding Paper,核心是给 RLVR(Reinforcement Learning with Verifiable Rewards)专门设计了一种低秩适配方法,叫 GeoRA。它的出发点很朴素:LoRA 那一套是为 SFT 设计的,直接搬到 RLVR 上,几何不对,效果就拉胯。GeoRA 的思路是先定位 RLVR 真正想更新的稀疏子空间,再用 SVD 把它压成低秩稠密适配器,这样既保留了低秩训练的计算优势,又对齐了 RLVR 的更新规律。
我读完之后最大的感受是:这个工作不是从零发明了一个新机制,而是把 RLVR 的优化几何这个已经被机制研究揭示的规律,第一次系统性地用在了 PEFT 方法设计上。而且论文里的实验做得很扎实,从 1.5B 到 32B 的模型,数学、医学、代码三个领域都验证了。更难得的是,美团团队把方法用在了实际的 AI 骑手招聘场景里,这种从业务问题出发的研究路径,我觉得比纯刷 benchmark 有价值得多。
下面我把这篇论文的技术细节完整拆解一遍,包括背景洞察、方法构造、实验验证和业务落地经验,尽量把来龙去脉讲清楚。
01 背景:为什么 SFT 的 LoRA 先验在 RLVR 上不好使
要理解 GeoRA 在解决什么问题,得先搞清楚 RLVR 和 SFT 在优化几何上的本质差异。这个差异不是拍脑袋想出来的,是最近一系列机制分析工作用实验和理论逐步勾勒出来的。
1.1 RLVR 的优化几何长什么样
先说 SFT。SFT 的本质是最大似然估计,它要做的就是把训练数据里的新信息显式地写进模型权重里。这意味着 SFT 的更新会倾向于改变权重的主方向——也就是预训练权重里奇异值最大的那些分量。你可以把预训练权重想象成一个已经成型的地形,SFT 是在这个地形上直接挖新的河道,而且挖的方向往往和原有主河道方向一致,因为这样才能高效地改变模型的输出分布。
RLVR 则完全不同。RLVR 不直接告诉模型“你应该输出什么”,而是给一堆候选输出打分,然后让模型自己去发现什么样的行为模式能拿到高奖励。这个过程更像一次受约束的优化:模型在已有的行为分布附近做探索,靠奖励信号诱导采样偏置,逐步放大那些能带来高奖励的推理路径。
机制分析工作给出的画像非常清晰:
- 有效更新分散在稀疏的子空间中。RLVR 的梯度信号不像 SFT 那样集中在一个明确的方向上,而是零零散散地分布在很多维度上,但每个维度上的幅度都不大。这意味着真正需要更新的参数只占一小部分,大部分参数在 RLVR 过程中几乎不动。
- 更新倾向于避开预训练权重的主方向。这一点很有意思。预训练权重的主方向承载了模型已经学会的通用能力,RLVR 如果去动这些方向,很容易破坏掉模型原有的推理能力。所以 RLVR 的优化过程会自发地绕开这些高曲率区域,把更新放在那些“不太重要”的方向上。
- 对更新稳定性极其敏感。RLVR 的策略更新需要在类信赖域(trust region)边界内进行。如果更新步子迈得太大,或者落在了主方向上,就会引发谱漂移(spectral shift)、探索多样性坍塌,甚至直接训练崩溃。这也是为什么 RLVR 训练里经常要加 KL 散度约束——它本质上是在限制策略更新的幅度。
1.2 现有 PEFT 方法的两个错位
理解了 RLVR 的优化几何,再看现有的低秩方法,问题就一目了然了。
几何错位。LoRA 及其变体几乎都是在 SFT 场景下设计和验证的,它们各自带着不同的谱先验,但这些先验没有一个考虑过 RLVR 的更新规律:
- LoRA 用高斯初始化 A 矩阵,B 矩阵全零初始化。这个初始化方式完全和预训练权重无关,相当于在权重空间里随机撒点,然后让优化器自己找路。在 SFT 里这没问题,因为 SFT 的梯度信号强且集中;但在 RLVR 里,这种随机初始化意味着优化器要从一个和 RLVR 偏好子空间毫无关系的起点出发,训练效率和稳定性都堪忧。
- PiSSA 对原始权重做 SVD,把可训练预算全部分配给主奇异方向。这个先验在 SFT 场景下是合理的——SFT 需要改主方向来注入新信息。但到了 RLVR 这里就反了:RLVR 恰恰要避开主方向,PiSSA 却强行把更新推到主成分上,这等于和 RLVR 的优化几何对着干。论文实验里 PiSSA 在 RLVR 下更容易崩溃,就是这个原因。
- MiLoRA 取尾部奇异方向。这个思路比 PiSSA 更接近 RLVR 的偏好,因为尾部方向确实不是主方向。但它只考虑了谱先验,忽略了 RLVR 更新分散在稀疏子空间这个特性,而且尾部方向往往包含大量噪声,不一定是最适合 RLVR 更新的区域。
工程错位。有人可能会说:既然 RLVR 只更新一小部分参数,那直接对这个子空间做稀疏微调不就行了?这个想法在更新模式上确实契合 RLVR 的偏好,但问题在于现代 GPU 对非结构化稀疏计算并不友好。稀疏矩阵的运算需要特殊的存储格式和访存模式,GPU 的 SIMT 架构天生适合稠密矩阵的并行计算,遇到稀疏数据反而会因为线程发散和内存访问不连续而效率大降。
论文里的效率实验很直观地说明了这个问题:稀疏微调(SparseFT)把可训练参数降低了 68.0%,但训练耗时反而增加了 10.8%。也就是说,参数少了,速度反而慢了。这在工程上是完全不可接受的——我们做高效微调,就是为了省时间省显存,不是单纯为了参数少。
1.3 GeoRA 的目标
一边是计算友好但几何不对(LoRA 及其变体),一边是几何对但算不快(稀疏微调)。GeoRA 要同时解决这两个错位。
它的目标可以概括成一句话:定位契合 RLVR 的稀疏子空间,然后用低秩稠密的方式去训练它。这样既保留了低秩训练的计算优势(稠密矩阵运算,GPU 友好),又让更新方向对齐了 RLVR 的优化几何(避开主方向,聚焦稀疏子空间)。
02 方法:GeoRA 的构造
GeoRA 的完整流程可以拆成三个步骤,整个过程只在训练开始前执行一次,属于一次性预处理。训练阶段的计算图和标准 LoRA 完全一致,没有任何额外开销。
2.1 构造几何子空间
第一步是从预训练权重矩阵 W 中筛选出 RLVR 偏好的参数区域。这里用了两个互补的掩码(Mask),两者共用同一个稀疏率 ρ。
谱先验 M_Spec(强调稳定性)。这个掩码的操作是:先对 W 做秩为 r 的低秩近似得到 Ŵ_r,然后选出 Ŵ_r 中幅值最小的 ρ 比例的位置。
为什么要这么做?这里的关键直觉是:主成分中的高幅值分量对应的是高曲率区域。在优化几何里,高曲率意味着这些方向的 loss landscape 很陡峭,改动它们会显著改变模型的输出行为,容易破坏预训练结构。RLVR 对稳定性敏感,所以我们要把更新限制在低幅值区域——这些区域曲率低,改动起来对模型整体行为的影响小,有利于谱稳定性。
欧氏先验 M_Euc(强调可塑性)。这个掩码更直接:直接在原始权重 W 上选出幅值最小的 ρ 比例的位置。
直觉是:这些接近零的参数在预训练过程中被“用得少”,可调整空间大。就像一个团队里平时不怎么干活的人,突然被安排新任务,他的可塑性比那些已经满负荷运转的核心成员要强得多。为 RLVR 保留这些自由度,可以让优化器有足够的空间去探索新的推理模式。
取并集。最终的几何约束矩阵是两者的并集:
W_Geo = W ⊙ (M_Spec ∪ M_Euc)
这里有一个非常有意思的细节:两个掩码看起来规则相似,但实际选出的参数集合却很少重叠。论文里给了具体数据:在 Qwen3-8B 上取 ρ = 0.2,两个掩码各选中 20.0% 的参数,但交集只有 4.55%,Jaccard 相似度仅 0.128。
这说明什么?说明谱先验和欧氏先验捕捉的是两类不同的参数区域,它们不是冗余关系,而是互补关系。谱先验关注的是低曲率区域(从低秩近似角度看的低幅值),欧氏先验关注的是低幅值区域(从原始权重角度看的低幅值)。这两个标准选出来的参数集合天然不同,取并集才能完整覆盖 RLVR 偏好的更新空间。论文里的消融实验也印证了这一点:去掉任何一个先验都会带来性能下降。
2.2 低秩近似构造适配器
拿到 W_Geo 之后,对它做 SVD:
W_Geo = U_Geo Σ_Geo V_Geoᵀ
然后取前 r 个奇异分量来初始化两个低秩矩阵:
A_Geo = Σ_Geo[:r,:r]^(1/2) · V_Geo[:,:r]ᵀ
B_Geo = U_Geo[:,:r] · Σ_Geo[:r,:r]^(1/2)
这样构造出来的 B_Geo A_Geo 就是 W_Geo 的最优秩-r 近似。这里依赖的是 Eckart–Young 定理,它保证了在 Frobenius 范数意义下,截断 SVD 给出的低秩近似是最优的。
这里有一个容易被忽略但极其关键的要点:GeoRA 取的是 W_Geo 的 top-r 方向,而不是原始权重 W 的 top-r。适配对象的变化,是 GeoRA 与 PiSSA / MiLoRA 的核心区别。
PiSSA 看的是 W 的主方向,MiLoRA 看的是 W 的尾方向,它们都在原始权重 W 上做文章。而 GeoRA 先通过几何掩码把 W 变成了 W_Geo——一个已经过滤掉主方向干扰、聚焦于 RLVR 偏好区域的矩阵——再在这个新矩阵上取主方向。这样取出来的方向,既不是 W 的主方向(已经被掩码去掉了),也不是 W 的尾方向(那是噪声),而是 W_Geo 这个“RLVR 偏好空间”里的主要变化方向。
从这个角度看,四种方法的区别可以概括成一句话:
LoRA 不看权重,PiSSA 看主方向,MiLoRA 看尾方向,GeoRA 先换一个更合适的适配对象,再在其中取主方向。
2.3 建立残差锚点
最后一步是把剩余权重冻结。按照 LoRA 的缩放约定计算残差矩阵:
W_res = W − (α / r) · B_Geo A_Geo
前向传播时,W_res 冻结,只有适配器可训练:
h = W_res x + (α / r) · B_Geo A_Geo x
这个设计带来两个重要性质。
性质一:初始化时函数不变。因为 W_res + (α/r) · B_Geo A_Geo = W,所以训练启动时模型的输出和预训练模型完全一致,不会出现突变。这对 RLVR 非常重要——初期的输出扰动会污染 rollout 采样分布,如果模型一开始的输出就和预训练差异很大,策略优化的起点就是歪的,后面的训练都会受影响。
性质二:施加了结构约束。优化器只能在 A_Geo、B_Geo 参数化的流形上更新,W_res 作为稳定锚点被冻结。这意味着预训练表示不会被破坏——即使适配器学到了新的推理模式,残差权重始终提供原始的预训练能力作为底衬。这有点像给 RLVR 加了一个隐式的正则化,防止优化过程偏离预训练结构太远。
03 实验验证
论文的主实验在 DeepMath-103K 上用 GRPO 算法对 Qwen3-8B 和 Llama-3.1-8B 做数学 RLVR,对比对象包括 LoRA、PiSSA、MiLoRA、SparseFT(稀疏微调)和 FullFT(全参微调)。同时在 4B 和 1.5B 模型上用 GSM8K 做了规模验证。
3.1 数学推理与分布外能力
分布内(ID)的数学基准上,GeoRA 在两个骨干模型上都取得了最强的整体表现。尤其值得注意的是,在竞赛难度的基准上,GeoRA 对低秩基线的领先非常一致——Qwen3-8B 的 AIME24 达到 23.75%,甚至略高于全参微调。
但分布外(OOD)的结果更值得关注。全参微调在 IFEval、TruthfulQA 上都出现了明显回退,而 GeoRA 基本无损,HumanEval 反而从 76.83 提升到 82.93。
这个结果说明了一个重要事实:在几何对齐的子空间更新,可以在提升目标域推理能力的同时,显著减少对既有能力的遗忘。全参微调的问题在于它更新了所有权重,包括那些承载通用能力的主方向,导致灾难性遗忘。而 GeoRA 从一开始就把更新限制在 RLVR 偏好的稀疏子空间里,这些区域和通用能力的主方向重叠很少,所以既学到了推理新技能,又不破坏已有能力。
3.2 医学与代码领域
为了确认收益不局限于数学,论文在医学和代码场景做了扩展实验。两个领域的结论一致:GeoRA 稳定优于低秩基线,并与全参微调相当。
这很重要,因为数学、医学、代码三个领域的 RLVR 任务特性差异很大:数学推理的验证信号非常明确(答案对错),医学任务的奖励设计更复杂(要考虑诊断准确性、治疗方案合理性),代码任务的验证则介于两者之间(编译通过 + 测试用例)。GeoRA 在三个领域都表现稳定,说明它的几何先验不是针对某个特定任务的过拟合,而是抓住了 RLVR 的通用规律。
3.3 收敛效率与稳定性
收敛效率方面,GeoRA 全程保持领先,并且达到高位性能的时间点显著早于其他低秩基线。这意味着在实际训练中,用 GeoRA 可以更早地停止训练,节省计算资源。
超参鲁棒性方面,论文以学习率为例做了实验:GeoRA 在很宽的区间内都维持高奖励,而其他方法在大学习率下明显下滑。这在实践中非常重要——RLVR 的超参调优本来就比 SFT 困难,如果方法对学习率敏感,那使用成本会非常高。GeoRA 的鲁棒性意味着实践者不需要精心调参就能获得稳定效果。
3.4 计算效率
相比全参微调,GeoRA 使可训练参数降低 99.5%,单步耗时降低 19.9%,显存占用降低 28.5%。
对照 SparseFT 的数据可以看得更清楚:SparseFT 虽然把参数降了 68.0%,但单步耗时反而上升了 10.8%。这说明参数效率不等于计算效率——非结构化稀疏在 GPU 上反而更慢。
GeoRA 的关键工程价值,就在于把几何先验落成了稠密低秩计算。虽然它只训练 0.5% 的参数(99.5% 的参数被冻结),但这些可训练参数是以稠密矩阵的形式参与计算的,GPU 的并行能力得到了充分利用,因此参数效率真正转化为了速度与显存收益。
3.5 低秩结构分析
论文还进一步做了结构性分析,回答了一个关键问题:W_Geo 是一个稀疏矩阵,把它压缩成秩 r 的形式,为什么损失是可控的?
这里有三组分析:
第一组:稀疏本身不带来低秩性。作为对照,论文构造了两个不同稠密度的随机噪声矩阵。两者的奇异值谱几乎重叠,都呈现相对平缓的衰减。这说明稀疏本身依然是近似各向同性的,没有可利用的主方向。换句话说,你不能说“因为矩阵是稀疏的,所以它天然低秩”——稀疏和低秩是两个独立的概念。
第二组:W_Geo 具有低秩特性。论文展示了 W_Geo 的谱形与预训练权重类似,大部分谱能量集中在少数前导分量上。这说明被选中的区域继承了预训练权重结构化、可压缩的低秩形态。预训练权重本身就不是各向同性的,它有清晰的谱结构,通过几何掩码筛选出来的子矩阵也保留了这种结构。
第三组:全参 RLVR 的实际更新也是低秩的。论文直接检验了 ΔW = W_FullFT − W_Pretrain,发现它也呈现出高度可压缩的重尾谱。这意味着 RLVR 的更新过程本身就在一个低秩子空间里进行,全参微调其实浪费了大量参数在更新那些几乎不需要动的方向。
三组分析合起来给出了 GeoRA 的结构依据:低秩特性是 RLVR 具备的内在属性。这也解释了为什么 GeoRA 只训练 0.5% 的参数就能与全参微调效果相当——它逼近的正是 RLVR 更新本身的形态。全参微调在数学上是完备的,但 RLVR 的更新形态天然低秩,所以低秩适配器有足够的容量去拟合。
04 业务应用
GeoRA 这个工作的出发点不是发论文,而是实际业务中对高效强化学习的需求。美团履约团队所处的场景是 AI 骑手招聘:由 Agent 主动触达和跟进候选人,在多轮沟通中识别其意愿、顾虑与决策卡点,针对性地制定下一步策略,进而把候选人逐步推进到面试和入职。
这个过程需要类似于销售的情商、策略、话术和临场应变,但目标和结果却明确、可验证(约面/入职/ROI),非常适合用 RLVR 来优化。这个垂直域场景有一个特别的训练需求组合:
- 基模大、上下文长。这个 Agent 对基础智能和长程能力要求较高,需要建立在大尺寸基模之上,且单条轨迹的上下文很长,强化学习的资源开销可观。
- 增量能力规模不大。垂直域需要额外构建的知识和能力规模通常不大,训练数据量远小于基模,低秩适配的容量基本足够承载。
一边是训练开销高,一边是增量容量小,这正是面向 RLVR 的低秩高效训练的用武之地。
事实上,让团队最早怀疑“为 SFT 设计的低秩先验未必适合 RLVR”的,也是业务训练中的体感:LoRA、PiSSA、MiLoRA 之间效果差异明显,学习率调大训练就不稳甚至崩掉。这说明初始化的几何先验在 RLVR 下是一个大变量,存在优化空间。
目前 GeoRA 在 AI 招聘场景中的 Agentic RL 实验结果:
- 效果:与全参训练相当,相比 LoRA 提升约 12%。
- 效率:与 LoRA 相当,显存相比全参训练降低 54%,若配合 QLoRA 等量化方法可进一步降低。
可见,GeoRA 用 LoRA 的训练成本取得了全参的优化效果,这正是它的应用价值。
落地时还有两点经验,也供同样想在 RLVR 中应用的同学参考:
随机 SVD 初始化。SVD 初始化是一次性的预处理,并且由于只需要前 r 个奇异分量,可以用随机 SVD(Randomized SVD)加速。随机 SVD 的思路是用随机投影把矩阵压到一个小得多的空间去做分解,这样即使 72B 模型处理也只需不到 1 分钟。这个工程细节很重要,因为如果预处理本身要花很长时间,那整体收益就会被削弱。
省略参考模型存储。RLVR 需要一个参考策略来算 KL 散度,常规做法是再存一份完整权重。但 GeoRA 的函数不变性质给出了免费的替代方案:原始权重 = 残差权重 + 初始适配器。因此只要在 actor 内多留一份冻结的初始适配器(低秩,开销很小),就能现算出准确的参考策略。这个技巧省下了一份完整权重的存储,对于大模型来说节省的显存非常可观。
05 总结
GeoRA 是首个面向 RLVR 的优化几何设计的低秩训练方法,其核心贡献可以归纳为三点:
揭示了 RLVR 更新的结构:RLVR 的更新子空间稀疏但各向异性可压缩,这是低秩适配成立的前提。这个发现本身就有价值——它告诉我们,RLVR 的优化过程不是在全参数空间均匀分布的,而是集中在一个低秩子空间里。
提出定位加压缩的适配方法:用谱先验与欧氏先验定位 RLVR 偏好的更新区域,再用截断 SVD 压缩为低秩适配器、冻结残差作锚点。这个方法同时避免了几何错位(对齐 RLVR 的更新偏好)和稀疏计算的效率瓶颈(用稠密低秩计算替代稀疏计算)。
广泛实验验证了优越性能:从 1.5B 到 32B 的模型,在数学、医学、代码场景的 RLVR 上验证方法稳定优于基线,分布外遗忘更少,兼具速度与显存的优越性。
除论文实验之外,GeoRA 也在实际业务场景 Agentic RL 中验证,以更低的成本取得更好的训练效果。
我觉得这个工作最有价值的地方在于:它展示了如何从机制理解出发设计方法。先搞清楚 RLVR 的优化几何是什么样,再针对性地设计适配方法,而不是盲目地把 SFT 场景下的成功方法搬过来。这种“先理解问题,再设计方案”的思路,在 LLM 技术快速迭代的当下尤其值得借鉴。