墨穗app.notebase.cn
控制台
内容库
动态
管理
账户
U
用户
--
在线
v1.0.165 · 墨穗笔记
笔记

Notebase墨穗
静水流深,落墨成穗。

0笔记
0工具
30推荐

分类导航

按主题直达

编辑精选

站内用户贡献 · 真实笔记

最新收录

每日更新
继续浏览全部内容 →

笔记

0
加载中...

工具

0

此页用于记录用户反馈问题后的每一次改进

关于

笔记用法

“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。

md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。

要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。

工具用法

在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。

要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。

工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。

隐藏笔记

写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。

适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。

不想公开、只想临时给人看:点“分享”生成一条带密码和有效期的链接,到期自动失效,你也能随时撤销。

数据安全

你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。

技术

全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。

理念

这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。

原则

不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。

更多

产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。

举报

如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。

趋势

// 点击导航加载发现
归档
// 归档为空
最近浏览
// 暂无浏览记录
发布
// 加载中...
用户发布
// 加载中...
用户管理
// 加载中...
访问统计
// 加载中...
内容审核
// 加载中...
个人信息
// 加载中...
返回首页

GeoRA: 为RLVR设计的LoRA——ACL 2026杰出论文解析

2026-08-29人工智能

先说结论:这篇论文拿了 ACL 2026 的 Outstanding Paper,核心是给 RLVR(Reinforcement Learning with Verifiable Rewards)专门设计了一种低秩适配方法,叫 GeoRA。它的出发点很朴素:LoRA 那一套是为 SFT 设计的,直接搬到 RLVR 上,几何不对,效果就拉胯。GeoRA 的思路是先定位 RLVR 真正想更新的稀疏子空间,再用 SVD 把它压成低秩稠密适配器,这样既保留了低秩训练的计算优势,又对齐了 RLVR 的更新规律。

我读完之后最大的感受是:这个工作不是从零发明了一个新机制,而是把 RLVR 的优化几何这个已经被机制研究揭示的规律,第一次系统性地用在了 PEFT 方法设计上。而且论文里的实验做得很扎实,从 1.5B 到 32B 的模型,数学、医学、代码三个领域都验证了。更难得的是,美团团队把方法用在了实际的 AI 骑手招聘场景里,这种从业务问题出发的研究路径,我觉得比纯刷 benchmark 有价值得多。

下面我把这篇论文的技术细节完整拆解一遍,包括背景洞察、方法构造、实验验证和业务落地经验,尽量把来龙去脉讲清楚。

01 背景:为什么 SFT 的 LoRA 先验在 RLVR 上不好使

要理解 GeoRA 在解决什么问题,得先搞清楚 RLVR 和 SFT 在优化几何上的本质差异。这个差异不是拍脑袋想出来的,是最近一系列机制分析工作用实验和理论逐步勾勒出来的。

1.1 RLVR 的优化几何长什么样

先说 SFT。SFT 的本质是最大似然估计,它要做的就是把训练数据里的新信息显式地写进模型权重里。这意味着 SFT 的更新会倾向于改变权重的主方向——也就是预训练权重里奇异值最大的那些分量。你可以把预训练权重想象成一个已经成型的地形,SFT 是在这个地形上直接挖新的河道,而且挖的方向往往和原有主河道方向一致,因为这样才能高效地改变模型的输出分布。

RLVR 则完全不同。RLVR 不直接告诉模型“你应该输出什么”,而是给一堆候选输出打分,然后让模型自己去发现什么样的行为模式能拿到高奖励。这个过程更像一次受约束的优化:模型在已有的行为分布附近做探索,靠奖励信号诱导采样偏置,逐步放大那些能带来高奖励的推理路径。

机制分析工作给出的画像非常清晰:

  • 有效更新分散在稀疏的子空间中。RLVR 的梯度信号不像 SFT 那样集中在一个明确的方向上,而是零零散散地分布在很多维度上,但每个维度上的幅度都不大。这意味着真正需要更新的参数只占一小部分,大部分参数在 RLVR 过程中几乎不动。
  • 更新倾向于避开预训练权重的主方向。这一点很有意思。预训练权重的主方向承载了模型已经学会的通用能力,RLVR 如果去动这些方向,很容易破坏掉模型原有的推理能力。所以 RLVR 的优化过程会自发地绕开这些高曲率区域,把更新放在那些“不太重要”的方向上。
  • 对更新稳定性极其敏感。RLVR 的策略更新需要在类信赖域(trust region)边界内进行。如果更新步子迈得太大,或者落在了主方向上,就会引发谱漂移(spectral shift)、探索多样性坍塌,甚至直接训练崩溃。这也是为什么 RLVR 训练里经常要加 KL 散度约束——它本质上是在限制策略更新的幅度。

1.2 现有 PEFT 方法的两个错位

理解了 RLVR 的优化几何,再看现有的低秩方法,问题就一目了然了。

几何错位。LoRA 及其变体几乎都是在 SFT 场景下设计和验证的,它们各自带着不同的谱先验,但这些先验没有一个考虑过 RLVR 的更新规律:

  • LoRA 用高斯初始化 A 矩阵,B 矩阵全零初始化。这个初始化方式完全和预训练权重无关,相当于在权重空间里随机撒点,然后让优化器自己找路。在 SFT 里这没问题,因为 SFT 的梯度信号强且集中;但在 RLVR 里,这种随机初始化意味着优化器要从一个和 RLVR 偏好子空间毫无关系的起点出发,训练效率和稳定性都堪忧。
  • PiSSA 对原始权重做 SVD,把可训练预算全部分配给主奇异方向。这个先验在 SFT 场景下是合理的——SFT 需要改主方向来注入新信息。但到了 RLVR 这里就反了:RLVR 恰恰要避开主方向,PiSSA 却强行把更新推到主成分上,这等于和 RLVR 的优化几何对着干。论文实验里 PiSSA 在 RLVR 下更容易崩溃,就是这个原因。
  • MiLoRA 取尾部奇异方向。这个思路比 PiSSA 更接近 RLVR 的偏好,因为尾部方向确实不是主方向。但它只考虑了谱先验,忽略了 RLVR 更新分散在稀疏子空间这个特性,而且尾部方向往往包含大量噪声,不一定是最适合 RLVR 更新的区域。

工程错位。有人可能会说:既然 RLVR 只更新一小部分参数,那直接对这个子空间做稀疏微调不就行了?这个想法在更新模式上确实契合 RLVR 的偏好,但问题在于现代 GPU 对非结构化稀疏计算并不友好。稀疏矩阵的运算需要特殊的存储格式和访存模式,GPU 的 SIMT 架构天生适合稠密矩阵的并行计算,遇到稀疏数据反而会因为线程发散和内存访问不连续而效率大降。

论文里的效率实验很直观地说明了这个问题:稀疏微调(SparseFT)把可训练参数降低了 68.0%,但训练耗时反而增加了 10.8%。也就是说,参数少了,速度反而慢了。这在工程上是完全不可接受的——我们做高效微调,就是为了省时间省显存,不是单纯为了参数少。

1.3 GeoRA 的目标

一边是计算友好但几何不对(LoRA 及其变体),一边是几何对但算不快(稀疏微调)。GeoRA 要同时解决这两个错位。

它的目标可以概括成一句话:定位契合 RLVR 的稀疏子空间,然后用低秩稠密的方式去训练它。这样既保留了低秩训练的计算优势(稠密矩阵运算,GPU 友好),又让更新方向对齐了 RLVR 的优化几何(避开主方向,聚焦稀疏子空间)。

02 方法:GeoRA 的构造

GeoRA 的完整流程可以拆成三个步骤,整个过程只在训练开始前执行一次,属于一次性预处理。训练阶段的计算图和标准 LoRA 完全一致,没有任何额外开销。

2.1 构造几何子空间

第一步是从预训练权重矩阵 W 中筛选出 RLVR 偏好的参数区域。这里用了两个互补的掩码(Mask),两者共用同一个稀疏率 ρ。

谱先验 M_Spec(强调稳定性)。这个掩码的操作是:先对 W 做秩为 r 的低秩近似得到 Ŵ_r,然后选出 Ŵ_r 中幅值最小的 ρ 比例的位置。

为什么要这么做?这里的关键直觉是:主成分中的高幅值分量对应的是高曲率区域。在优化几何里,高曲率意味着这些方向的 loss landscape 很陡峭,改动它们会显著改变模型的输出行为,容易破坏预训练结构。RLVR 对稳定性敏感,所以我们要把更新限制在低幅值区域——这些区域曲率低,改动起来对模型整体行为的影响小,有利于谱稳定性。

欧氏先验 M_Euc(强调可塑性)。这个掩码更直接:直接在原始权重 W 上选出幅值最小的 ρ 比例的位置。

直觉是:这些接近零的参数在预训练过程中被“用得少”,可调整空间大。就像一个团队里平时不怎么干活的人,突然被安排新任务,他的可塑性比那些已经满负荷运转的核心成员要强得多。为 RLVR 保留这些自由度,可以让优化器有足够的空间去探索新的推理模式。

取并集。最终的几何约束矩阵是两者的并集:

W_Geo = W ⊙ (M_Spec ∪ M_Euc)

这里有一个非常有意思的细节:两个掩码看起来规则相似,但实际选出的参数集合却很少重叠。论文里给了具体数据:在 Qwen3-8B 上取 ρ = 0.2,两个掩码各选中 20.0% 的参数,但交集只有 4.55%,Jaccard 相似度仅 0.128。

这说明什么?说明谱先验和欧氏先验捕捉的是两类不同的参数区域,它们不是冗余关系,而是互补关系。谱先验关注的是低曲率区域(从低秩近似角度看的低幅值),欧氏先验关注的是低幅值区域(从原始权重角度看的低幅值)。这两个标准选出来的参数集合天然不同,取并集才能完整覆盖 RLVR 偏好的更新空间。论文里的消融实验也印证了这一点:去掉任何一个先验都会带来性能下降。

2.2 低秩近似构造适配器

拿到 W_Geo 之后,对它做 SVD:

W_Geo = U_Geo Σ_Geo V_Geoᵀ

然后取前 r 个奇异分量来初始化两个低秩矩阵:

A_Geo = Σ_Geo[:r,:r]^(1/2) · V_Geo[:,:r]ᵀ
B_Geo = U_Geo[:,:r] · Σ_Geo[:r,:r]^(1/2)

这样构造出来的 B_Geo A_Geo 就是 W_Geo 的最优秩-r 近似。这里依赖的是 Eckart–Young 定理,它保证了在 Frobenius 范数意义下,截断 SVD 给出的低秩近似是最优的。

这里有一个容易被忽略但极其关键的要点:GeoRA 取的是 W_Geo 的 top-r 方向,而不是原始权重 W 的 top-r。适配对象的变化,是 GeoRA 与 PiSSA / MiLoRA 的核心区别。

PiSSA 看的是 W 的主方向,MiLoRA 看的是 W 的尾方向,它们都在原始权重 W 上做文章。而 GeoRA 先通过几何掩码把 W 变成了 W_Geo——一个已经过滤掉主方向干扰、聚焦于 RLVR 偏好区域的矩阵——再在这个新矩阵上取主方向。这样取出来的方向,既不是 W 的主方向(已经被掩码去掉了),也不是 W 的尾方向(那是噪声),而是 W_Geo 这个“RLVR 偏好空间”里的主要变化方向。

从这个角度看,四种方法的区别可以概括成一句话:

LoRA 不看权重,PiSSA 看主方向,MiLoRA 看尾方向,GeoRA 先换一个更合适的适配对象,再在其中取主方向。

2.3 建立残差锚点

最后一步是把剩余权重冻结。按照 LoRA 的缩放约定计算残差矩阵:

W_res = W − (α / r) · B_Geo A_Geo

前向传播时,W_res 冻结,只有适配器可训练:

h = W_res x + (α / r) · B_Geo A_Geo x

这个设计带来两个重要性质。

性质一:初始化时函数不变。因为 W_res + (α/r) · B_Geo A_Geo = W,所以训练启动时模型的输出和预训练模型完全一致,不会出现突变。这对 RLVR 非常重要——初期的输出扰动会污染 rollout 采样分布,如果模型一开始的输出就和预训练差异很大,策略优化的起点就是歪的,后面的训练都会受影响。

性质二:施加了结构约束。优化器只能在 A_Geo、B_Geo 参数化的流形上更新,W_res 作为稳定锚点被冻结。这意味着预训练表示不会被破坏——即使适配器学到了新的推理模式,残差权重始终提供原始的预训练能力作为底衬。这有点像给 RLVR 加了一个隐式的正则化,防止优化过程偏离预训练结构太远。

03 实验验证

论文的主实验在 DeepMath-103K 上用 GRPO 算法对 Qwen3-8B 和 Llama-3.1-8B 做数学 RLVR,对比对象包括 LoRA、PiSSA、MiLoRA、SparseFT(稀疏微调)和 FullFT(全参微调)。同时在 4B 和 1.5B 模型上用 GSM8K 做了规模验证。

3.1 数学推理与分布外能力

分布内(ID)的数学基准上,GeoRA 在两个骨干模型上都取得了最强的整体表现。尤其值得注意的是,在竞赛难度的基准上,GeoRA 对低秩基线的领先非常一致——Qwen3-8B 的 AIME24 达到 23.75%,甚至略高于全参微调。

但分布外(OOD)的结果更值得关注。全参微调在 IFEval、TruthfulQA 上都出现了明显回退,而 GeoRA 基本无损,HumanEval 反而从 76.83 提升到 82.93。

这个结果说明了一个重要事实:在几何对齐的子空间更新,可以在提升目标域推理能力的同时,显著减少对既有能力的遗忘。全参微调的问题在于它更新了所有权重,包括那些承载通用能力的主方向,导致灾难性遗忘。而 GeoRA 从一开始就把更新限制在 RLVR 偏好的稀疏子空间里,这些区域和通用能力的主方向重叠很少,所以既学到了推理新技能,又不破坏已有能力。

3.2 医学与代码领域

为了确认收益不局限于数学,论文在医学和代码场景做了扩展实验。两个领域的结论一致:GeoRA 稳定优于低秩基线,并与全参微调相当。

这很重要,因为数学、医学、代码三个领域的 RLVR 任务特性差异很大:数学推理的验证信号非常明确(答案对错),医学任务的奖励设计更复杂(要考虑诊断准确性、治疗方案合理性),代码任务的验证则介于两者之间(编译通过 + 测试用例)。GeoRA 在三个领域都表现稳定,说明它的几何先验不是针对某个特定任务的过拟合,而是抓住了 RLVR 的通用规律。

3.3 收敛效率与稳定性

收敛效率方面,GeoRA 全程保持领先,并且达到高位性能的时间点显著早于其他低秩基线。这意味着在实际训练中,用 GeoRA 可以更早地停止训练,节省计算资源。

超参鲁棒性方面,论文以学习率为例做了实验:GeoRA 在很宽的区间内都维持高奖励,而其他方法在大学习率下明显下滑。这在实践中非常重要——RLVR 的超参调优本来就比 SFT 困难,如果方法对学习率敏感,那使用成本会非常高。GeoRA 的鲁棒性意味着实践者不需要精心调参就能获得稳定效果。

3.4 计算效率

相比全参微调,GeoRA 使可训练参数降低 99.5%,单步耗时降低 19.9%,显存占用降低 28.5%。

对照 SparseFT 的数据可以看得更清楚:SparseFT 虽然把参数降了 68.0%,但单步耗时反而上升了 10.8%。这说明参数效率不等于计算效率——非结构化稀疏在 GPU 上反而更慢。

GeoRA 的关键工程价值,就在于把几何先验落成了稠密低秩计算。虽然它只训练 0.5% 的参数(99.5% 的参数被冻结),但这些可训练参数是以稠密矩阵的形式参与计算的,GPU 的并行能力得到了充分利用,因此参数效率真正转化为了速度与显存收益。

3.5 低秩结构分析

论文还进一步做了结构性分析,回答了一个关键问题:W_Geo 是一个稀疏矩阵,把它压缩成秩 r 的形式,为什么损失是可控的?

这里有三组分析:

第一组:稀疏本身不带来低秩性。作为对照,论文构造了两个不同稠密度的随机噪声矩阵。两者的奇异值谱几乎重叠,都呈现相对平缓的衰减。这说明稀疏本身依然是近似各向同性的,没有可利用的主方向。换句话说,你不能说“因为矩阵是稀疏的,所以它天然低秩”——稀疏和低秩是两个独立的概念。

第二组:W_Geo 具有低秩特性。论文展示了 W_Geo 的谱形与预训练权重类似,大部分谱能量集中在少数前导分量上。这说明被选中的区域继承了预训练权重结构化、可压缩的低秩形态。预训练权重本身就不是各向同性的,它有清晰的谱结构,通过几何掩码筛选出来的子矩阵也保留了这种结构。

第三组:全参 RLVR 的实际更新也是低秩的。论文直接检验了 ΔW = W_FullFT − W_Pretrain,发现它也呈现出高度可压缩的重尾谱。这意味着 RLVR 的更新过程本身就在一个低秩子空间里进行,全参微调其实浪费了大量参数在更新那些几乎不需要动的方向。

三组分析合起来给出了 GeoRA 的结构依据:低秩特性是 RLVR 具备的内在属性。这也解释了为什么 GeoRA 只训练 0.5% 的参数就能与全参微调效果相当——它逼近的正是 RLVR 更新本身的形态。全参微调在数学上是完备的,但 RLVR 的更新形态天然低秩,所以低秩适配器有足够的容量去拟合。

04 业务应用

GeoRA 这个工作的出发点不是发论文,而是实际业务中对高效强化学习的需求。美团履约团队所处的场景是 AI 骑手招聘:由 Agent 主动触达和跟进候选人,在多轮沟通中识别其意愿、顾虑与决策卡点,针对性地制定下一步策略,进而把候选人逐步推进到面试和入职。

这个过程需要类似于销售的情商、策略、话术和临场应变,但目标和结果却明确、可验证(约面/入职/ROI),非常适合用 RLVR 来优化。这个垂直域场景有一个特别的训练需求组合:

  • 基模大、上下文长。这个 Agent 对基础智能和长程能力要求较高,需要建立在大尺寸基模之上,且单条轨迹的上下文很长,强化学习的资源开销可观。
  • 增量能力规模不大。垂直域需要额外构建的知识和能力规模通常不大,训练数据量远小于基模,低秩适配的容量基本足够承载。

一边是训练开销高,一边是增量容量小,这正是面向 RLVR 的低秩高效训练的用武之地。

事实上,让团队最早怀疑“为 SFT 设计的低秩先验未必适合 RLVR”的,也是业务训练中的体感:LoRA、PiSSA、MiLoRA 之间效果差异明显,学习率调大训练就不稳甚至崩掉。这说明初始化的几何先验在 RLVR 下是一个大变量,存在优化空间。

目前 GeoRA 在 AI 招聘场景中的 Agentic RL 实验结果:

  • 效果:与全参训练相当,相比 LoRA 提升约 12%。
  • 效率:与 LoRA 相当,显存相比全参训练降低 54%,若配合 QLoRA 等量化方法可进一步降低。

可见,GeoRA 用 LoRA 的训练成本取得了全参的优化效果,这正是它的应用价值。

落地时还有两点经验,也供同样想在 RLVR 中应用的同学参考:

随机 SVD 初始化。SVD 初始化是一次性的预处理,并且由于只需要前 r 个奇异分量,可以用随机 SVD(Randomized SVD)加速。随机 SVD 的思路是用随机投影把矩阵压到一个小得多的空间去做分解,这样即使 72B 模型处理也只需不到 1 分钟。这个工程细节很重要,因为如果预处理本身要花很长时间,那整体收益就会被削弱。

省略参考模型存储。RLVR 需要一个参考策略来算 KL 散度,常规做法是再存一份完整权重。但 GeoRA 的函数不变性质给出了免费的替代方案:原始权重 = 残差权重 + 初始适配器。因此只要在 actor 内多留一份冻结的初始适配器(低秩,开销很小),就能现算出准确的参考策略。这个技巧省下了一份完整权重的存储,对于大模型来说节省的显存非常可观。

05 总结

GeoRA 是首个面向 RLVR 的优化几何设计的低秩训练方法,其核心贡献可以归纳为三点:

  1. 揭示了 RLVR 更新的结构:RLVR 的更新子空间稀疏但各向异性可压缩,这是低秩适配成立的前提。这个发现本身就有价值——它告诉我们,RLVR 的优化过程不是在全参数空间均匀分布的,而是集中在一个低秩子空间里。

  2. 提出定位加压缩的适配方法:用谱先验与欧氏先验定位 RLVR 偏好的更新区域,再用截断 SVD 压缩为低秩适配器、冻结残差作锚点。这个方法同时避免了几何错位(对齐 RLVR 的更新偏好)和稀疏计算的效率瓶颈(用稠密低秩计算替代稀疏计算)。

  3. 广泛实验验证了优越性能:从 1.5B 到 32B 的模型,在数学、医学、代码场景的 RLVR 上验证方法稳定优于基线,分布外遗忘更少,兼具速度与显存的优越性。

除论文实验之外,GeoRA 也在实际业务场景 Agentic RL 中验证,以更低的成本取得更好的训练效果。

我觉得这个工作最有价值的地方在于:它展示了如何从机制理解出发设计方法。先搞清楚 RLVR 的优化几何是什么样,再针对性地设计适配方法,而不是盲目地把 SFT 场景下的成功方法搬过来。这种“先理解问题,再设计方案”的思路,在 LLM 技术快速迭代的当下尤其值得借鉴。

相似推荐
DeepSeek Harness Windows 安装保姆教学:一条 npx 命令跑起 Web UIMistral OCR:重新定义文档理解的OCR技术Claude Opus 4.8 深度解析:更诚实、更高效的 AI 协作新纪元Claude Opus 5 深度解析:半价逼近前沿智能的日常化模型Gemma 4:Google DeepMind 开源模型的最新里程碑DeepSeek-R1 深度解析:纯强化学习激发大模型推理能力,蒸馏小模型同样强悍
编写使用方法
Markdown 格式 · Ctrl+Enter 确定
0 字新建笔记
欢迎回来
登录你的墨穗笔记账户
忘记密码?
还没有账户?立即注册
创建账户
注册你的专属墨穗笔记
已有账户?去登录
找回密码
输入注册邮箱获取验证码
返回登录
请输入图片中的验证码以继续注册
加载中...
取消
新建收藏
手动添加你喜欢的内容
取消
编辑头像与昵称
上传新头像或修改你的显示昵称
支持 JPG/PNG,最大 2MB
取消

问题反馈

隐私提醒

取消
编辑工具
受控分享
为这篇笔记生成限时 / 带密码的临时链接
关闭