墨穗app.notebase.cn
控制台
内容库
动态
管理
账户
U
用户
--
在线
v1.0.165 · 墨穗笔记
笔记

Notebase墨穗
静水流深,落墨成穗。

0笔记
0工具
30推荐

分类导航

按主题直达

编辑精选

站内用户贡献 · 真实笔记

最新收录

每日更新
继续浏览全部内容 →

笔记

0
加载中...

工具

0

此页用于记录用户反馈问题后的每一次改进

关于

笔记用法

“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。

md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。

要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。

工具用法

在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。

要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。

工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。

隐藏笔记

写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。

适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。

不想公开、只想临时给人看:点“分享”生成一条带密码和有效期的链接,到期自动失效,你也能随时撤销。

数据安全

你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。

技术

全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。

理念

这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。

原则

不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。

更多

产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。

举报

如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。

趋势

// 点击导航加载发现
归档
// 归档为空
最近浏览
// 暂无浏览记录
发布
// 加载中...
用户发布
// 加载中...
用户管理
// 加载中...
访问统计
// 加载中...
内容审核
// 加载中...
个人信息
// 加载中...
返回首页

科技爱好者周刊(第 408 期):你需要知道的 AI 缓存知识

2026-08-13人工智能

说实话,我用了这么久的大模型 API,一直没太把“缓存命中”当回事。直到前几天我看到 DeepSeek 的定价表,直接愣住了——缓存命中的输入价格是 2 分钱,未命中的是 1 块钱,整整差了 50 倍。这价格差得也太离谱了,背后肯定有门道。

我花了不少时间研究了一下,又把阮一峰老师那篇周刊翻来覆去读了几遍,总算是把这玩意儿搞明白了。今天就把我理解的东西完整地梳理一遍,希望能帮到跟我一样曾经对 AI 缓存一头雾水的朋友。

为什么输入 Token 要收费?

要理解缓存的价值,得先搞清楚模型公司为什么对输入 Token 收费。

大模型处理你的提示词,不是直接读文字,而是经历一个相当消耗算力的过程:

  1. 分词:把提示词拆成 Token(可以理解为词块或字符块)
  2. 向量化:把每个 Token 转成高维向量,也就是 Embedding
  3. 注意力计算:计算所有 Token 两两之间的注意力关系,这一步是算力大头

特别是第三步,随着 Token 数量增加,计算量是呈平方级增长的。你给模型发 1000 个 Token,它要做的是 1000×1000 的注意力矩阵运算;你发 10000 个 Token,那就是 10000×10000 的运算。所以提示词越长,模型公司需要消耗的 GPU 算力就越多,自然要向你收费。

缓存到底缓存的是什么?

理解了上面的过程,缓存的概念就顺理成章了。

想象一下多轮对话的场景。你跟 AI 聊一个复杂项目,第一轮你发了一段很长的背景说明,AI 回复了方案。第二轮你继续追问,这时候你的请求里包含的是之前所有的对话内容加上新问题。

也就是说,每一轮请求里,前面那些已经处理过的内容是不变的。模型完全没必要对这些“前缀”重新做分词、向量化、注意力计算——把第一次计算的结果存起来,后面直接用不就行了?

这就是缓存的本质:缓存的是输入 Token 的计算结果,而不是输入文本本身。命中缓存意味着模型跳过了大量重复的算力消耗,直接取用之前算好的结果。

这也是为什么缓存命中的价格如此低廉——它收的其实主要是存储费,而不是算力费。

各家模型的缓存有效期

缓存不是永久保存的。如果一段时间没人用,服务器就会清理掉这些缓存,毕竟存储空间也是成本。

根据阮一峰周刊里引用的测试数据,各家公司的缓存保存时间差异挺大:

公司 缓存有效期
Anthropic 5 分钟
DeepSeek 10 分钟
OpenAI 10~30 分钟逐步失效
Google 1 小时内逐步失效

以 DeepSeek 为例:如果你的两次请求间隔在 10 分钟以内,第二次请求就能命中缓存,输入费用只要 2 分钱。但如果间隔超过了 10 分钟,缓存被清掉了,模型就得重新计算,费用直接变成 1 块钱。

这个价差意味着什么?对于高频调用的 AI Agent 应用来说,能不能保持缓存有效,直接决定了你的 API 账单是三位数还是五位数。

保持缓存有效的策略

既然缓存命中跟未命中的价格差距这么大,做 AI Agent 的开发者自然会想尽办法让缓存一直“活着”。

目前业界常用的做法是:当用户长时间不操作、也不退出的时候,Agent 每隔 30 秒自动向服务器发送一个请求,让缓存保持激活状态。

原理很简单——每次请求都会刷新缓存的有效期,只要在过期之前不断“续命”,缓存就能一直存在。

但这里有个问题:激活请求本身也是要花钱的。每隔 30 秒发一次,10 分钟内就是 20 个请求。虽然单个激活请求的 Token 量不大,但架不住频率高,日积月累也是一笔不小的开销。

而且仔细想想,各家模型的最短缓存有效期也有 5 分钟(Anthropic),30 秒一次的频率确实太激进了。阮一峰在周刊里提到,最新的行业建议是把激活间隔从 30 秒改成 4 分钟一次。这样既能在 5 分钟的最短有效期之内刷新缓存,又能把请求次数从 20 次降到 2-3 次,成本直接砍掉 80% 以上。

不过这里有个细节需要注意:有些模型提供了专门的缓存激活接口,直接调那个接口就行;没有的话,就只能用笨办法——自动重复发送一次以前的提示词,确保缓存被命中并刷新。

缓存的实际使用建议

聊了这么多理论,落地到实际使用,我有几点体会:

  1. 如果你的应用是多轮对话场景,一定要关注缓存的命中率。很多模型提供商的 Dashboard 里都能看到这个指标,如果命中率很低,说明你的请求模式可能有问题,比如每次请求都带了大量无关的上下文。

  2. 设计提示词时,把稳定的内容放在前面,变化的内容放在后面。因为缓存是基于前缀匹配的,前面的 Token 越稳定,越容易命中缓存。如果你把经常变化的内容放在前面,就相当于每次都强制模型重新计算。

  3. 对于长文档处理,缓存的价值尤其大。比如你上传了一份 10 万字的文档,让 AI 帮你分析。第一次处理可能花了几块钱,但只要缓存有效,后续针对这份文档的所有追问都只需要支付缓存命中的价格,成本几乎可以忽略不计。

  4. 激活频率要根据实际模型的有效期来定。别盲目照搬 30 秒或 4 分钟,先查清楚你用的模型缓存有效期是多长,留出足够的余量再定激活间隔。

最后说点题外话

阮一峰周刊里还提到一个有意思的观点,我觉得放在这里很合适。他说有人问 AI 省下来的时间能不能用来休假,Meta 的 CTO Andrew Bosworth 回答说:AI 省下的时间不是用来休假的,而是应该用来开发更多产品。

这个观点有人赞同有人反对,评论区吵得不可开交。但我觉得放在缓存这个具体话题上,道理是通的——你理解了缓存机制,花点时间优化一下请求策略,省下来的 API 费用可能是实打实的 50 倍差距。这比让 AI 帮你写代码省下的时间实在多了。

以上就是我对 AI 输入缓存的全部理解了。如果你也在做 AI 相关的开发,建议去翻翻你用的模型提供商的定价文档,看看缓存命中和未命中的价差,然后检查一下你的请求模式——说不定你一直在为本来可以省掉的钱买单。

相似推荐
DeepSeek Harness Windows 安装保姆教学:一条 npx 命令跑起 Web UIMistral OCR:重新定义文档理解的OCR技术Claude Opus 4.8 深度解析:更诚实、更高效的 AI 协作新纪元Claude Opus 5 深度解析:半价逼近前沿智能的日常化模型Gemma 4:Google DeepMind 开源模型的最新里程碑DeepSeek-R1 深度解析:纯强化学习激发大模型推理能力,蒸馏小模型同样强悍
编写使用方法
Markdown 格式 · Ctrl+Enter 确定
0 字新建笔记
欢迎回来
登录你的墨穗笔记账户
忘记密码?
还没有账户?立即注册
创建账户
注册你的专属墨穗笔记
已有账户?去登录
找回密码
输入注册邮箱获取验证码
返回登录
请输入图片中的验证码以继续注册
加载中...
取消
新建收藏
手动添加你喜欢的内容
取消
编辑头像与昵称
上传新头像或修改你的显示昵称
支持 JPG/PNG,最大 2MB
取消

问题反馈

隐私提醒

取消
编辑工具
受控分享
为这篇笔记生成限时 / 带密码的临时链接
关闭