笔记
0工具
0此页用于记录用户反馈问题后的每一次改进
关于
“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。
md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。
要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。
在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。
要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。
工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。
写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。
适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。
不想公开、只想临时给人看:点“分享”生成一条带密码和有效期的链接,到期自动失效,你也能随时撤销。
你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。
全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。
这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。
不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。
产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。
如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。
趋势
科技爱好者周刊(第 408 期):你需要知道的 AI 缓存知识
说实话,我用了这么久的大模型 API,一直没太把“缓存命中”当回事。直到前几天我看到 DeepSeek 的定价表,直接愣住了——缓存命中的输入价格是 2 分钱,未命中的是 1 块钱,整整差了 50 倍。这价格差得也太离谱了,背后肯定有门道。
我花了不少时间研究了一下,又把阮一峰老师那篇周刊翻来覆去读了几遍,总算是把这玩意儿搞明白了。今天就把我理解的东西完整地梳理一遍,希望能帮到跟我一样曾经对 AI 缓存一头雾水的朋友。
为什么输入 Token 要收费?
要理解缓存的价值,得先搞清楚模型公司为什么对输入 Token 收费。
大模型处理你的提示词,不是直接读文字,而是经历一个相当消耗算力的过程:
- 分词:把提示词拆成 Token(可以理解为词块或字符块)
- 向量化:把每个 Token 转成高维向量,也就是 Embedding
- 注意力计算:计算所有 Token 两两之间的注意力关系,这一步是算力大头
特别是第三步,随着 Token 数量增加,计算量是呈平方级增长的。你给模型发 1000 个 Token,它要做的是 1000×1000 的注意力矩阵运算;你发 10000 个 Token,那就是 10000×10000 的运算。所以提示词越长,模型公司需要消耗的 GPU 算力就越多,自然要向你收费。
缓存到底缓存的是什么?
理解了上面的过程,缓存的概念就顺理成章了。
想象一下多轮对话的场景。你跟 AI 聊一个复杂项目,第一轮你发了一段很长的背景说明,AI 回复了方案。第二轮你继续追问,这时候你的请求里包含的是之前所有的对话内容加上新问题。
也就是说,每一轮请求里,前面那些已经处理过的内容是不变的。模型完全没必要对这些“前缀”重新做分词、向量化、注意力计算——把第一次计算的结果存起来,后面直接用不就行了?
这就是缓存的本质:缓存的是输入 Token 的计算结果,而不是输入文本本身。命中缓存意味着模型跳过了大量重复的算力消耗,直接取用之前算好的结果。
这也是为什么缓存命中的价格如此低廉——它收的其实主要是存储费,而不是算力费。
各家模型的缓存有效期
缓存不是永久保存的。如果一段时间没人用,服务器就会清理掉这些缓存,毕竟存储空间也是成本。
根据阮一峰周刊里引用的测试数据,各家公司的缓存保存时间差异挺大:
| 公司 | 缓存有效期 |
|---|---|
| Anthropic | 5 分钟 |
| DeepSeek | 10 分钟 |
| OpenAI | 10~30 分钟逐步失效 |
| 1 小时内逐步失效 |
以 DeepSeek 为例:如果你的两次请求间隔在 10 分钟以内,第二次请求就能命中缓存,输入费用只要 2 分钱。但如果间隔超过了 10 分钟,缓存被清掉了,模型就得重新计算,费用直接变成 1 块钱。
这个价差意味着什么?对于高频调用的 AI Agent 应用来说,能不能保持缓存有效,直接决定了你的 API 账单是三位数还是五位数。
保持缓存有效的策略
既然缓存命中跟未命中的价格差距这么大,做 AI Agent 的开发者自然会想尽办法让缓存一直“活着”。
目前业界常用的做法是:当用户长时间不操作、也不退出的时候,Agent 每隔 30 秒自动向服务器发送一个请求,让缓存保持激活状态。
原理很简单——每次请求都会刷新缓存的有效期,只要在过期之前不断“续命”,缓存就能一直存在。
但这里有个问题:激活请求本身也是要花钱的。每隔 30 秒发一次,10 分钟内就是 20 个请求。虽然单个激活请求的 Token 量不大,但架不住频率高,日积月累也是一笔不小的开销。
而且仔细想想,各家模型的最短缓存有效期也有 5 分钟(Anthropic),30 秒一次的频率确实太激进了。阮一峰在周刊里提到,最新的行业建议是把激活间隔从 30 秒改成 4 分钟一次。这样既能在 5 分钟的最短有效期之内刷新缓存,又能把请求次数从 20 次降到 2-3 次,成本直接砍掉 80% 以上。
不过这里有个细节需要注意:有些模型提供了专门的缓存激活接口,直接调那个接口就行;没有的话,就只能用笨办法——自动重复发送一次以前的提示词,确保缓存被命中并刷新。
缓存的实际使用建议
聊了这么多理论,落地到实际使用,我有几点体会:
如果你的应用是多轮对话场景,一定要关注缓存的命中率。很多模型提供商的 Dashboard 里都能看到这个指标,如果命中率很低,说明你的请求模式可能有问题,比如每次请求都带了大量无关的上下文。
设计提示词时,把稳定的内容放在前面,变化的内容放在后面。因为缓存是基于前缀匹配的,前面的 Token 越稳定,越容易命中缓存。如果你把经常变化的内容放在前面,就相当于每次都强制模型重新计算。
对于长文档处理,缓存的价值尤其大。比如你上传了一份 10 万字的文档,让 AI 帮你分析。第一次处理可能花了几块钱,但只要缓存有效,后续针对这份文档的所有追问都只需要支付缓存命中的价格,成本几乎可以忽略不计。
激活频率要根据实际模型的有效期来定。别盲目照搬 30 秒或 4 分钟,先查清楚你用的模型缓存有效期是多长,留出足够的余量再定激活间隔。
最后说点题外话
阮一峰周刊里还提到一个有意思的观点,我觉得放在这里很合适。他说有人问 AI 省下来的时间能不能用来休假,Meta 的 CTO Andrew Bosworth 回答说:AI 省下的时间不是用来休假的,而是应该用来开发更多产品。
这个观点有人赞同有人反对,评论区吵得不可开交。但我觉得放在缓存这个具体话题上,道理是通的——你理解了缓存机制,花点时间优化一下请求策略,省下来的 API 费用可能是实打实的 50 倍差距。这比让 AI 帮你写代码省下的时间实在多了。
以上就是我对 AI 输入缓存的全部理解了。如果你也在做 AI 相关的开发,建议去翻翻你用的模型提供商的定价文档,看看缓存命中和未命中的价差,然后检查一下你的请求模式——说不定你一直在为本来可以省掉的钱买单。