笔记
0工具
0此页用于记录用户反馈问题后的每一次改进
关于
“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。
md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。
要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。
在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。
要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。
工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。
写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。
适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。
不想公开、只想临时给人看:点“分享”生成一条带密码和有效期的链接,到期自动失效,你也能随时撤销。
你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。
全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。
这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。
不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。
产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。
如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。
趋势
CPU vs GPU:为什么大语言模型需要GPU?——按下回车键后到底发生了什么?
按下回车键的那一刻,数十亿次数学运算就开始了。咱们来追踪一下这趟旅程。
每天,有无数人向ChatGPT、Gemini、Claude或者其他AI助手提问。答案几乎瞬间就出现了。但你有没有想过,按下回车键之后,到底发生了什么?为什么普通的CPU不能快速回答这些问题?为什么各大公司要花几十亿买GPU?今天,咱们就从你的键盘出发,一路走到AI的“大脑”里看看。
先打个比方
想象一下,你的办公室收到了1万封信。你有两个选择:
方案一:一个超级快的员工
他一个接一个地拆信,速度飞快,但一次只能拆一封。这就是CPU。方案二:1万个员工
每个人同时拆一封信,工作几乎瞬间完成。这就是GPU。
差别不在于每个员工有多聪明,而是有更多的人同时在干活。
再换个说法:
CPU = CEO做决策
GPU = 成千上万的工厂工人同时生产产品
CPU为什么厉害
你的CPU能胜任这些任务:
- 打开Chrome
- 播放音乐
- 运行Windows
- 计算税收
- 管理内存
- 运行各种应用
这些任务需要决策、分支、条件判断、中断处理——这是逻辑思考。CPU天生就是干这个的。
GPU又是怎么来的
GPU最初是为了游戏发明的。
想象一下渲染一张画面:一块4K屏幕有超过800万个像素。每个像素都需要计算。每一帧都要算,每秒60次。与其一个像素一个像素地算,GPU选择同时计算数百万个像素。
游戏意外地造出了AI需要的完美硬件。
AI不是像人一样“思考”的
大语言模型(LLM)并不用英语“思考”。它们做的是数学运算——海量的数学运算。LLM内部几乎一切操作最终都变成:
矩阵 × 矩阵
向量 × 矩阵
加法
乘法
归一化
Softmax
全都是数学,重复数十亿次。
矩阵乘法为什么重要
拿两张表格举例:
表A
1 2 3
4 5 6
7 8 9
乘以表B
2 4
6 8
1 3
每个数字都要做多次乘法。但想象一下,这不是3×3的矩阵,而是20000×20000的矩阵,重复几千次,每个词都要算一次。
GPU就是喜欢干这种活。
按下回车键后发生了什么?
咱们一步步追踪。
第一步:你输入“解释黑洞”,按下回车
浏览器发送请求:你的电脑 → 互联网 → 云服务器
第二步:服务器收到请求
AI服务器收到你的文本。此时还没发生任何智能行为。服务器先做这些事:
- 检查认证
- 检查使用限制
- 防止滥用
- 创建请求ID
- 选择可用的GPU
第三步:分词器开始工作
AI不理解文字,它要把文本转成数字。
例如:
解释 → Token 4127
黑洞 → Token 928
于是你的句子变成 [4127, 928]。电脑喜欢数字。
第四步:嵌入(Embeddings)
每个Token变成几百甚至几千个数字。例如:
4127 → [0.34, -0.11, 1.72, ... 共2048个值]
这个向量代表了“意义”。意思相近的词,向量也相近。
第五步:GPU接管
真正的计算开始了。嵌入向量被复制到GPU内存(VRAM)中。从这一步开始,几乎所有操作都在GPU上执行。
Transformer:现代LLM的心脏
每个LLM内部都有很多重复的层:
输入
↓
注意力层(Attention)
↓
前馈网络(Feed Forward)
↓
注意力层
↓
前馈网络
↓
输出
大型模型会重复这个过程几十甚至上百次。
注意力机制(Attention)
这就是AI问“我该关注哪些词?”的地方。
比如这句话:
“猫喝了牛奶,因为它饿了。”
“它”指的是猫还是牛奶?注意力机制会计算所有词之间的关系——每个词和每个其他词都要比较。数百万次数学运算,GPU最擅长这个。
前馈网络(Feed Forward Network)
可以把它想象成一个巨型计算器。每个神经元做的事情就是:
乘 → 加 → 激活 → 重复
成千上万个神经元,运行数百万次。又是GPU的活儿。
为什么GPU内存(VRAM)这么重要
一个现代LLM可能有700亿个参数。每个参数都是一个数字。这些数字必须一直待在内存里。如果放不下,一切都会慢得离谱。
举个例子:
RAM → CPU → GPU → VRAM
把模型放在VRAM里,就能避免频繁的数据传输,速度飞快。
预测下一个词
AI不是一次性写完整个句子的。它一次预测一个Token。
假设下一个词的可能性是:
地球 0.52
月球 0.20
太阳 0.11
火星 0.05
模型会选择最合适的Token(或者根据概率随机采样)。然后整个过程重复,一次一次,直到答案完整。
为什么回答会流式输出
你注意到ChatGPT还没写完就开始回答了吗?因为它是这样工作的:
Token 1 → 发送
Token 2 → 发送
Token 3 → 发送
而不是等所有Token都生成完再一次性发给你。这样对话才显得自然。
为什么要用多个GPU?
一个GPU有时候装不下非常大的模型。解决办法是把模型拆开:
GPU 1:第1-20层
GPU 2:第21-40层
GPU 3:第41-60层
计算从一张GPU流向下一张,这样就能跑更大的模型了。
CPU在AI服务器里到底有什么用?
即使在AI服务器里,CPU仍然不可或缺。它的工作包括:
- 接收你的请求
- 管理网络
- 运行操作系统
- 加载模型
- 调度GPU任务
- 把结果流式返回给你
而GPU负责的是沉重的数学计算。
可以把CPU想象成指挥家,GPU就是整个交响乐团。
一个简单的类比
想象写一本书:
- CPU是经理,决定谁下一步做什么、文件放哪里、什么时候开始。
- GPU是成千上万个写手,同时计算数百万个词。
它们合作,最终产生答案。
完整旅程回顾
用户
↓
浏览器
↓
互联网
↓
LLM服务器
↓
CPU
↓
分词器
↓
嵌入
↓
GPU
↓
Transformer层
↓
注意力机制
↓
前馈网络
↓
预测下一个Token
↓
流式输出
↓
浏览器
↓
你
最后说两句
每一次AI对话,都是一场软件和硬件的精妙协作。CPU负责管理流程、网络和协调;GPU负责执行数十亿次并行数学运算,让现代语言模型变得实用。
下次你按下回车键,答案几乎瞬间出现时,请记住:在这简单的交互背后,是一个全球网络、一套复杂软件和成千上万个GPU核心,一起努力,一次预测一个Token。
这就是驱动现代AI的隐形引擎。