墨穗app.notebase.cn
控制台
内容库
动态
管理
账户
U
用户
--
在线
v1.0.165 · 墨穗笔记
笔记

Notebase墨穗
静水流深,落墨成穗。

0笔记
0工具
30推荐

分类导航

按主题直达

编辑精选

站内用户贡献 · 真实笔记

最新收录

每日更新
继续浏览全部内容 →

笔记

0
加载中...

工具

0

此页用于记录用户反馈问题后的每一次改进

关于

笔记用法

“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。

md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。

要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。

工具用法

在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。

要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。

工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。

隐藏笔记

写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。

适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。

不想公开、只想临时给人看:点“分享”生成一条带密码和有效期的链接,到期自动失效,你也能随时撤销。

数据安全

你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。

技术

全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。

理念

这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。

原则

不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。

更多

产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。

举报

如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。

趋势

// 点击导航加载发现
归档
// 归档为空
最近浏览
// 暂无浏览记录
发布
// 加载中...
用户发布
// 加载中...
用户管理
// 加载中...
访问统计
// 加载中...
内容审核
// 加载中...
个人信息
// 加载中...
返回首页

CPU vs GPU:为什么大语言模型需要GPU?——按下回车键后到底发生了什么?

2026-07-08人工智能

按下回车键的那一刻,数十亿次数学运算就开始了。咱们来追踪一下这趟旅程。

每天,有无数人向ChatGPT、Gemini、Claude或者其他AI助手提问。答案几乎瞬间就出现了。但你有没有想过,按下回车键之后,到底发生了什么?为什么普通的CPU不能快速回答这些问题?为什么各大公司要花几十亿买GPU?今天,咱们就从你的键盘出发,一路走到AI的“大脑”里看看。

先打个比方

想象一下,你的办公室收到了1万封信。你有两个选择:

  • 方案一:一个超级快的员工
    他一个接一个地拆信,速度飞快,但一次只能拆一封。这就是CPU。

  • 方案二:1万个员工
    每个人同时拆一封信,工作几乎瞬间完成。这就是GPU。

差别不在于每个员工有多聪明,而是有更多的人同时在干活。

再换个说法:
CPU = CEO做决策
GPU = 成千上万的工厂工人同时生产产品

CPU为什么厉害

你的CPU能胜任这些任务:

  • 打开Chrome
  • 播放音乐
  • 运行Windows
  • 计算税收
  • 管理内存
  • 运行各种应用

这些任务需要决策、分支、条件判断、中断处理——这是逻辑思考。CPU天生就是干这个的。

GPU又是怎么来的

GPU最初是为了游戏发明的。

想象一下渲染一张画面:一块4K屏幕有超过800万个像素。每个像素都需要计算。每一帧都要算,每秒60次。与其一个像素一个像素地算,GPU选择同时计算数百万个像素。

游戏意外地造出了AI需要的完美硬件。

AI不是像人一样“思考”的

大语言模型(LLM)并不用英语“思考”。它们做的是数学运算——海量的数学运算。LLM内部几乎一切操作最终都变成:

矩阵 × 矩阵
向量 × 矩阵
加法
乘法
归一化
Softmax

全都是数学,重复数十亿次。

矩阵乘法为什么重要

拿两张表格举例:

表A

1 2 3
4 5 6
7 8 9

乘以表B

2 4
6 8
1 3

每个数字都要做多次乘法。但想象一下,这不是3×3的矩阵,而是20000×20000的矩阵,重复几千次,每个词都要算一次。

GPU就是喜欢干这种活。

按下回车键后发生了什么?

咱们一步步追踪。

第一步:你输入“解释黑洞”,按下回车

浏览器发送请求:
你的电脑 → 互联网 → 云服务器

第二步:服务器收到请求

AI服务器收到你的文本。此时还没发生任何智能行为。服务器先做这些事:

  • 检查认证
  • 检查使用限制
  • 防止滥用
  • 创建请求ID
  • 选择可用的GPU

第三步:分词器开始工作

AI不理解文字,它要把文本转成数字。

例如:

解释 → Token 4127
黑洞 → Token 928

于是你的句子变成 [4127, 928]。电脑喜欢数字。

第四步:嵌入(Embeddings)

每个Token变成几百甚至几千个数字。例如:

4127 → [0.34, -0.11, 1.72, ... 共2048个值]

这个向量代表了“意义”。意思相近的词,向量也相近。

第五步:GPU接管

真正的计算开始了。嵌入向量被复制到GPU内存(VRAM)中。从这一步开始,几乎所有操作都在GPU上执行。

Transformer:现代LLM的心脏

每个LLM内部都有很多重复的层:

输入
  ↓
注意力层(Attention)
  ↓
前馈网络(Feed Forward)
  ↓
注意力层
  ↓
前馈网络
  ↓
输出

大型模型会重复这个过程几十甚至上百次。

注意力机制(Attention)

这就是AI问“我该关注哪些词?”的地方。

比如这句话:
“猫喝了牛奶,因为它饿了。”
“它”指的是猫还是牛奶?注意力机制会计算所有词之间的关系——每个词和每个其他词都要比较。数百万次数学运算,GPU最擅长这个。

前馈网络(Feed Forward Network)

可以把它想象成一个巨型计算器。每个神经元做的事情就是:

乘 → 加 → 激活 → 重复

成千上万个神经元,运行数百万次。又是GPU的活儿。

为什么GPU内存(VRAM)这么重要

一个现代LLM可能有700亿个参数。每个参数都是一个数字。这些数字必须一直待在内存里。如果放不下,一切都会慢得离谱。

举个例子:

RAM → CPU → GPU → VRAM

把模型放在VRAM里,就能避免频繁的数据传输,速度飞快。

预测下一个词

AI不是一次性写完整个句子的。它一次预测一个Token。

假设下一个词的可能性是:

地球    0.52
月球    0.20
太阳    0.11
火星    0.05

模型会选择最合适的Token(或者根据概率随机采样)。然后整个过程重复,一次一次,直到答案完整。

为什么回答会流式输出

你注意到ChatGPT还没写完就开始回答了吗?因为它是这样工作的:

Token 1 → 发送
Token 2 → 发送
Token 3 → 发送

而不是等所有Token都生成完再一次性发给你。这样对话才显得自然。

为什么要用多个GPU?

一个GPU有时候装不下非常大的模型。解决办法是把模型拆开:

GPU 1:第1-20层
GPU 2:第21-40层
GPU 3:第41-60层

计算从一张GPU流向下一张,这样就能跑更大的模型了。

CPU在AI服务器里到底有什么用?

即使在AI服务器里,CPU仍然不可或缺。它的工作包括:

  • 接收你的请求
  • 管理网络
  • 运行操作系统
  • 加载模型
  • 调度GPU任务
  • 把结果流式返回给你

而GPU负责的是沉重的数学计算。

可以把CPU想象成指挥家,GPU就是整个交响乐团。

一个简单的类比

想象写一本书:

  • CPU是经理,决定谁下一步做什么、文件放哪里、什么时候开始。
  • GPU是成千上万个写手,同时计算数百万个词。

它们合作,最终产生答案。

完整旅程回顾

用户
  ↓
浏览器
  ↓
互联网
  ↓
LLM服务器
  ↓
CPU
  ↓
分词器
  ↓
嵌入
  ↓
GPU
  ↓
Transformer层
  ↓
注意力机制
  ↓
前馈网络
  ↓
预测下一个Token
  ↓
流式输出
  ↓
浏览器
  ↓
你

最后说两句

每一次AI对话,都是一场软件和硬件的精妙协作。CPU负责管理流程、网络和协调;GPU负责执行数十亿次并行数学运算,让现代语言模型变得实用。

下次你按下回车键,答案几乎瞬间出现时,请记住:在这简单的交互背后,是一个全球网络、一套复杂软件和成千上万个GPU核心,一起努力,一次预测一个Token。

这就是驱动现代AI的隐形引擎。

相似推荐
DeepSeek Harness Windows 安装保姆教学:一条 npx 命令跑起 Web UIMistral OCR:重新定义文档理解的OCR技术Claude Opus 4.8 深度解析:更诚实、更高效的 AI 协作新纪元Claude Opus 5 深度解析:半价逼近前沿智能的日常化模型Gemma 4:Google DeepMind 开源模型的最新里程碑DeepSeek-R1 深度解析:纯强化学习激发大模型推理能力,蒸馏小模型同样强悍
编写使用方法
Markdown 格式 · Ctrl+Enter 确定
0 字新建笔记
欢迎回来
登录你的墨穗笔记账户
忘记密码?
还没有账户?立即注册
创建账户
注册你的专属墨穗笔记
已有账户?去登录
找回密码
输入注册邮箱获取验证码
返回登录
请输入图片中的验证码以继续注册
加载中...
取消
新建收藏
手动添加你喜欢的内容
取消
编辑头像与昵称
上传新头像或修改你的显示昵称
支持 JPG/PNG,最大 2MB
取消

问题反馈

隐私提醒

取消
编辑工具
受控分享
为这篇笔记生成限时 / 带密码的临时链接
关闭