笔记
0工具
0此页用于记录用户反馈问题后的每一次改进
关于
“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。
md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。
要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。
在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。
要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。
工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。
写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。
适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。
不想公开、只想临时给人看:点“分享”生成一条带密码和有效期的链接,到期自动失效,你也能随时撤销。
你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。
全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。
这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。
不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。
产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。
如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。
趋势
Kokoro:82M参数、CPU友好、高质量本地语音合成系统深度解析
Kokoro 是一个仅82M参数、可在CPU上实时运行、支持多语言的高质量文本转语音模型,通过容器化部署兼容OpenAI API,让本地语音合成变得简单且隐私安全。
引言:从不可能到触手可及
几年前,在本地生成逼真的语音听起来像天方夜谭。如今,不仅质量已经非常出色,而且更重要的是——这一切可以在不牺牲隐私的前提下实现。本文要介绍的Kokoro模型,正是这一进步的典型代表。
核心亮点:小而强
Kokoro模型只有82M参数(82 million parameters),却能够生成非常自然的语音。它支持英语、普通话(中文)、印地语等多种语言,并提供了约50种不同音色(主要针对英语优化)。
与之对比,许多现代大型语言模型(LLM)动辄数十亿甚至上百亿参数,而Kokoro以不到1亿的参数规模实现了令人惊艳的TTS效果,这得益于其高效的模型架构和训练策略。
部署方式:容器化一键启动
Kokoro的部署非常简单,官方推荐使用预构建的容器镜像 Kokoro-FastAPI。这个镜像已经包含了预下载的语音模型文件,因此体积较大(约5GB),但好处是开箱即用。
使用Docker或Podman启动
bash
podman run -p 8880:8880 ghcr.io/remsky/kokoro-fastapi-cpu
这条命令会在本地的8880端口启动一个服务。启动后,访问 http://localhost:8880/web 即可看到一个简单的Web界面,你可以输入文本并直接生成(并自动播放)语音。
API兼容性:无缝对接OpenAI生态
Kokoro-FastAPI 容器不仅提供了Web UI,还提供了一个与OpenAI语音API兼容的TTS接口。这意味着,任何已经使用OpenAI TTS API的程序,只需要修改API的Base URL,就可以直接切换到本地的Kokoro服务,无需改动代码逻辑。
这对于希望保护数据隐私、减少延迟或避免API费用的开发者来说,是一个极大的便利。
快速测试:JS和Python示例
为了方便测试,作者提供了一个示例仓库 github.com/remotebrowser/speak。克隆后,只需设置环境变量即可使用。
JavaScript版本
bash
export TTS_API_BASE_URL = http://127.0.0.1:8880/v1
./speak.js "Good morning! How are you today?"
Python版本
bash
export TTS_API_BASE_URL = http://127.0.0.1:8880/v1
./speak.py "Good morning! How are you today?"
生成的音频会保存为MP3文件。如果系统安装了 SoX(Sound eXchange,一个跨平台的音频处理工具),音频还会自动播放。
切换音色
你可以通过 TTS_VOICE 环境变量来指定不同的音色:
bash
export TTS_API_BASE_URL = http://127.0.0.1:8880/v1
export TTS_VOICE = am_eric
./speak.js "Good morning! How are you today?"
完整的音色列表可以在Kokoro官方项目页的 VOICES.md 中找到。
性能实测:老CPU也能跑
为了验证Kokoro在CPU上的实际表现,作者使用 am_eric 音色对一段测试文本进行了生成时间测试。测试文本如下:
Jupiter is the largest and most massive planet in our solar system. This gas giant, made mostly of hydrogen and helium, is known for its Great Red Spot—a massive storm observed for centuries.
测试结果(取3次运行中的最佳值):
| CPU型号 | 生成时间 |
|---|---|
| Intel Core i7-4770K | 4.7秒 |
| Apple M2 Pro | 4.5秒 |
| AMD Ryzen 7 8745HS | 1.5秒 |
关键观察:
- i7-4770K 是一颗2013年发布的CPU,距今已超过12年。即便如此,它仍然能在5秒内完成一段短文本的语音合成。
- Apple M2 Pro 表现与老i7接近,说明Kokoro对x86和ARM架构都有良好的支持。
- AMD Ryzen 7 8745HS(2024年主流移动处理器)仅需1.5秒,几乎是实时生成。
这意味着,只要你的电脑不是太过古老,Kokoro都能提供可用的CPU端TTS体验。
备选方案:Speaches
如果你需要更完整的语音服务,可以考虑另一个兼容OpenAI API的容器化TTS服务——Speaches。
与Kokoro-FastAPI的区别:
- Kokoro-FastAPI:镜像内已预置语音权重,启动即用。
- Speaches:需要你通过API显式下载语音权重(不打包在镜像中),因此镜像体积更小。
Speaches的优势:它集成了OpenAI著名的Whisper语音识别(STT)系统。如果你的应用同时需要文本转语音(TTS)和语音转文本(STT),Speaches可以一站式解决。
应用场景与展望
将这样的本地TTS系统与一个本地运行的LLM(大语言模型)结合,你就可以用耳朵听LLM的回答,而不是用眼睛看。这对于:
- 在开车、做家务时获取信息
- 为视障人士提供辅助
- 构建完全离线的语音助手
- 保护隐私的语音交互应用
都具有极高的实用价值。
总结
Kokoro以82M参数、CPU可运行的轻量级设计,提供了令人惊讶的高质量多语言语音合成能力。通过容器化部署和OpenAI API兼容设计,它极大地降低了本地TTS的接入门槛。无论是12年前的老CPU还是最新的移动处理器,都能流畅运行。对于追求隐私、低延迟或离线部署的开发者来说,Kokoro是一个值得认真考虑的TTS解决方案。
原文链接:https://ariya.io/2026/03/local-cpu-friendly-high-quality-tts-text-to-speech-with-kokoro/