笔记
0工具
0此页用于记录用户反馈问题后的每一次改进
关于
“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。
md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。
要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。
在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。
要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。
工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。
写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。
适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。
不想公开、只想临时给人看:点“分享”生成一条带密码和有效期的链接,到期自动失效,你也能随时撤销。
你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。
全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。
这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。
不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。
产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。
如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。
趋势
Kokoro:轻量级本地 TTS 系统,CPU 即可实现高质量语音合成
本文介绍 Kokoro,一个仅 82M 参数、完全在 CPU 上运行的高质量文本转语音模型,可本地部署并兼容 OpenAI API。
从不可能到现实:本地 TTS 的质变
几年前,在普通计算机上生成逼真的语音似乎还是天方夜谭。如今,不仅质量已出类拔萃,更重要的是,这一切可以在不牺牲隐私的前提下实现。Kokoro 正是这一趋势的代表——它完全离线运行,所有数据留在本地,无需上传至云端。
Kokoro 模型概览
Kokoro 是一个轻量级神经网络模型,参数仅有 82M(约 8200 万),却能生成多种语言的逼真语音,包括英语、中文(普通话)和印地语。它提供约 50 种不同的声音(主要是英语优化)。模型权重托管在 Hugging Face 上(hexgrad/Kokoro-82M)。
为何选择本地 CPU 推理?
作者在一台配备 GTX 1080 Ti 的机器上运行测试。尽管有独立 GPU,但 GPU 被完全保留给本地 LLM(大语言模型)推理使用,语音合成全部由 CPU 承担。这种设计非常适合多任务场景:GPU 跑 LLM,CPU 跑 TTS,互不干扰。
部署方式:Kokoro-FastAPI 容器
最简便的部署方式是使用预构建的容器镜像 Kokoro-FastAPI。该镜像已包含预下载的语音模型,因此镜像体积较大(约 5 GB)。
启动容器
使用 Podman 或 Docker 执行以下命令:
bash
podman run -p 8880:8880 ghcr.io/remsky/kokoro-fastapi-cpu
容器启动后,访问 http://localhost:8880/web 即可看到简易 Web UI,输入文本即可生成并自动播放音频。
兼容 OpenAI 语音 API
Kokoro-FastAPI 不仅提供 Web UI,还暴露了一个与 OpenAI 语音 API 兼容的 TTS 接口。这意味着任何原本使用 OpenAI TTS 的程序只需修改端点 URL 即可无缝切换。
客户端示例代码
作者提供了 JavaScript 和 Python 两种语言的示例客户端,代码仓库位于 github.com/remotebrowser/speak。
JavaScript 示例
bash
export TTS_API_BASE_URL=http://127.0.0.1:8880/v1
./speak.js "Good morning! How are you today?"
Python 示例
bash
export TTS_API_BASE_URL=http://127.0.0.1:8880/v1
./speak.py "Good morning! How are you today?"
生成的音频默认保存为 MP3 文件。如果系统安装了 SoX(Sound eXchange),音频还会自动播放。
更换声音
通过环境变量 TTS_VOICE 选择不同声音:
bash
export TTS_API_BASE_URL=http://127.0.0.1:8880/v1
export TTS_VOICE=am_eric
./speak.js "Good morning! How are you today?"
完整声音列表见:https://huggingface.co/hexgrad/Kokoro-82M/blob/main/VOICES.md
性能测试:CPU 合成速度
测试文本如下:
Jupiter is the largest and most massive planet in our solar system. This gas giant, made mostly of hydrogen and helium, is known for its Great Red Spot—a massive storm observed for centuries.
使用 am_eric 声音,取 3 次运行最佳结果:
| CPU | 生成时间 |
|---|---|
| Intel Core i7-4770K(2013年发布) | 4.7 秒 |
| Apple M2 Pro | 4.5 秒 |
| AMD Ryzen 7 8745HS | 1.5 秒 |
值得注意的是,i7-4770K 是 12 年前发布的 CPU。如果这块“古董”芯片都能在 5 秒内完成任务,说明 Kokoro 的 CPU 友好性确实出色。
备选方案:Speaches
另一个值得关注的 OpenAI 兼容容器化 TTS 服务是 Speaches。与 Kokoro-FastAPI 不同,Speaches 不捆绑语音权重,需要用户通过 API 显式下载。但 Speaches 的优势在于集成了 OpenAI 的 Whisper——业界领先的语音转文本(STT)系统。如果你的应用同时需要 TTS 和 STT,Speaches 是一个一站式解决方案。
实际应用场景
结合本地 LLM,这类语音合成系统可以让你“听”LLM 的回答,而不是阅读文字。例如:
- 在本地运行 LLM 聊天机器人,将回答实时转为语音
- 为无障碍场景提供离线语音阅读
- 在隐私敏感行业(医疗、金融)中替代云 TTS 服务
技术深度解析
为什么 82M 参数能产生高质量语音?
Kokoro 采用了高效的神经声码器架构,可能基于 VITS 或类似模型。82M 参数在 TTS 领域属于轻量级(通常高质量模型在 100M-500M 之间),但通过精心设计的训练策略和高质量多语言数据集,实现了令人惊讶的逼真度。
CPU 推理的优化
Kokoro 的推理过程被优化为对 CPU 缓存友好,避免了频繁的内存访问。ONNX Runtime 或类似框架可能被用于加速推理。i7-4770K 虽然老旧,但其 AVX2 指令集足以高效运行此类模型。
隐私优势
所有音频生成在本地完成,没有任何数据离开你的机器。这对于处理敏感文本(如医疗报告、法律文件)至关重要。
总结
Kokoro 证明了高质量 TTS 不需要昂贵的 GPU 或云端服务。82M 参数、CPU 友好、多语言支持、OpenAI API 兼容,这些特性使其成为本地语音合成的最佳选择之一。无论是集成到现有应用,还是作为独立服务,它都提供了令人信服的方案。
原文链接:https://ariya.io/2026/03/local-cpu-friendly-high-quality-tts-text-to-speech-with-kokoro/