墨穗app.notebase.cn
控制台
内容库
动态
管理
账户
U
用户
--
在线
v1.0.165 · 墨穗笔记
笔记

Notebase墨穗
静水流深,落墨成穗。

0笔记
0工具
30推荐

分类导航

按主题直达

编辑精选

站内用户贡献 · 真实笔记

最新收录

每日更新
继续浏览全部内容 →

笔记

0
加载中...

工具

0

此页用于记录用户反馈问题后的每一次改进

关于

笔记用法

“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。

md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。

要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。

工具用法

在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。

要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。

工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。

隐藏笔记

写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。

适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。

不想公开、只想临时给人看:点“分享”生成一条带密码和有效期的链接,到期自动失效,你也能随时撤销。

数据安全

你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。

技术

全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。

理念

这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。

原则

不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。

更多

产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。

举报

如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。

趋势

// 点击导航加载发现
归档
// 归档为空
最近浏览
// 暂无浏览记录
发布
// 加载中...
用户发布
// 加载中...
用户管理
// 加载中...
访问统计
// 加载中...
内容审核
// 加载中...
个人信息
// 加载中...
返回首页

Kokoro:轻量级本地 TTS 系统,CPU 即可实现高质量语音合成

2026-07-07人工智能

本文介绍 Kokoro,一个仅 82M 参数、完全在 CPU 上运行的高质量文本转语音模型,可本地部署并兼容 OpenAI API。

从不可能到现实:本地 TTS 的质变

几年前,在普通计算机上生成逼真的语音似乎还是天方夜谭。如今,不仅质量已出类拔萃,更重要的是,这一切可以在不牺牲隐私的前提下实现。Kokoro 正是这一趋势的代表——它完全离线运行,所有数据留在本地,无需上传至云端。

Kokoro 模型概览

Kokoro 是一个轻量级神经网络模型,参数仅有 82M(约 8200 万),却能生成多种语言的逼真语音,包括英语、中文(普通话)和印地语。它提供约 50 种不同的声音(主要是英语优化)。模型权重托管在 Hugging Face 上(hexgrad/Kokoro-82M)。

为何选择本地 CPU 推理?

作者在一台配备 GTX 1080 Ti 的机器上运行测试。尽管有独立 GPU,但 GPU 被完全保留给本地 LLM(大语言模型)推理使用,语音合成全部由 CPU 承担。这种设计非常适合多任务场景:GPU 跑 LLM,CPU 跑 TTS,互不干扰。

部署方式:Kokoro-FastAPI 容器

最简便的部署方式是使用预构建的容器镜像 Kokoro-FastAPI。该镜像已包含预下载的语音模型,因此镜像体积较大(约 5 GB)。

启动容器

使用 Podman 或 Docker 执行以下命令:

bash
podman run -p 8880:8880 ghcr.io/remsky/kokoro-fastapi-cpu

容器启动后,访问 http://localhost:8880/web 即可看到简易 Web UI,输入文本即可生成并自动播放音频。

兼容 OpenAI 语音 API

Kokoro-FastAPI 不仅提供 Web UI,还暴露了一个与 OpenAI 语音 API 兼容的 TTS 接口。这意味着任何原本使用 OpenAI TTS 的程序只需修改端点 URL 即可无缝切换。

客户端示例代码

作者提供了 JavaScript 和 Python 两种语言的示例客户端,代码仓库位于 github.com/remotebrowser/speak。

JavaScript 示例

bash
export TTS_API_BASE_URL=http://127.0.0.1:8880/v1
./speak.js "Good morning! How are you today?"

Python 示例

bash
export TTS_API_BASE_URL=http://127.0.0.1:8880/v1
./speak.py "Good morning! How are you today?"

生成的音频默认保存为 MP3 文件。如果系统安装了 SoX(Sound eXchange),音频还会自动播放。

更换声音

通过环境变量 TTS_VOICE 选择不同声音:

bash
export TTS_API_BASE_URL=http://127.0.0.1:8880/v1
export TTS_VOICE=am_eric
./speak.js "Good morning! How are you today?"

完整声音列表见:https://huggingface.co/hexgrad/Kokoro-82M/blob/main/VOICES.md

性能测试:CPU 合成速度

测试文本如下:

Jupiter is the largest and most massive planet in our solar system. This gas giant, made mostly of hydrogen and helium, is known for its Great Red Spot—a massive storm observed for centuries.

使用 am_eric 声音,取 3 次运行最佳结果:

CPU 生成时间
Intel Core i7-4770K(2013年发布) 4.7 秒
Apple M2 Pro 4.5 秒
AMD Ryzen 7 8745HS 1.5 秒

值得注意的是,i7-4770K 是 12 年前发布的 CPU。如果这块“古董”芯片都能在 5 秒内完成任务,说明 Kokoro 的 CPU 友好性确实出色。

备选方案:Speaches

另一个值得关注的 OpenAI 兼容容器化 TTS 服务是 Speaches。与 Kokoro-FastAPI 不同,Speaches 不捆绑语音权重,需要用户通过 API 显式下载。但 Speaches 的优势在于集成了 OpenAI 的 Whisper——业界领先的语音转文本(STT)系统。如果你的应用同时需要 TTS 和 STT,Speaches 是一个一站式解决方案。

实际应用场景

结合本地 LLM,这类语音合成系统可以让你“听”LLM 的回答,而不是阅读文字。例如:

  • 在本地运行 LLM 聊天机器人,将回答实时转为语音
  • 为无障碍场景提供离线语音阅读
  • 在隐私敏感行业(医疗、金融)中替代云 TTS 服务

技术深度解析

为什么 82M 参数能产生高质量语音?

Kokoro 采用了高效的神经声码器架构,可能基于 VITS 或类似模型。82M 参数在 TTS 领域属于轻量级(通常高质量模型在 100M-500M 之间),但通过精心设计的训练策略和高质量多语言数据集,实现了令人惊讶的逼真度。

CPU 推理的优化

Kokoro 的推理过程被优化为对 CPU 缓存友好,避免了频繁的内存访问。ONNX Runtime 或类似框架可能被用于加速推理。i7-4770K 虽然老旧,但其 AVX2 指令集足以高效运行此类模型。

隐私优势

所有音频生成在本地完成,没有任何数据离开你的机器。这对于处理敏感文本(如医疗报告、法律文件)至关重要。

总结

Kokoro 证明了高质量 TTS 不需要昂贵的 GPU 或云端服务。82M 参数、CPU 友好、多语言支持、OpenAI API 兼容,这些特性使其成为本地语音合成的最佳选择之一。无论是集成到现有应用,还是作为独立服务,它都提供了令人信服的方案。


原文链接:https://ariya.io/2026/03/local-cpu-friendly-high-quality-tts-text-to-speech-with-kokoro/

相似推荐
DeepSeek Harness Windows 安装保姆教学:一条 npx 命令跑起 Web UIMistral OCR:重新定义文档理解的OCR技术Claude Opus 4.8 深度解析:更诚实、更高效的 AI 协作新纪元Claude Opus 5 深度解析:半价逼近前沿智能的日常化模型Gemma 4:Google DeepMind 开源模型的最新里程碑DeepSeek-R1 深度解析:纯强化学习激发大模型推理能力,蒸馏小模型同样强悍
编写使用方法
Markdown 格式 · Ctrl+Enter 确定
0 字新建笔记
欢迎回来
登录你的墨穗笔记账户
忘记密码?
还没有账户?立即注册
创建账户
注册你的专属墨穗笔记
已有账户?去登录
找回密码
输入注册邮箱获取验证码
返回登录
请输入图片中的验证码以继续注册
加载中...
取消
新建收藏
手动添加你喜欢的内容
取消
编辑头像与昵称
上传新头像或修改你的显示昵称
支持 JPG/PNG,最大 2MB
取消

问题反馈

隐私提醒

取消
编辑工具
受控分享
为这篇笔记生成限时 / 带密码的临时链接
关闭