墨穗app.notebase.cn
控制台
内容库
动态
管理
账户
U
用户
--
在线
v1.0.165 · 墨穗笔记
笔记

Notebase墨穗
静水流深,落墨成穗。

0笔记
0工具
30推荐

分类导航

按主题直达

编辑精选

站内用户贡献 · 真实笔记

最新收录

每日更新
继续浏览全部内容 →

笔记

0
加载中...

工具

0

此页用于记录用户反馈问题后的每一次改进

关于

笔记用法

“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。

md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。

要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。

工具用法

在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。

要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。

工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。

隐藏笔记

写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。

适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。

不想公开、只想临时给人看:点“分享”生成一条带密码和有效期的链接,到期自动失效,你也能随时撤销。

数据安全

你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。

技术

全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。

理念

这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。

原则

不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。

更多

产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。

举报

如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。

趋势

// 点击导航加载发现
归档
// 归档为空
最近浏览
// 暂无浏览记录
发布
// 加载中...
用户发布
// 加载中...
用户管理
// 加载中...
访问统计
// 加载中...
内容审核
// 加载中...
个人信息
// 加载中...
返回首页

Kokoro:本地CPU运行的高质量文本转语音系统深度解析

2026-07-08人工智能

本文介绍Kokoro——一个仅82M参数、可在CPU上实时运行的高质量多语言TTS模型,并详述其部署与使用。

引言:从遥不可及到触手可及的本地语音合成

就在几年前,在本地设备上生成逼真的语音似乎还是一个遥不可及的梦想。然而今天,这一技术的质量已经达到了令人惊叹的水平,更重要的是,它能够在不牺牲用户隐私的前提下实现这些成果。本文介绍的Kokoro模型,正是这一技术进步的典型代表。

作者在先前一篇关于“GTX 1080 Ti用于本地LLM”的文章中描述了一台本地机器。本文展示的音频样例正是完全在这台机器上生成的。值得注意的是,尽管该机器配备了专用的GPU,但这个GPU被完全保留给LLM(大语言模型)推理使用,而语音合成任务则完全由CPU负责。这种设计展示了Kokoro在CPU上的高效性。

Kokoro模型的核心特性

Kokoro是一个参数规模仅为82M的模型,但它却能生成多语言的高质量语音,支持的语言包括英语、普通话(中文)和印地语等。它提供了大约50种不同的声音选项,这些声音主要针对英语进行了优化。82M参数意味着模型体积较小,推理速度快,非常适合在资源受限的环境(如普通个人电脑、笔记本甚至树莓派)上运行。

部署方式:基于容器的快速启动

部署Kokoro有多种方式,本文推荐的是最简单直接的一种:使用预先构建好的容器镜像Kokoro-FastAPI。这个镜像已经包含了预下载的语音模型,因此镜像体积较大,大约为5GB。使用Docker或Podman等容器工具,只需一行命令即可启动服务:

bash
podman run -p 8880:8880 ghcr.io/remsky/kokoro-fastapi-cpu

启动后,可以通过访问 localhost:8880/web 来打开一个简单的Web界面。在这个界面中,你可以输入文本,点击生成,浏览器会自动播放生成的音频。这对于快速验证服务是否正常运行非常方便。

API兼容性与编程接口

Kokoro-FastAPI 容器不仅提供了Web UI,还提供了一个与 OpenAI Speech API 兼容的TTS接口。这意味着任何已经基于OpenAI语音API开发的程序,都可以通过简单地修改API基础地址,无缝切换到本地的Kokoro服务。这极大地降低了集成门槛。

为了便于测试,作者在GitHub仓库 github.com/remotebrowser/speak 中提供了JavaScript和Python两种语言的示例代码。克隆该仓库后,可以按照以下方式使用:

JavaScript 示例

bash
export TTS_API_BASE_URL=http://127.0.0.1:8880/v1
./speak.js "Good morning! How are you today?"

Python 示例

bash
export TTS_API_BASE_URL=http://127.0.0.1:8880/v1
./speak.py "Good morning! How are you today?"

生成的音频文件会被保存为MP3格式。如果系统中安装了 SoX(Sound eXchange,一个命令行音频处理工具),音频还会自动播放。

语音选择与性能测试

你可以通过设置环境变量 TTS_VOICE 来选择不同的声音。例如:

bash
export TTS_API_BASE_URL=http://127.0.0.1:8880/v1
export TTS_VOICE=am_eric
./speak.js "Good morning! How are you today?"

所有可用的声音列表可以在Kokoro官方项目的Hugging Face页面上找到:huggingface.co/hexgrad/Kokoro-82M/blob/main/VOICES.md。

性能实测数据

作者使用 am_eric 声音,对一段测试文本(描述木星)进行了性能测试,记录了在不同CPU上的生成时间(取三次运行的最佳值):

  • Intel Core i7-4770K(2013年发布,距今约12年):4.7秒
  • Apple M2 Pro(2023年发布):4.5秒
  • AMD Ryzen 7 8745HS(2023年发布):1.5秒

这个测试结果非常具有说服力。i7-4770K是一款12年前的老款CPU,即便如此也能在不到5秒内完成一段较长文本的语音生成。这表明Kokoro对CPU的要求极低,几乎任何现代(甚至不太现代的)CPU都能胜任。而AMD Ryzen 7 8745HS的1.5秒成绩,则意味着几乎可以实时生成语音,体验非常流畅。

备选方案:Speaches

文章最后还提到了另一个与OpenAI API兼容的容器化TTS服务——Speaches (speaches.ai)。与Kokoro-FastAPI不同的是,Speaches的容器镜像没有预装语音权重文件,你需要通过其API显式地下载。

但Speaches有一个独特的优势:它集成了OpenAI著名的Whisper模型,这是一个高质量的语音转文本(STT)系统。如果你的应用同时需要TTS(文本转语音)和STT(语音转文本)功能,那么Speaches可以作为一个一体化的解决方案。

应用场景与总结

将这样的本地语音合成系统与本地LLM相结合,你可以实现一个完全在本地运行、保护隐私的语音助手。你可以“听”到LLM的回答,而不是费眼去阅读。这在驾驶、多任务处理或为视障人士提供辅助等方面具有巨大的实用价值。

Kokoro的出现,证明了高质量的TTS不再需要昂贵的GPU或云服务。它通过精巧的模型设计和高效的实现,让每一个普通用户都能在自己的电脑上,以极低的成本获得接近自然的语音体验,同时牢牢掌握自己的数据隐私。

原文链接:https://ariya.io/2026/03/local-cpu-friendly-high-quality-tts-text-to-speech-with-kokoro/

相似推荐
DeepSeek Harness Windows 安装保姆教学:一条 npx 命令跑起 Web UIMistral OCR:重新定义文档理解的OCR技术Claude Opus 4.8 深度解析:更诚实、更高效的 AI 协作新纪元Claude Opus 5 深度解析:半价逼近前沿智能的日常化模型Gemma 4:Google DeepMind 开源模型的最新里程碑DeepSeek-R1 深度解析:纯强化学习激发大模型推理能力,蒸馏小模型同样强悍
编写使用方法
Markdown 格式 · Ctrl+Enter 确定
0 字新建笔记
欢迎回来
登录你的墨穗笔记账户
忘记密码?
还没有账户?立即注册
创建账户
注册你的专属墨穗笔记
已有账户?去登录
找回密码
输入注册邮箱获取验证码
返回登录
请输入图片中的验证码以继续注册
加载中...
取消
新建收藏
手动添加你喜欢的内容
取消
编辑头像与昵称
上传新头像或修改你的显示昵称
支持 JPG/PNG,最大 2MB
取消

问题反馈

隐私提醒

取消
编辑工具
受控分享
为这篇笔记生成限时 / 带密码的临时链接
关闭