编程 Pocket TTS:1 亿参数、CPU 上跑 6 倍实时,pip 装完就能配音

2026-09-11 23:34:38

Pocket TTS:1 亿参数、CPU 上跑 6 倍实时,pip 装完就能配音

做一个有声内容项目,绕不开配音这一环。调 API 要钱,ElevenLabs 要钱,Azure 语音服务也要钱。如果有一个方案能本地跑、免费、效果还过得去,就省事很多——Pocket TTS 就是冲这个问题来的。

它是什么

Pocket TTS 是 Kyutai Labs 开源的语音合成工具,1 亿参数,专门为 CPU 优化。

官方 slogan:A TTS that fits in your CPU (and pocket).

不需要 GPU,不需要云端 API,不需要注册账号,装上就能用。

速度怎么样

实测在 MacBook Air M4 上,速度是实时音频的 6 倍,也就是生成 10 秒音频只需要不到 2 秒。

首字节延迟约 200 毫秒,音频流式输出,边生成边播放。

运行时只占用 2 个 CPU 核心,不会把机器跑满。

支持多少种语言

6 种:英语、法语、德语、葡萄牙语、意大利语、西班牙语。

每种语言都有多个预置音色可选,也可以上传一段 5 秒的音频做声音克隆:

pocket-tts export-voice ./my-voice.wav
pocket-tts generate --voice ./my-voice.wav "111222"

输入任意 wav 或 mp3 文件,提取声音特征,之后生成的音频就会用这个音色。

适合什么场景

  • 本地应用配音:桌面应用、小程序、有声内容生成,不需要网络请求
  • 隐私敏感场景:文本不上传,声音特征存在本地
  • 开发阶段快速验证:不调 API、不等网络,直接本地跑
  • 批量音频生成:速度快,支持超长文本输入

用起来有多简单

pip 安装:

pip install pocket-tts

一行命令生成音频:

pocket-tts generate --text "Hello world" --voice alba

或者起一个本地服务,在网页上交互式体验:

pocket-tts serve
# 打开 http://localhost:8000

老实说

对比 ElevenLabs、Azure 这类商用 TTS,Pocket TTS 在音色自然度上还有差距。它解决的是「有没有」的问题,而不是「效果是否顶级」的问题。

另外目前没有中文支持,想做中文配音的话暂时用不上。

小结

Pocket TTS 把语音合成做成了一行 pip 命令就能装的东西:免费、本地运行、CPU 就能跑、支持声音克隆。对于需要配音但不想折腾 API 和费用的开发者,是一个值得一试的起点。

GitHub:

复制全文 生成海报 TTS 语音合成 开源工具 CPU Kyutai

推荐文章

程序员茄子在线接单