Pocket TTS:1 亿参数、CPU 上跑 6 倍实时,pip 装完就能配音
做一个有声内容项目,绕不开配音这一环。调 API 要钱,ElevenLabs 要钱,Azure 语音服务也要钱。如果有一个方案能本地跑、免费、效果还过得去,就省事很多——Pocket TTS 就是冲这个问题来的。
它是什么
Pocket TTS 是 Kyutai Labs 开源的语音合成工具,1 亿参数,专门为 CPU 优化。
官方 slogan:A TTS that fits in your CPU (and pocket).
不需要 GPU,不需要云端 API,不需要注册账号,装上就能用。
速度怎么样
实测在 MacBook Air M4 上,速度是实时音频的 6 倍,也就是生成 10 秒音频只需要不到 2 秒。
首字节延迟约 200 毫秒,音频流式输出,边生成边播放。
运行时只占用 2 个 CPU 核心,不会把机器跑满。
支持多少种语言
6 种:英语、法语、德语、葡萄牙语、意大利语、西班牙语。
每种语言都有多个预置音色可选,也可以上传一段 5 秒的音频做声音克隆:
pocket-tts export-voice ./my-voice.wav
pocket-tts generate --voice ./my-voice.wav "111222"
输入任意 wav 或 mp3 文件,提取声音特征,之后生成的音频就会用这个音色。
适合什么场景
- 本地应用配音:桌面应用、小程序、有声内容生成,不需要网络请求
- 隐私敏感场景:文本不上传,声音特征存在本地
- 开发阶段快速验证:不调 API、不等网络,直接本地跑
- 批量音频生成:速度快,支持超长文本输入
用起来有多简单
pip 安装:
pip install pocket-tts
一行命令生成音频:
pocket-tts generate --text "Hello world" --voice alba
或者起一个本地服务,在网页上交互式体验:
pocket-tts serve
# 打开 http://localhost:8000
老实说
对比 ElevenLabs、Azure 这类商用 TTS,Pocket TTS 在音色自然度上还有差距。它解决的是「有没有」的问题,而不是「效果是否顶级」的问题。
另外目前没有中文支持,想做中文配音的话暂时用不上。
小结
Pocket TTS 把语音合成做成了一行 pip 命令就能装的东西:免费、本地运行、CPU 就能跑、支持声音克隆。对于需要配音但不想折腾 API 和费用的开发者,是一个值得一试的起点。
GitHub: