程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
TTS 相关技术文章
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
电子书转有声书:Abogen 本地 TTS,EPUB/PDF 转带字幕音频
综合
电子书转有声书:Abogen 本地 TTS,EPUB/PDF 转带字幕音频
2026-09-12 22:03:31
Abogen 是用 Python 写的桌面级本地 TTS 工具,把 EPUB/PDF/Markdown/TXT 转成带时间同步字幕的音频,全程离线、MIT 开源。基于 Kokoro-82M 提供 66+ 语音,支持字幕生成、音色混合、批量队列和 CUDA/MPS/ROCm 加速,附三种安装方式与对比。
TTS
开源工具
本地部署
Python
有声书
FireRedAudio 开源:小红书把音频理解和生成塞进同一个 9B 模型,六项能力全榜单第一
资讯
FireRedAudio 开源:小红书把音频理解和生成塞进同一个 9B 模型,六项能力全榜单第一
2026-09-12 09:57:11
FireRedAudio 是小红书超级智能团队开源的统一音频语言模型:9B LLM 骨架配 Audio Encoder(理解)与 RedAE(生成)双通路,一个模型同时支持 ASR、音频理解问答(MMAU 82.0/MMSU 83.3 双第一)、1 小时长录音结构化分析、零样本声音克隆(Seed-ZH CER 0.83%)、自然语言声音设计与语义/声学级语音编辑;论文 arXiv 2608.24168,HuggingFace/ModelScope 均可下载。
FireRedAudio
音频大模型
语音识别
TTS
小红书
ViiTorVoice 开源:国产 TTS 登顶 Seed-TTS 全球第一,首创像改 Word 一样局部编辑语音
资讯
ViiTorVoice 开源:国产 TTS 登顶 Seed-TTS 全球第一,首创像改 Word 一样局部编辑语音
2026-09-12 09:54:19
ViiTorVoice-NAR 是国产非自回归语音生成系统:中文词错率 0.99 登顶 Seed-TTS 评测成全球首个突破 1.0 的模型;首创无参考文本跨语种克隆(给段声音即可生成任意内容)与片段级局部编辑(像改 Word 一样替换词句,前后过渡天衣无缝);支持情感标签副语言控制,端到端首帧约 60ms,推理速度 40 倍实时。
ViiTorVoice
语音合成
TTS
声音克隆
国产AI
Pocket TTS:1 亿参数、CPU 上跑 6 倍实时,pip 装完就能配音
编程
Pocket TTS:1 亿参数、CPU 上跑 6 倍实时,pip 装完就能配音
2026-09-11 23:34:38
Kyutai Labs 开源的 Pocket TTS 为 CPU 优化,1 亿参数、无需 GPU 与 API,实测速度达实时 6 倍,支持声音克隆与 6 种语言,一行 pip 命令即可本地配音。
TTS
语音合成
开源工具
CPU
Kyutai
语音克隆不用上云:Voicebox本地工作站集成7个TTS引擎
编程
语音克隆不用上云:Voicebox本地工作站集成7个TTS引擎
2026-09-05 19:14:48
介绍 Voicebox 这个完全本地运行的语音克隆工作站:集成 Qwen3-TTS、LuxTTS、Chatterbox、TADA、Kokoro 等 7 个 TTS 引擎,带多轨道时间轴编辑器和 8 种后处理效果,支持声音档案克隆、REST API,数据全程不出设备,GitHub 已获 21K Star。
Voicebox
语音克隆
TTS
本地运行
Qwen3-TTS
多轨编辑
VoxClaw:给AI Agent加语音输出的开源工具,Mac菜单栏应用支持局域网远程播报
编程
VoxClaw:给AI Agent加语音输出的开源工具,Mac菜单栏应用支持局域网远程播报
2026-09-05 18:58:51
介绍VoxClaw这个刚开源的工具,为OpenClaw等AI Agent增加语音输出层,解决AI执行完任务后反馈不直观的痛点。它在Mac上以菜单栏应用运行,也可当CLI工具使用,支持朗读文本、管道接收终端输出和局域网POST远程播报,提供Apple/OpenAI/ElevenLabs三种语音引擎,目前仅支持macOS。
VoxClaw
AI Agent
语音输出
TTS
Mac工具
Piper:离线中文 TTS 的轻量选项
代码
Piper:离线中文 TTS 的轻量选项
2026-08-30 19:24:04
树莓派/低算力设备上本地运行的中文神经 TTS 方案:安装步骤、模型选择、CPU 实时推理与适用边界,以及和云端/其他本地 TTS 的取舍。
Piper
TTS
离线语音
树莓派
语音合成
VoxCPM 深度拆解:当无分词器遇见扩散自回归——从 MiniCPM-4 到零样本声音克隆的 TTS 架构革命(2026)
编程
VoxCPM 深度拆解:当无分词器遇见扩散自回归——从 MiniCPM-4 到零样本声音克隆的 TTS 架构革命(2026)
2026-08-14 12:15:05
深度拆解 VoxCPM 无分词器 TTS 系统:从 MiniCPM-4 基座到扩散自回归架构,从零样本声音克隆到 30 种语言支持,配完整代码实战与 15 条生产踩坑清单。
VoxCPM
TTS
语音合成
开源
AI
MiniCPM
声音克隆
扩散模型
多语言
VoxCPM2 深度拆解:当语音合成决定杀死分词器——从 Tokenizer-Free 架构到 48kHz 高保真克隆的全链路工程革命
编程
VoxCPM2 深度拆解:当语音合成决定杀死分词器——从 Tokenizer-Free 架构到 48kHz 高保真克隆的全链路工程革命
2026-08-12 02:14:35
深度拆解OpenBMB开源VoxCPM2无分词器TTS系统:扩散自回归架构、AudioVAE V2非对称编解码、Voice Design音色创造、Controllable Cloning可控克隆、48kHz高保真输出、RTF 0.13实时部署、Nano-vLLM/vLLM-Omni生产实践、30条踩坑清单
VoxCPM2
TTS
语音合成
Tokenizer-Free
扩散模型
Voice Design
声音克隆
AudioVAE
多语言TTS
开源AI
VibeVoice 深度拆解:当微软决定「开源语音 AI 的全部武器库」——从 7.5Hz 连续语音 Tokenizer 到多说话人对话生成,一个 27K Star 的开源模型家族如何重新定义文本转语音的终极形态
编程
VibeVoice 深度拆解:当微软决定「开源语音 AI 的全部武器库」——从 7.5Hz 连续语音 Tokenizer 到多说话人对话生成,一个 27K Star 的开源模型家族如何重新定义文本转语音的终极形态
2026-08-05 06:43:20
深度拆解微软开源语音AI模型家族VibeVoice:7.5Hz连续语音Tokenizer、多说话人对话生成、90分钟长音频处理、300ms实时TTS,MIT协议本地部署,27K Star背后的架构设计与代码实战指南
VibeVoice
微软
TTS
语音合成
多说话人
开源
AI
文本转语音
扩散模型
Tokenizer
语音智能体流水线深度拆解:VAD→STT→LLM→TTS 四级管线如何用开源模型复刻 OpenAI Realtime
编程
语音智能体流水线深度拆解:VAD→STT→LLM→TTS 四级管线如何用开源模型复刻 OpenAI Realtime
2026-08-01 09:43:09
深度拆解 huggingface/speech-to-speech 本地语音智能体:VAD→STT→LLM→TTS 四级流水线架构、OpenAI Realtime 兼容协议、打断处理与延迟优化实战
语音智能体
speech-to-speech
VAD
STT
TTS
OpenAI Realtime
WebSocket
本地部署
AI Agent
流式处理
VoxCPM 深度解剖:扔掉离散 Token 的 TTS——0.5B 小模型如何用「扩散自回归」在连续语音空间里造出真人级声音
编程
VoxCPM 深度解剖:扔掉离散 Token 的 TTS——0.5B 小模型如何用「扩散自回归」在连续语音空间里造出真人级声音
2026-07-26 05:14:43
VoxCPM 深度拆解:OpenBMB 与清华 THUHCSI 联手,扔掉离散语音 token,用端到端扩散自回归在连续语音空间建模。0.5B 参数、RTF 0.17、消费级显卡实时跑,零样本克隆真人音色与情绪。含 LocEnc、层级语义-声学 LM、FSQ 解耦、扩散解码头原理与代码实战、性能优化与选型建议。
VoxCPM
TTS
语音合成
扩散模型
自回归
MiniCPM
OpenBMB
声音克隆
Tokenizer-Free
开源
微软 VibeVoice-Realtime-0.5B 深度拆解:300ms 首包延迟的实时 TTS,凭什么用 0.5B 参数「边想边说」
编程
微软 VibeVoice-Realtime-0.5B 深度拆解:300ms 首包延迟的实时 TTS,凭什么用 0.5B 参数「边想边说」
2026-07-24 03:13:10
深度拆解微软刚开源的 VibeVoice-Realtime-0.5B:7.5Hz 双 Tokenizer、next-token diffusion、交错窗口流式架构如何做到 300ms 首包延迟,配 LLM 边想边说管线、WebSocket 服务化与延迟调优实战。
VibeVoice
TTS
语音合成
微软
实时语音
扩散模型
流式生成
开源
Qwen2.5
AI语音
MoneyPrinterTurbo 深度拆解:一个关键词如何端到端跑出一条高清短视频——AI 视频生成流水线的工程内幕
编程
MoneyPrinterTurbo 深度拆解:一个关键词如何端到端跑出一条高清短视频——AI 视频生成流水线的工程内幕
2026-07-14 19:41:50
从 LLM 脚本、Pexels 素材检索、Edge TTS 配音、字幕生成到 FFmpeg 合成,深度拆解 MoneyPrinterTurbo 的端到端 AI 视频生成流水线架构,并附可运行核心代码与规模化性能优化。
MoneyPrinterTurbo
AI视频生成
短视频自动化
FFmpeg
LLM
TTS
Python
内容创作
VoxCPM 深度实战:当 TTS 告别分词器——零样本语音克隆与扩散模型如何重构语音合成范式
编程
VoxCPM 深度实战:当 TTS 告别分词器——零样本语音克隆与扩散模型如何重构语音合成范式
2026-07-14 14:17:19
VoxCPM 无分词器 TTS 深度实战:从扩散模型架构、上下文感知生成、零样本语音克隆到完整部署,一次讲透 Tokenizer-Free TTS 技术革命
VoxCPM
TTS
语音合成
扩散模型
零样本克隆
OpenBMB
Tokenizer-Free
语音克隆
AI音频
多语言TTS
CyberVerse:开源实时视频通话数字人平台,一张照片让 AI 活过来
编程
CyberVerse:开源实时视频通话数字人平台,一张照片让 AI 活过来
2026-07-14 11:47:44
CyberVerse是开源数字人Agent平台(GPL-3.0),上传一张照片生成实时视频通话数字人,WebRTC低延迟+语音打断+Agent工具调用/RAG/多Agent协作,支持GPT-4o/Qwen/DeepSeek+FlashHead/LiveAct,无需3D建模,RTX 4090即可运行。
数字人
CyberVerse
实时视频
AI Agent
WebRTC
开源
TTS
ASR
多模态
数字永生
微软VibeVoice深度解析:7.5Hz超低帧率+Next-Token Diffusion如何让AI一口气说90分钟——从TTS-1.5B到ASR-7B的语音AI全家桶实战指南
编程
微软VibeVoice深度解析:7.5Hz超低帧率+Next-Token Diffusion如何让AI一口气说90分钟——从TTS-1.5B到ASR-7B的语音AI全家桶实战指南
2026-07-06 04:43:23
深度解析微软开源VibeVoice语音AI全家桶:7.5Hz超低帧率连续分词器+Next-Token Diffusion框架,TTS-1.5B单次生成90分钟4人对话,ASR-7B单次转录60分钟会议,Realtime-0.5B实现300ms实时响应。含完整代码实战与生产部署指南。
VibeVoice
微软
TTS
语音合成
ASR
开源
Next-Token Diffusion
语音AI
开源封神!网易有道全新TTS太强了!3秒克隆、14种语言无口音、免费商用
代码
开源封神!网易有道全新TTS太强了!3秒克隆、14种语言无口音、免费商用
2026-07-02 13:34:35
网易有道开源Confucius4-TTS,支持3秒极速克隆音色(相似度85%,准确率97%)、14种语言无口音跨语种配音、情绪精准复刻、54GB本地离线部署,Apache开源协议免费商用。
AI
TTS
语音合成
开源
网易有道
语音克隆
多语言
数字人
配音
AI驱动的智能客服呼叫中心系统SmartCall,让每一通电话都被智慧对待
代码
AI驱动的智能客服呼叫中心系统SmartCall,让每一通电话都被智慧对待
2026-07-02 13:27:29
SmartCall是一套基于AI大模型+Asterisk的智能客服呼叫中心系统,支持AI智能应答、IVR流程编排、批量外呼、坐席管理,采用Apache-2.0开源协议。
AI
开源
智能客服
呼叫中心
Asterisk
IVR
ASR
TTS
外呼
Apache
万字深度解析 VibeVoice:当微软开源遇见90分钟连续语音合成——从7.5Hz连续编码器到长篇有声书自动配音的完整技术指南(2026)
编程
万字深度解析 VibeVoice:当微软开源遇见90分钟连续语音合成——从7.5Hz连续编码器到长篇有声书自动配音的完整技术指南(2026)
2026-07-02 11:14:52
深度解析微软2026年开源的VibeVoice语音合成系统:15亿参数、90+分钟连续生成、7.5Hz连续语音编码器、50+预训练音色、8种语言支持,含完整代码实战。
VibeVoice
微软
语音AI
TTS
语音合成
7.5Hz编码器
开源
有声书
深度学习
万字深度解析 MoneyPrinterTurbo:当 LLM 遇见视频自动化——从 5 步 Pipeline 到 100+ 模型接入的生产级实战(2026)
编程
万字深度解析 MoneyPrinterTurbo:当 LLM 遇见视频自动化——从 5 步 Pipeline 到 100+ 模型接入的生产级实战(2026)
2026-07-01 10:45:38
深度解析MoneyPrinterTurbo开源项目:AI全自动短视频生成框架,涵盖5步Pipeline、100+LLM模型接入、9种TTS方案、FFmpeg视频合成与性能优化实战(2026)
MoneyPrinterTurbo
AI视频
LLM
视频自动化
短视频
开源项目
Python
FFmpeg
TTS
LiteLLM
万字深度解析 Microsoft VibeVoice:当开源遇上前沿语音AI——从 TTS 到 ASR 的全栈语音合成与识别技术革命(2026)
编程
万字深度解析 Microsoft VibeVoice:当开源遇上前沿语音AI——从 TTS 到 ASR 的全栈语音合成与识别技术革命(2026)
2026-07-01 04:12:36
2026年Microsoft Research开源VibeVoice,支持90分钟TTS连续生成、60分钟ASR单次处理。深度解析Next-Token Diffusion架构、7.5Hz超低频Tokenizer、多说话人建模与vLLM推理加速。
VibeVoice
Microsoft
TTS
ASR
语音AI
开源
Next-Token Diffusion
LLM
Diffusion
VibeVoice 深度实战:当微软把「超长对话语音」开源——从 7.5Hz 连续分词到 Next-Token Diffusion、从 90 分钟 TTS 到 60 分钟 ASR 的生产级完全指南(2026)
编程
VibeVoice 深度实战:当微软把「超长对话语音」开源——从 7.5Hz 连续分词到 Next-Token Diffusion、从 90 分钟 TTS 到 60 分钟 ASR 的生产级完全指南(2026)
2026-06-21 05:52:51
深度解析微软开源语音AI项目VibeVoice:从7.5Hz连续分词器到Next-Token Diffusion架构,从90分钟TTS到60分钟ASR的生产级完全指南。
VibeVoice
语音AI
微软开源
TTS
ASR
扩散模型
LLM
VibeVoice 深度实战:当 TTS 遇见扩散模型与 LLM——从 3200 倍压缩到 90 分钟多人对话的生产级完全指南(2026)
编程
VibeVoice 深度实战:当 TTS 遇见扩散模型与 LLM——从 3200 倍压缩到 90 分钟多人对话的生产级完全指南(2026)
2026-06-16 02:16:25
微软VibeVoice深度解析:基于LLM与扩散模型融合的TTS系统,支持90分钟多人对话,3200倍压缩率,300ms流式延迟,完整实战指南。
语音AI
TTS
微软开源
扩散模型
大语言模型
音频生成
实时语音
多人对话
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
python
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调
上一页
1
2
下一页
共 2 页
到第
页
确定