资讯 SmartSub(妙幕)开源:字幕生成翻译配音一条龙,6 大转写引擎 100% 本地处理

2026-09-12 09:55:56

SmartSub(妙幕)开源:字幕生成翻译配音一条龙,6 大转写引擎 100% 本地处理

今天介绍一个开源工具:SmartSub,中文名"妙幕",是由开发者buxuku创建的开源 AI 字幕生成与多语言翻译桌面应用。

它的定位非常清晰:一站式解决音视频字幕从生成到翻译到合成的全流程
项目的起源可以追溯到作者之前开发的命令行工具 VideoSubtitleGenerator。这个工具虽然功能扎实,但每次使用都得敲命令、调参数,流程割裂。随着 Whisper 模型的火爆和 AI 翻译能力的成熟,作者决定将这些能力整合进一个"傻瓜式"的桌面应用里,让字幕生成和翻译变得像拖拽文件一样简单。
目前,SmartSub 已在 GitHub 上收获了超过4.5k Star,版本迭代非常活跃——从最初的 v1.x 到现在的 v3.7.0,几乎每月都有更新。

最新版本不仅在字幕生成精度上持续优化,还扩展了配音、说话人识别、在线视频下载等功能,正在从一个"字幕工具"进化为"音视频本地化处理平台"。

核心亮点

🔥 亮点一:6 大转写引擎

SmartSub 内置了 6 种语音转写引擎:
whisper.cpp:C++ 重写版 Whisper,纯本地、高性能
faster-whisper:基于 CTranslate2 优化,速度更快
FunASR:阿里达摩院开源,中文识别精度出色
Qwen3-ASR:通义万相系列,v3.7.0 刚加入的新引擎
FireRedASR:轻量级选项
本地 Whisper CLI:如果你已经安装了 Whisper,可以直接调用
不同引擎各有所长:whisper.cpp 兼容性好,FunASR 对中文支持更优,Qwen3-ASR 在长语音识别中表现稳定。
用户可以根据自己的需求和硬件条件自由选择,也可以全部下载后逐一测试。

🌍 亮点二:多种翻译引擎接入

它几乎接入了市面上所有主流翻译服务:
传统翻译 API:百度翻译、火山引擎翻译、微软翻译器、DeepLX
AI 翻译引擎:Ollama(本地模型)、Deepseek、Azure OpenAI、DeerAPI、Gemini、SiliconFlow、通义千问、豆包、小牛、腾讯、讯飞……
更贴心的是,它支持自定义参数配置:不用改代码,直接在界面上就能调整模型参数、自定义 HTTP 头和请求体、实时验证配置,还能导出导入配置方便团队共享。
双语字幕也是它的一大杀招。勾选"双语字幕"选项,就能导出原文+译文对照的字幕文件,看外语片时体验直接拉满。

🔒 亮点三:100% 本地化处理

很多在线字幕工具要求你把视频上传到云端,不仅有隐私泄露的风险,对于动辄几个 G 的原始视频,上传本身就很耗时。
SmartSub 的所有计算都在你本地电脑上完成——语音识别在本地跑模型,翻译要么调本地的 Ollama,要么调 API,但视频文件本身绝不会离开你的硬盘。

⚡ 亮点四:硬件加速

SmartSub 支持两大硬件加速方案:
NVIDIA CUDA(Windows/Linux):应用内置了 GPU 加速包管理器,会自动检测你的显卡型号,推荐合适的 CUDA 版本(11.8.0 / 12.2.0 / 12.4.0 / 13.0.2),一键下载即可启用,不需要手动安装 CUDA Toolkit。
Apple Core ML(macOS M 系列芯片):从 v1.20.0 开始支持,M 系列芯片用户下载 arm64 版本即可自动启用 Core ML 加速,识别速度显著提升。

✏️ 亮点五:可视化校对

语音识别再准,也难免出现专有名词错误。SmartSub 内置了可视化校对面板
• 播放视频的同时,字幕行自动同步定位
• 逐行修改文字、调整时间轴
• 支持 AI 自动优化,一键批量修正
• 新增 AI 字幕精修功能,语言转写更可控
• 支持参考文稿导入,高置信度匹配原稿对齐修正
这比用文本编辑器改字幕体验好太多了——相当于给你一个迷你版的 PR 界面,改完一处立即看到效果。

🎬 亮点六:字幕合成与配音一条龙

支持AI 配音与声音克隆,v3.7.0 进一步支持多角色配音和说话人识别:
• 支持为字幕生成配音音轨
• 声音克隆:上传一小段参考音频即可克隆音色
• 说话人识别:自动区分不同发言者并标注角色
• 按角色批量分配音色,单句也可单独覆盖
加上字幕烧录功能——支持硬字幕(直接烧录进画面)和软字幕(封装在容器内)两种方式,可以调整字体、字号、颜色,所见即所得。
还有隐藏彩蛋:内置在线视频下载器,粘贴 YTb 或 B站 链接,就能自动拉取源视频,不用再单独找下载工具了。

快速上手指南

第一步:下载安装

SmartSub 提供了多种安装方式:
方式一:Homebrew(macOS 推荐)

brew tap buxuku/smartsub
brew install --cask smartsub

方式二:直接下载安装包
前往 GitHub Releases[1]页面,根据你的系统选择对应版本:

系统芯片显卡推荐版本
Windowsx64CUDA >= 11.8windows-x64-cuda通用版
Windowsx64无 N 卡windows-x64-generic
macOSApple Silicon (M1/M2/M3)-mac-arm64 (自动启用 Core ML)
macOSIntel-mac-x64
Linuxx64CUDAlinux-x64-cuda版本
关于 macOS "应用已损坏"提示:如果首次打开时出现警告,在终端执行以下命令即可:
sudo xattr -dr com.apple.quarantine /Applications/SmartSub.app

第二步:下载模型

首次启动后,应用会引导你下载语音识别模型。建议选择:
M 系列芯片 + 64GB 内存:large-v3-turbo 或 large 模型
M 系列芯片 + 32GB 内存:medium 或 small 模型
Windows 无 N 卡:small 或 base 模型
Windows 有 N 卡:large-v3-turbo 模型
如果模型下载失败,可以:

  1. 切换到"引擎与模型"页面
  2. 选择国内镜像源下载
  3. 或者手动下载模型文件,在"导入模型"处导入

第三步:配置翻译服务

打开"设置 → 翻译服务",选择你喜欢的翻译引擎:
推荐配置方案
1.追求免费+本地:选择 Ollama,本地跑一个 LLM 模型即可,完全免费且隐私安全
2.追求质量+速度:选择 Deepseek 或 DeerAPI,注册获取 API Key,翻译质量高
3.追求稳定+低成本:选择百度翻译或火山引擎翻译,按调用量计费,稳定可靠
API Key 获取
• 百度翻译:访问 https://fanyi-api.baidu.com/ 注册
• 火山引擎:访问 https://console.volcengine.com/ 注册
• Deepseek:访问 https://platform.deepseek.com/ 注册

第四步:开始使用

选择任务类型,拖入文件,设置参数,点击"开始任务"——就是这么简单。

写在最后

SmartSub 的价值在于,它把原本分散在多个工具、多个平台、甚至需要付费才能完成的字幕工作流——音视频转字幕 → 翻译 → 校对 → 合成 → 导出——全部整合到了一个本地运行的开源桌面应用中。
SmartSub(妙幕),让每一帧画面都能美妙地表达。
项目地址:https://github.com/buxuku/SmartSub

引用链接

[1]GitHub Releases:https://github.com/buxuku/SmartSub/releases

复制全文 生成海报 SmartSub 字幕工具 AI字幕 配音 本地化

推荐文章

程序员茄子在线接单