video-ai-talking:输入不说话的人脸视频,自动配音对口型并合成竖屏 MP4
一句话用法:准备一段真人出镜、不说话的素材,脸清楚就行;再写好文案,项目会完成 AI 配音、对口型,最后合成竖屏 MP4。API Key 只存在浏览器本地,不会上传到作者服务器。
项目地址:yizhi-chengzi/video-ai-talking

功能特性
- 本地运行,任务 JSON、音频、中间片、成片都存放在本机
data/目录 - 支持两家 AI 配音:阿里百炼 CosyVoice、火山引擎语音合成,二选一
- 对口型使用阿里百炼 VideoRetalk,参考视频要求正面近景、人脸清晰
- 可插入视频素材替换某一句话的画面,也支持加 BGM
- 文案可手写,也可接 DeepSeek 自动生成
- 多套字幕皮肤可选,控制标题和字幕是否显示
- 生成链路:配音 → 对口型 → FFmpeg 合成竖屏成片
- 修改后重新生成时,若参考视频、文案、音色都没变,会跳过对口型,直接重跑 FFmpeg
- 支持 mock 模式(
VAT_MOCK=1),不调用真实接口,方便本地验证
部署方式
需要 Node.js 20+,本机装好 FFmpeg 和 ffprobe,并能直接命令行调用。然后依次执行:
git clone https://github.com/yizhi-chengzi/video-ai-talking.git
cd video-ai-talking
cp .env.example .env
npm install
npm run dev
浏览器打开 http://127.0.0.1:5175。如果已经构建过,用 npm run build && npm start,端口是 8789。
使用前需要申请几个 Key:百炼 VideoRetalk Key(对口型必填)、百炼 CosyVoice 或火山引擎的配音凭证(二选一)、DeepSeek Key(文案自动生成,可选)。都在页面「配置」里填,测通后再用。Linux 桌面端如果文件选择器点不开,装个 zenity,或者直接把文件拖进页面。