阿里开源 Fun-CineForge:会看视频的 AI 配音模型,口型同步、多人对话自然切换
之前刷视频的时候发现一件有意思的事,很多国外电影被配成中文后,要么声音和画面对不上,要么角色音色千篇一律,要么多人对话时混乱得像一锅粥。
这让我想起以前看港剧的国语配音,那些专业配音演员分饰多角,声音切换自然,口型还精准得吓人。
那种高质量的配音体验,现在的AI技术能复制吗?
就在前几天,阿里的通义实验室语音团队联合中科大发布了一款全新的多模态电影配音模型——Fun-CineForge。
这不是那种简单的文字转语音工具,它是真正能看懂视频、识别角色、理解时间线的智能配音系统。
用官方的话说,这是"一个统一的数据集流水线和零样本电影配音模型"。
更厉害的是,他们不仅开源了模型,还构建了首个大规模中文电视剧配音数据集 CineDub-CN,包含了丰富的场景和标注。
从独白、旁白,到多人对话的复杂场景,这个模型都能游刃有余地处理。
以下为挑选的DEMO示例:
项目介绍
Fun-CineForge来自阿里的FunAudioLLM团队,这是通义实验室语音团队主导开发的一个开源项目。
简单来说,它是一个端到端的电影配音解决方案,包含两个核心部分:数据集流水线和MLLM(多模态大语言模型)配音模型。
在传统的配音流程中,你需要先把视频切成片段,识别说话人,生成语音,然后再合成回去,每一步都容易出错。
但Fun-CineForge把这些全都整合了,形成了一个完整的流水线。它不仅能处理中文视频,最新的更新还支持了英文视频,功能越来越完善。
根据官方公布的数据,在独白、旁白、对话、多人说话等各种场景下,Fun-CineForge在音质、口型同步、音色转换、指令遵循等多个维度,都超过了当前最先进的方法。
核心亮点
•真正的视频理解能力:它不只是"听"和"说",还能"看"视频。它能理解画面内容,知道谁在什么时候张嘴,谁在说话。
•时间模态,精准对齐:它有强大的时间模态能力,给AI加上了"时间感"。它能精确知道谁在什么时候说话,完美解决了多人同时说话或快速切换说话者的对齐问题。
•多角色自然切换:支持多角色对话,能在多个角色声音间自然切换,就像真人配音演员分饰多角的效果一样。
•覆盖各种电影场景:从独白到旁白,从两人对话到多人讨论,Fun-CineForge都能处理。不管是电影、电视剧还是短视频,只要你想给视频配音,这个工具都能用得上。
使用步骤
Fun-CineForge最厉害的地方之一,就是它完整的数据集流水线。你可以用这个流水线自己制作大规模的配音数据集。让我们看看它的具体步骤:
第一步:标准化和裁剪
首先是标准化视频格式和文件名,然后裁剪长视频的开头和结尾(默认各剪10秒),最后从裁剪后的视频中提取音频。
python normalize_trim.py --root datasets/raw_zh --intro 10 --outro 10
第二步:语音分离
接下来是语音分离,把人声和背景音乐/音效分开。这一步很重要,能大大提高后续处理的质量。
cd speech_separation
python run.py --root datasets/clean/zh --gpus 0 1 2 3
第三步:视频剪辑
然后用VideoClipper获取句子级别的字幕文件,并根据时间戳把长视频剪辑成片段。现在这个工具已经支持中英文双语了。中文可以用CPU,英文建议用GPU加速。
cd video_clip
bash run.sh --stage 1 --stop_stage 2 --input datasets/raw_zh --output datasets/clean/zh --lang zh --device cpu
之后还要进行视频时长限制和清理检查:
python clean_video.py --root datasets/clean/zh
python clean_srt.py --root datasets/clean/zh --lang zh
第四步:说话人分辩
这一步是多模态活跃说话人识别,生成RTTM文件,识别说话人的面部帧,提取帧级别的说话人面部和嘴唇原始数据。
cd speaker_diarization
bash run.sh --stage 1 --stop_stage 4 --hf_access_token hf_xxx --root datasets/clean/zh --gpus "0 1 2 3"
第五步:多模态CoT修正
这一步是最有意思的,基于通用的多模态大语言模型,用音频、ASR文本和RTTM文件作为输入,利用思维链(CoT)推理提取线索,修正专业模型的结果。
它还会标注角色的年龄、性别和音色。
实验结果显示,这个策略把字符错误率(CER)从4.53%降到了0.94%,说话人分辩错误率从8.38%降到了1.20%,质量堪比甚至优于人工转录!
而且还支持断点续传,防止重复推理浪费资源。
python cot.py --root_dir datasets/clean/zh --lang zh --provider google --model gemini-3-pro-preview --api_key xxx --resume
python cot.py --root_dir datasets/clean/en --lang en --provider google --model gemini-3-pro-preview --api_key xxx --resume
python build_datasets.py --root_zh datasets/clean/zh --root_en datasets/clean/en --out_dir datasets/clean --save
写在最后
Fun-CineForge 的开源,让我们看到了AI在影视制作领域的巨大潜力。
它不仅让专业配音变得更容易,也让普通人有机会给视频配上高质量的音频。
更重要的是,这个项目是完全开源的,还有完整的数据集流水线。这意味着开发者可以在这个基础上做更多创新,研究者可以用它来训练更好的模型。
如果你对视频配音、多模态AI或者语音合成感兴趣,一定要去看看这个项目。你可以访问他们的演示网站查看样本,也可以直接克隆代码自己体验。
GitHub地址:https://github.com/FunAudioLLM/FunCineForge
Hugging Face:https://huggingface.co/FunAudioLLM/Fun-CineForge
演示网站:https://funcineforge.github.io/