FireRedAudio 开源:小红书把音频理解和生成塞进同一个 9B 模型,六项能力全榜单第一
小红书 FireRed 团队最新开源FireRedAudio。它把音频理解和语音生成,塞进同一个模型里。
是真·一个模型,既能"听懂",又能"说出"。
项目简介
FireRedAudio 是小红书Super Intelligence(超级智能)团队开源的通用音频语言模型。
9B 参数的 LLM 骨架,配了两条独立的音频输入通路——理解用 Audio Encoder,生成用 RedAE。
技术论文已经挂在了 arXiv(编号 2608.24168),Demo 页面也有,直接能体验。
这不是 FireRed 团队第一次开源音频模型了。
之前他们已经放出过 FireRedASR2S(普通话字错率 2.89%、支持 20+ 方言的语音识别)、FireRedTTS3(24 种语言 + 21 种中文方言的零样本克隆),以及 FireRedChat(全双工语音交互)。
FireRedAudio 是这个系列里的"集大成者"——把之前分散的能力收进一个统一框架。
核心设计:解耦连续表示
论文摘要里有一句话我印象特别深:"To the best of our knowledge, it is the first publicly disclosed unified audio-language model to provide separate continuous input representations for understanding and generation within a single trainable autoregressive LLM."
翻译过来就是:我们可能是第一个公开披露的、在同一个可训练自回归 LLM 里给理解和生成分配独立连续表示的统一音频语言模型。
具体怎么做的?
•理解通路:输入音频 → Audio Encoder → 12.5 Hz 感知表示 → LLM 理解。这条路径的特征经过精心压缩,适合长录音的语义分析。
•生成通路:输入音频 → RedAE(一个带语义蒸馏的自编码器) → 连续声学 latent → LLM 条件生成 → Flow-Matching DiT 解码成 24 kHz 波形。这条路径保留了重建所需的全部细节。
两条路喂给同一个 9B LLM,共享语言和推理能力,但输入表示各自优化。这就解决了之前说的那个"既要又要"的矛盾。
一个模型,覆盖六件事
FireRedAudio 不是"做一件事做到极致",而是"一件事都能做"。它同时支持:
1.ASR 语音识别:支持多种语言,FLEURS-102 多语言平均字错率 14.94%,超过 Qwen3-Omni-30B
2.音频理解与问答:MMAU 测试集 82.0 分、MMSU 83.3 分,两个榜单都是第一
3.长录音结构化分析:支持最长 1 小时录音,输出带时间戳的结构化内容,秒级时间对齐
4.Zero-Shot TTS 声音克隆:一段参考音频 + 一段文本,Seed-ZH CER 0.83%、相似度 0.74,中文零样本克隆领先
5.Instruct TTS 声音设计:用自然语言描述音色——"女性高音区的清亮音色,青年特质,语速略快,带急切情感"——直接出全新声音
6.语音编辑:语义级(删除/插入/替换内容)+ 声学级(调音调速调音量),Ming-Freeform-Audio-Edit 数据集上全面碾压 Ming-UniAudio-Edit
快速上手
# 克隆仓库
git clone https://github.com/FireRedTeam/FireRedAudio.git
cd FireRedAudio
# 用 uv 同步依赖(注意:会编译 causal-conv1d 和 flash-attn,需要 CUDA 环境)
uv sync --extra accel --extra accel-build --group tools
下载模型权重
两种方式,任选其一:
# 方式一:从 HuggingFace 下载(推荐)
uv run hf download FireRedTeam/FireRedAudio --local-dir pretrained_models/
# 方式二:从 ModelScope 下载(国内更快)
uv pip install modelscope
uv run modelscope download --model FireRedTeam/FireRedAudio --local_dir pretrained_models/
Python API 使用
import torch
import torchaudio
from inference import FireRedAudioInference
# 初始化模型
# 注意:理解任务只需要 model_path
# 生成任务(TTS / 编辑 / 声音设计)还需要 vae_decoder_path
engine = FireRedAudioInference(
model_path="pretrained_models/FireRedAudio",
vae_decoder_path="pretrained_models/RedAE_decoder/model.pt",
device="cuda:0",
)
# 1️⃣ 语音识别
res = engine.understand(
"assets/examples/asr_zh_fleurs.wav",
"Transcribe speech to text.",
task="asr"
)
print(res.answer)
# 2️⃣ 音频理解 + 思维链推理
res = engine.understand(
"assets/examples/assets_mmau_test.wav",
"What illness did Second speaker's friend suffer from?",
task="understand",
enable_thinking=True,
max_new_tokens=10240,
)
print("推理过程:", res.reasoning)
print("答案:", res.answer)
# 3️⃣ Zero-Shot 声音克隆
res = engine.tts(
prompt_text="同时,他强调微调要科学有序。",
prompt_audio="assets/examples/tts_zh_prompt.wav",
target_text="安徽淮南秦师傅发现,停在小区的爱车右前驾驶窗玻璃被砸。",
language="zh",
)
torchaudio.save("tts.wav", res.audio.cpu(), sample_rate=24000)
# 4️⃣ 语义编辑(删除)
res = engine.edit(
"assets/examples/edit_semantic_zh_ref.wav",
"delete '比普通的茶叶要'",
edit_type="semantic"
)
torchaudio.save("edit_semantic.wav", res.audio.cpu(), sample_rate=24000)
# 5️⃣ 声学编辑(升调 +3 个半音)
res = engine.edit(
"assets/examples/edit_acoustic_zh_ref.wav",
"shift the pitch by 3 steps",
edit_type="acoustic"
)
torchaudio.save("edit_acoustic.wav", res.audio.cpu(), sample_rate=24000)
# 6️⃣ 声音设计(纯描述生成全新音色)
res = engine.voice_design(
instruction="以女性高音区的清亮音色,表现出青年阶段的特质,音量略强,语速适中稍快,语调带有解释意味和急切的情感流露,确保语音流畅自然。",
text="是我请他来的,可他什么也不知道,他来只是想打听一下,你们厂是不是有旧锅炉?",
)
torchaudio.save("voice_design.wav", res.audio.cpu(), sample_rate=24000)
性能对比
直接上官方基准测试数据,我摘几个最有代表性的:
音频理解(Audio Understanding)
| 模型 | MMAU test-mini | MMAU test | MMSU |
|---|---|---|---|
| Qwen3.5-Omni-Plus | 81.4 | 79.9 | 80.7 |
| Gemini 3.1 Pro | 80.7 | 78.8 | 82.7 |
| FireRedAudio | 82.0 | 80.9 | 83.3 |
| 三个榜单全第一。 | |||
| Zero-Shot TTS(中文 Seed-TTS-eval) | |||
| 模型 | CER ↓ | 相似度 ↑ | |
| --- | --- | --- | |
| CosyVoice 2 | 1.45 | 0.75 | |
| CosyVoice 3 | 1.12 | 0.78 | |
| DiTAR (1B) | 1.02 | 0.75 | |
| FireRedAudio | 0.83 | 0.74 | |
| CER 比第二名还低 19%,说明克隆出来的语音文字准确性极高。相似度虽然不是第一,但 0.74 也在第一梯队。 | |||
| Instruct TTS(中文指令遵循) | |||
| 模型 | APS ↑ | DSD ↑ | RP ↑ |
| --- | --- | --- | --- |
| Qwen3-TTS-VD | 83.7 | 81.7 | 65.8 |
| FireRedAudio | 86.0 | 84.1 | 70.1 |
| 三个指标全领先。APS 是指令遵循的准确性,DSD 是说话人描述匹配度,RP 是自然度。 | |||
| 语音编辑 | |||
| Ming-Freeform-Audio-Edit 数据集上,无论是语义编辑(删除/插入/替换)还是声学编辑(调音调速调音量),FireRedAudio 的 WER 更低、相似度更高、任务完成准确率显著领先。 |
写在最后
FireRedAudio 的核心价值,不在于某个单项指标刷了榜,而在于它证明了一件事:
理解和生成,不需要分开两套模型。给它们分配各自优化的表示空间,用同一个 LLM 当"大脑",就能既听懂又说对。
这个"解耦连续表示"的设计思路,可能会成为下一代音频大模型的标配。
之前 Qwen-Omni 用 Thinker-Talker 绕路,Ming-UniAudio 用 token 类型拆分,FireRedAudio 直接给了个更干净的答案。
9B 参数的规模也很讨喜——不算太大,推理成本可控;不算太小,有足够的语言理解能力。对于想做本地化音频 AI 应用的团队来说,这个体量是个不错的起点。
GitHub:https://github.com/FireRedTeam/FireRedAudio