资讯 FireRedAudio 开源:小红书把音频理解和生成塞进同一个 9B 模型,六项能力全榜单第一

2026-09-12 09:57:11

FireRedAudio 开源:小红书把音频理解和生成塞进同一个 9B 模型,六项能力全榜单第一

小红书 FireRed 团队最新开源FireRedAudio。它把音频理解和语音生成,塞进同一个模型里

是真·一个模型,既能"听懂",又能"说出"。

项目简介

FireRedAudio 是小红书Super Intelligence(超级智能)团队开源的通用音频语言模型。
9B 参数的 LLM 骨架,配了两条独立的音频输入通路——理解用 Audio Encoder,生成用 RedAE。
技术论文已经挂在了 arXiv(编号 2608.24168),Demo 页面也有,直接能体验。
这不是 FireRed 团队第一次开源音频模型了。
之前他们已经放出过 FireRedASR2S(普通话字错率 2.89%、支持 20+ 方言的语音识别)、FireRedTTS3(24 种语言 + 21 种中文方言的零样本克隆),以及 FireRedChat(全双工语音交互)。
FireRedAudio 是这个系列里的"集大成者"——把之前分散的能力收进一个统一框架

核心设计:解耦连续表示

论文摘要里有一句话我印象特别深:"To the best of our knowledge, it is the first publicly disclosed unified audio-language model to provide separate continuous input representations for understanding and generation within a single trainable autoregressive LLM."
翻译过来就是:我们可能是第一个公开披露的、在同一个可训练自回归 LLM 里给理解和生成分配独立连续表示的统一音频语言模型
具体怎么做的?
理解通路:输入音频 → Audio Encoder → 12.5 Hz 感知表示 → LLM 理解。这条路径的特征经过精心压缩,适合长录音的语义分析。
生成通路:输入音频 → RedAE(一个带语义蒸馏的自编码器) → 连续声学 latent → LLM 条件生成 → Flow-Matching DiT 解码成 24 kHz 波形。这条路径保留了重建所需的全部细节。
两条路喂给同一个 9B LLM,共享语言和推理能力,但输入表示各自优化。这就解决了之前说的那个"既要又要"的矛盾。

一个模型,覆盖六件事

FireRedAudio 不是"做一件事做到极致",而是"一件事都能做"。它同时支持:
1.ASR 语音识别:支持多种语言,FLEURS-102 多语言平均字错率 14.94%,超过 Qwen3-Omni-30B
2.音频理解与问答:MMAU 测试集 82.0 分、MMSU 83.3 分,两个榜单都是第一
3.长录音结构化分析支持最长 1 小时录音,输出带时间戳的结构化内容,秒级时间对齐
4.Zero-Shot TTS 声音克隆:一段参考音频 + 一段文本,Seed-ZH CER 0.83%、相似度 0.74,中文零样本克隆领先
5.Instruct TTS 声音设计:用自然语言描述音色——"女性高音区的清亮音色,青年特质,语速略快,带急切情感"——直接出全新声音
6.语音编辑:语义级(删除/插入/替换内容)+ 声学级(调音调速调音量),Ming-Freeform-Audio-Edit 数据集上全面碾压 Ming-UniAudio-Edit

快速上手

# 克隆仓库
git clone https://github.com/FireRedTeam/FireRedAudio.git
cd FireRedAudio

# 用 uv 同步依赖(注意:会编译 causal-conv1d 和 flash-attn,需要 CUDA 环境)
uv sync --extra accel --extra accel-build --group tools

下载模型权重

两种方式,任选其一:

# 方式一:从 HuggingFace 下载(推荐)
uv run hf download FireRedTeam/FireRedAudio --local-dir pretrained_models/

# 方式二:从 ModelScope 下载(国内更快)
uv pip install modelscope
uv run modelscope download --model FireRedTeam/FireRedAudio --local_dir pretrained_models/

Python API 使用

import torch
import torchaudio
from inference import FireRedAudioInference

# 初始化模型
# 注意:理解任务只需要 model_path
# 生成任务(TTS / 编辑 / 声音设计)还需要 vae_decoder_path
engine = FireRedAudioInference(
    model_path="pretrained_models/FireRedAudio",
    vae_decoder_path="pretrained_models/RedAE_decoder/model.pt",
    device="cuda:0",
)

# 1️⃣ 语音识别
res = engine.understand(
    "assets/examples/asr_zh_fleurs.wav",
    "Transcribe speech to text.",
    task="asr"
)
print(res.answer)

# 2️⃣ 音频理解 + 思维链推理
res = engine.understand(
    "assets/examples/assets_mmau_test.wav",
    "What illness did Second speaker's friend suffer from?",
    task="understand",
    enable_thinking=True,
    max_new_tokens=10240,
)
print("推理过程:", res.reasoning)
print("答案:", res.answer)

# 3️⃣ Zero-Shot 声音克隆
res = engine.tts(
    prompt_text="同时,他强调微调要科学有序。",
    prompt_audio="assets/examples/tts_zh_prompt.wav",
    target_text="安徽淮南秦师傅发现,停在小区的爱车右前驾驶窗玻璃被砸。",
    language="zh",
)
torchaudio.save("tts.wav", res.audio.cpu(), sample_rate=24000)

# 4️⃣ 语义编辑(删除)
res = engine.edit(
    "assets/examples/edit_semantic_zh_ref.wav",
    "delete '比普通的茶叶要'",
    edit_type="semantic"
)
torchaudio.save("edit_semantic.wav", res.audio.cpu(), sample_rate=24000)

# 5️⃣ 声学编辑(升调 +3 个半音)
res = engine.edit(
    "assets/examples/edit_acoustic_zh_ref.wav",
    "shift the pitch by 3 steps",
    edit_type="acoustic"
)
torchaudio.save("edit_acoustic.wav", res.audio.cpu(), sample_rate=24000)

# 6️⃣ 声音设计(纯描述生成全新音色)
res = engine.voice_design(
    instruction="以女性高音区的清亮音色,表现出青年阶段的特质,音量略强,语速适中稍快,语调带有解释意味和急切的情感流露,确保语音流畅自然。",
    text="是我请他来的,可他什么也不知道,他来只是想打听一下,你们厂是不是有旧锅炉?",
)
torchaudio.save("voice_design.wav", res.audio.cpu(), sample_rate=24000)

性能对比

直接上官方基准测试数据,我摘几个最有代表性的:
音频理解(Audio Understanding)

模型MMAU test-miniMMAU testMMSU
Qwen3.5-Omni-Plus81.479.980.7
Gemini 3.1 Pro80.778.882.7
FireRedAudio82.080.983.3
三个榜单全第一
Zero-Shot TTS(中文 Seed-TTS-eval)
模型CER ↓相似度 ↑
---------
CosyVoice 21.450.75
CosyVoice 31.120.78
DiTAR (1B)1.020.75
FireRedAudio0.830.74
CER 比第二名还低 19%,说明克隆出来的语音文字准确性极高。相似度虽然不是第一,但 0.74 也在第一梯队。
Instruct TTS(中文指令遵循)
模型APS ↑DSD ↑RP ↑
------------
Qwen3-TTS-VD83.781.765.8
FireRedAudio86.084.170.1
三个指标全领先。APS 是指令遵循的准确性,DSD 是说话人描述匹配度,RP 是自然度。
语音编辑
Ming-Freeform-Audio-Edit 数据集上,无论是语义编辑(删除/插入/替换)还是声学编辑(调音调速调音量),FireRedAudio 的 WER 更低、相似度更高、任务完成准确率显著领先。

写在最后

FireRedAudio 的核心价值,不在于某个单项指标刷了榜,而在于它证明了一件事

理解和生成,不需要分开两套模型。给它们分配各自优化的表示空间,用同一个 LLM 当"大脑",就能既听懂又说对。
这个"解耦连续表示"的设计思路,可能会成为下一代音频大模型的标配。
之前 Qwen-Omni 用 Thinker-Talker 绕路,Ming-UniAudio 用 token 类型拆分,FireRedAudio 直接给了个更干净的答案。
9B 参数的规模也很讨喜——不算太大,推理成本可控;不算太小,有足够的语言理解能力。对于想做本地化音频 AI 应用的团队来说,这个体量是个不错的起点。
GitHub:https://github.com/FireRedTeam/FireRedAudio

推荐文章

程序员茄子在线接单