Hugging Face Transformers v5.16.0 发布:新增 Qwen4-Exp、Granite Speech 5.0 与 Step-3.7-Flash 支持
Hugging Face 发布 Transformers 库 v5.16.0 版本。这是自 v5.15.0 以来的又一次版本更新,包含 114 个提交,主要新增三个模型系列的支持:Qwen4-Exp(通义千问新一代混合架构模型)、Granite Speech 5.0 Turbo CTC(轻量级语音识别模型)和 Step-3.7-Flash(阶跃星辰 198B 稀疏 MoE 视觉语言模型)。本文基于 Transformers 官方发布说明,系统解读这三个新模型的技术特点和版本更新意义。
版本概况
Transformers v5.16.0 的关键信息:
- 发布者:Cyril Vallez
- 发布于 2026 年 8 月 26 日
- 自上一版本以来包含 114 个提交
- 主要变更:新增三个模型系列支持
- 提交经过验证签名
新模型一:Qwen4-Exp
模型定位
Qwen4-Exp 基于 Qwen3.5 的混合文本和多模态架构,是通义千问系列的新一代实验模型。
三大关键组件
Qwen4-Exp 包含三个关键组件:
GatedResidual(GR)
- 通义千问开发的残差架构
- 结合 Hyper-Connection 与 GatedNorm
- 在注意力块和混合专家(MoE)块之前,用细粒度元素级门控混合多个残差流
- 控制块输出被注入回每个流的多少
- 改善信息流动和梯度传播
Qwen Sparse Attention(QSA)
- 使用多个查询头对压缩键块进行评分
- 选择最相关的连续 token 块
- 保留不完整的尾部块不压缩
- 块级选择减少索引开销,改善长序列的内存局部性
- 与 Gated DeltaNet 结合,使 Qwen4-Exp 成为首个集成线性和稀疏注意力的混合架构
- 显著提高长上下文工作负载的推理效率
Per-Layer Embedding(PLE)
- 用哈希 token n-gram 和扩张深度卷积派生的层特定词汇特征丰富选定的解码器层
- 增强模型对词汇特征的表示能力
意义
Qwen4-Exp 代表了混合架构的重要进展:
- 首次在同一架构中集成线性和稀疏注意力
- 长上下文推理效率显著提升
- 为处理超长文本提供了新的技术路线
新模型二:Granite Speech 5.0 Turbo CTC
模型定位
Granite Speech 5.0 Turbo CTC 是轻量级(约 4.7 亿参数)的语音识别编码器,属于 Granite Speech 家族:
- 使用连接时序分类(CTC)在 BPE 目标上训练
- 快速、仅编码器
- 转录只需单次前向传递 + 贪心 CTC 解码
- 无需自回归解码器
架构特点
帧堆叠 + 分块时间下采样
- 特征提取器堆叠成对的 log-mel(+delta) 帧(2 倍)
- 前两个 conformer 块各自通过步长 2 的深度卷积进行 2 倍时间下采样(带均值池化残差)
- 总计在 10ms mel hop 下实现 8 倍时间缩减
带 Shaw 相对位置嵌入的分块注意力
- 在固定大小块上计算注意力
- 序列右填充到整块数,填充帧被掩码
- 使用独立的无偏置查询/键/值投影
自条件 CTC
- 中间层的 CTC 后验被投影并反馈到隐藏状态
- CTC 头在中间层自条件与最终预测之间共享
意义
Granite Speech 5.0 Turbo 展示了高效语音识别的设计方向:
- 编码器-only 架构大幅降低推理成本
- 8 倍时间下采样提升处理速度
- 自条件 CTC 提高准确率
- 轻量级参数适合边缘部署
新模型三:Step-3.7-Flash
模型定位
Step-3.7-Flash 由阶跃星辰(StepFun)提出,是 198B 参数的稀疏 MoE 视觉语言模型:
- 196B 参数的 MoE 语言骨干
- 1.8B 参数视觉编码器
- 原生图像理解能力
架构特点
稀疏 MoE 解码器
- 除前 3 个解码器层外,所有层都通过 MoE 块路由
- 288 个路由专家(每个 token 前 8 个)+ 1 个共享专家
- 路由器使用 sigmoid 为专家评分
视觉语言融合
- 1.8B 视觉编码器支持原生图像理解
- 与 MoE 语言骨干结合
注意事项
- StepFun 尚未发布 Step-3.7-Flash 的技术报告
- 上述细节来自发布检查点的配置而非论文
- 使用时应关注官方后续文档
意义
Step-3.7-Flash 代表了视觉语言模型的大规模稀疏化方向:
- 198B 参数规模
- 稀疏激活降低推理成本
- 原生图像理解能力
- 中国 AI 模型在开源生态中的持续参与
版本更新意义
对开发者
- 三个新模型可直接使用 Transformers API
- 统一的模型加载和推理接口
- 文档已同步更新
- 降低新模型接入成本
对生态
- 多模态模型支持持续增强
- 混合架构(线性+稀疏注意力)开始进入主流库
- 轻量级语音识别模型丰富 ASR 生态
- 视觉语言模型持续演进
使用建议
- 关注各模型的官方文档
- Qwen4-Exp:适合长上下文任务
- Granite Speech 5.0:适合低延迟语音识别
- Step-3.7-Flash:适合图像理解任务(关注技术报告发布)
总结
Hugging Face Transformers v5.16.0 是一个以新模型支持为核心的版本更新。Qwen4-Exp 是通义千问的混合架构实验模型,通过 GatedResidual(结合 Hyper-Connection 与 GatedNorm 的残差架构)、Qwen Sparse Attention(块级稀疏注意力)和 Per-Layer Embedding(层特定词汇特征)三大组件,成为首个集成线性和稀疏注意力的混合架构,显著提升长上下文推理效率。Granite Speech 5.0 Turbo CTC 是约 4.7 亿参数的轻量级语音识别编码器,通过帧堆叠、分块时间下采样(8 倍缩减)和自条件 CTC,实现单次前向传递即可完成转录的高效推理。Step-3.7-Flash 是阶跃星辰的 198B 稀疏 MoE 视觉语言模型,采用 288 路由专家 + 1 共享专家的架构,配 1.8B 视觉编码器,支持原生图像理解(技术报告尚未发布,细节来自检查点配置)。对开发者而言,三个模型可直接通过统一 Transformers API 使用;对生态而言,混合架构、轻量级 ASR、大规模 VLM 三个方向的演进反映了多模态 AI 的持续发展。使用建议是根据任务类型选择合适模型,并关注官方文档和技术报告。
来源:https://github.com/huggingface/transformers/releases/tag/v5.16.0