资讯 Hugging Face Transformers v5.16.0 发布:新增 Qwen4-Exp、Granite Speech 5.0 与 Step-3.7-Flash 支持

2026-09-07 03:11:58

Hugging Face Transformers v5.16.0 发布:新增 Qwen4-Exp、Granite Speech 5.0 与 Step-3.7-Flash 支持

Hugging Face 发布 Transformers 库 v5.16.0 版本。这是自 v5.15.0 以来的又一次版本更新,包含 114 个提交,主要新增三个模型系列的支持:Qwen4-Exp(通义千问新一代混合架构模型)、Granite Speech 5.0 Turbo CTC(轻量级语音识别模型)和 Step-3.7-Flash(阶跃星辰 198B 稀疏 MoE 视觉语言模型)。本文基于 Transformers 官方发布说明,系统解读这三个新模型的技术特点和版本更新意义。

版本概况

Transformers v5.16.0 的关键信息:

  • 发布者:Cyril Vallez
  • 发布于 2026 年 8 月 26 日
  • 自上一版本以来包含 114 个提交
  • 主要变更:新增三个模型系列支持
  • 提交经过验证签名

新模型一:Qwen4-Exp

模型定位

Qwen4-Exp 基于 Qwen3.5 的混合文本和多模态架构,是通义千问系列的新一代实验模型。

三大关键组件

Qwen4-Exp 包含三个关键组件:

GatedResidual(GR)

  • 通义千问开发的残差架构
  • 结合 Hyper-Connection 与 GatedNorm
  • 在注意力块和混合专家(MoE)块之前,用细粒度元素级门控混合多个残差流
  • 控制块输出被注入回每个流的多少
  • 改善信息流动和梯度传播

Qwen Sparse Attention(QSA)

  • 使用多个查询头对压缩键块进行评分
  • 选择最相关的连续 token 块
  • 保留不完整的尾部块不压缩
  • 块级选择减少索引开销,改善长序列的内存局部性
  • 与 Gated DeltaNet 结合,使 Qwen4-Exp 成为首个集成线性和稀疏注意力的混合架构
  • 显著提高长上下文工作负载的推理效率

Per-Layer Embedding(PLE)

  • 用哈希 token n-gram 和扩张深度卷积派生的层特定词汇特征丰富选定的解码器层
  • 增强模型对词汇特征的表示能力

意义

Qwen4-Exp 代表了混合架构的重要进展:

  • 首次在同一架构中集成线性和稀疏注意力
  • 长上下文推理效率显著提升
  • 为处理超长文本提供了新的技术路线

新模型二:Granite Speech 5.0 Turbo CTC

模型定位

Granite Speech 5.0 Turbo CTC 是轻量级(约 4.7 亿参数)的语音识别编码器,属于 Granite Speech 家族:

  • 使用连接时序分类(CTC)在 BPE 目标上训练
  • 快速、仅编码器
  • 转录只需单次前向传递 + 贪心 CTC 解码
  • 无需自回归解码器

架构特点

帧堆叠 + 分块时间下采样

  • 特征提取器堆叠成对的 log-mel(+delta) 帧(2 倍)
  • 前两个 conformer 块各自通过步长 2 的深度卷积进行 2 倍时间下采样(带均值池化残差)
  • 总计在 10ms mel hop 下实现 8 倍时间缩减

带 Shaw 相对位置嵌入的分块注意力

  • 在固定大小块上计算注意力
  • 序列右填充到整块数,填充帧被掩码
  • 使用独立的无偏置查询/键/值投影

自条件 CTC

  • 中间层的 CTC 后验被投影并反馈到隐藏状态
  • CTC 头在中间层自条件与最终预测之间共享

意义

Granite Speech 5.0 Turbo 展示了高效语音识别的设计方向:

  • 编码器-only 架构大幅降低推理成本
  • 8 倍时间下采样提升处理速度
  • 自条件 CTC 提高准确率
  • 轻量级参数适合边缘部署

新模型三:Step-3.7-Flash

模型定位

Step-3.7-Flash 由阶跃星辰(StepFun)提出,是 198B 参数的稀疏 MoE 视觉语言模型:

  • 196B 参数的 MoE 语言骨干
  • 1.8B 参数视觉编码器
  • 原生图像理解能力

架构特点

稀疏 MoE 解码器

  • 除前 3 个解码器层外,所有层都通过 MoE 块路由
  • 288 个路由专家(每个 token 前 8 个)+ 1 个共享专家
  • 路由器使用 sigmoid 为专家评分

视觉语言融合

  • 1.8B 视觉编码器支持原生图像理解
  • 与 MoE 语言骨干结合

注意事项

  • StepFun 尚未发布 Step-3.7-Flash 的技术报告
  • 上述细节来自发布检查点的配置而非论文
  • 使用时应关注官方后续文档

意义

Step-3.7-Flash 代表了视觉语言模型的大规模稀疏化方向:

  • 198B 参数规模
  • 稀疏激活降低推理成本
  • 原生图像理解能力
  • 中国 AI 模型在开源生态中的持续参与

版本更新意义

对开发者

  • 三个新模型可直接使用 Transformers API
  • 统一的模型加载和推理接口
  • 文档已同步更新
  • 降低新模型接入成本

对生态

  • 多模态模型支持持续增强
  • 混合架构(线性+稀疏注意力)开始进入主流库
  • 轻量级语音识别模型丰富 ASR 生态
  • 视觉语言模型持续演进

使用建议

  • 关注各模型的官方文档
  • Qwen4-Exp:适合长上下文任务
  • Granite Speech 5.0:适合低延迟语音识别
  • Step-3.7-Flash:适合图像理解任务(关注技术报告发布)

总结

Hugging Face Transformers v5.16.0 是一个以新模型支持为核心的版本更新。Qwen4-Exp 是通义千问的混合架构实验模型,通过 GatedResidual(结合 Hyper-Connection 与 GatedNorm 的残差架构)、Qwen Sparse Attention(块级稀疏注意力)和 Per-Layer Embedding(层特定词汇特征)三大组件,成为首个集成线性和稀疏注意力的混合架构,显著提升长上下文推理效率。Granite Speech 5.0 Turbo CTC 是约 4.7 亿参数的轻量级语音识别编码器,通过帧堆叠、分块时间下采样(8 倍缩减)和自条件 CTC,实现单次前向传递即可完成转录的高效推理。Step-3.7-Flash 是阶跃星辰的 198B 稀疏 MoE 视觉语言模型,采用 288 路由专家 + 1 共享专家的架构,配 1.8B 视觉编码器,支持原生图像理解(技术报告尚未发布,细节来自检查点配置)。对开发者而言,三个模型可直接通过统一 Transformers API 使用;对生态而言,混合架构、轻量级 ASR、大规模 VLM 三个方向的演进反映了多模态 AI 的持续发展。使用建议是根据任务类型选择合适模型,并关注官方文档和技术报告。

来源:https://github.com/huggingface/transformers/releases/tag/v5.16.0

推荐文章

程序员茄子在线接单