资讯 Gemini 3.8 Flash 与 3.8 Flash Cyber 发布:更强的推理编码与网络安全模型

2026-09-07 07:12:42

Gemini 3.8 Flash 与 3.8 Flash Cyber 发布:更强的推理编码与网络安全模型

Google 官方博客发表文章(作者 Tulsee Doshi 与 Raluca Ada Popa),宣布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber 发布。这是六周内第三个 Flash 版本(3.7 Flash 三周前发布),定位"迄今为止最强的推理和编码模型",保持与 3.7 相同的速度和低成本。本文基于 Google 官方文章,解读两个新模型的能力、定价与应用场景。

概览

  • Gemini 3.8 Flash:最智能的工作马模型,在软件工程、agent 任务和关键多步推理上相比 3.7 Flash 显著改进
  • Gemini 3.8 Flash Cyber:最强大的网络安全模型,漏洞检测与自动修补达前沿水平,通过新的 Fairwind 计划向受信任的防御者开放
  • 两个版本共享同一基础智能,由长期运行的 agent 循环(递归评估和优化底层模型)进一步加速
  • 显著编码和推理提升源于多项创新,包括在网络安全这一高要求领域的严格训练

定价

Gemini 3.8 Flash 与 3.7 Flash 相同入门价:每百万输入 token $0.75、每百万输出 token $3.75。入门价 2026 年 12 月 31 日到期,2027 年 1 月 1 日起为 $1.50/1M 输入、$7.50/1M 输出。

Gemini 3.8 Flash:为长程编码与自主 agent 而生

  • DeepSWE v1.1(长程软件工程)基准:3.8 Flash 在自主解决复杂工程问题上超过大多数更大的前沿模型,成本仅一小部分
  • 金融与法律领域:在 Vals Finance Agent V2、Harvey's Legal Agent Benchmark 上超越 3.7 Flash 和其他前沿模型
  • HLE-Verified 达 54.9%,展示跨 STEM、人文学科和专业领域的多步推理能力
  • 核心设计选择:3.8 Flash 更"努力"——复杂任务上执行额外推理步骤、迭代调用工具;高 effort 级别时可能用更多 token 换性能
  • 计算效率优先的应用可用更低 effort 级别控制 token 开销,或继续用完全受支持的 3.7 Flash

Gemini 3.8 Flash Cyber:专家级网络防御

自主漏洞发现

  • CyberGym(标准漏洞发现基准):达到前沿水平,超越 3.5 Flash Cyber 和显著更大的前沿模型
  • 内部综合基准(覆盖 20 种编程语言代码库):漏洞发现成功率超过 70%

自动修补

  • 从一开始就投资于漏洞修复,优先于利用(exploitation)等进攻能力
  • CWE-Bench(Collinear 运营的修补能力外部基准):处于帕累托前沿——pass@1 达 47.2%,领先前沿模型为 47.8%,但成本显著更低

在 Google 内部的真实影响

  • Chrome 安全团队:3.8 Flash Cyber 对 Chrome 漏洞产出的正确补丁是最大商业模型(大得多)的 2.6 倍
  • Wiz:内部渗透测试基准上召回率高 7.5-9.7%,成本低 2.3-5.2 倍
  • Google Cloud 漏洞研究团队:不到 2 小时找到关键基础性漏洞——这类漏洞的研究和发现通常要数月

安全设计

  • 3.8 Flash 按 Frontier Safety Framework 提供 CBRN(化学、生物、放射、核)和网络攻击领域的滥用防护
  • 3.8 Flash Cyber 携带更宽松的网络安全缓解措施,因此仅通过 Fairwind 计划提供给受信任防御者
  • 提示注入鲁棒性(Gray Swan 测量)显著提升

可用性

  • 开发者:Google Antigravity、Gemini API(Google AI Studio)、Android Studio 构建 agent-first 工作流;Stitch 生成 UI
  • 企业:Gemini Enterprise 中可用 3.8 Flash
  • 消费者:Gemini 应用、Google 搜索 AI Mode、Google Sheets 中的 Gemini(Google AI Pro 和 Ultra 订阅)
  • 网络安全:通过 Fairwind 计划向受信任政府机构、关键基础设施运营者和软件维护者提供 3.8 Flash Cyber 优先访问

总结

Gemini 3.8 Flash 是 Google 六周内第三个 Flash 版本,定位"最强的推理和编码模型":DeepSWE 上超越大多数更大前沿模型、金融/法律基准领先、HLE 54.9%,核心设计是"更努力地工作"(更多推理步骤与工具迭代),开发者可按 effort 级别平衡 token 成本。3.8 Flash Cyber 聚焦防御者:20 种语言的内部基准漏洞发现成功率超 70%、CWE-Bench 修补 47.2% pass@1(与领先模型持平但成本低得多)、Chrome 正确补丁 2.6 倍于更大商业模型,通过 Fairwind 计划限流分发。定价保持 $0.75/3.75 每百万 token(入门价至 2026 年底)。对开发者,3.8 Flash 是当前性价比最高的编码/agent 模型选择之一。

来源:https://deepmind.google/blog/introducing-gemini-3-8-flash-and-38-flash-cyber/

复制全文 生成海报 Google Gemini 大模型 AI编码 网络安全 Agent

推荐文章

程序员茄子在线接单