Gemini 3.8 Flash 与 3.8 Flash Cyber 发布:更强的推理编码与网络安全模型
Google 官方博客发表文章(作者 Tulsee Doshi 与 Raluca Ada Popa),宣布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber 发布。这是六周内第三个 Flash 版本(3.7 Flash 三周前发布),定位"迄今为止最强的推理和编码模型",保持与 3.7 相同的速度和低成本。本文基于 Google 官方文章,解读两个新模型的能力、定价与应用场景。
概览
- Gemini 3.8 Flash:最智能的工作马模型,在软件工程、agent 任务和关键多步推理上相比 3.7 Flash 显著改进
- Gemini 3.8 Flash Cyber:最强大的网络安全模型,漏洞检测与自动修补达前沿水平,通过新的 Fairwind 计划向受信任的防御者开放
- 两个版本共享同一基础智能,由长期运行的 agent 循环(递归评估和优化底层模型)进一步加速
- 显著编码和推理提升源于多项创新,包括在网络安全这一高要求领域的严格训练
定价
Gemini 3.8 Flash 与 3.7 Flash 相同入门价:每百万输入 token $0.75、每百万输出 token $3.75。入门价 2026 年 12 月 31 日到期,2027 年 1 月 1 日起为 $1.50/1M 输入、$7.50/1M 输出。
Gemini 3.8 Flash:为长程编码与自主 agent 而生
- DeepSWE v1.1(长程软件工程)基准:3.8 Flash 在自主解决复杂工程问题上超过大多数更大的前沿模型,成本仅一小部分
- 金融与法律领域:在 Vals Finance Agent V2、Harvey's Legal Agent Benchmark 上超越 3.7 Flash 和其他前沿模型
- HLE-Verified 达 54.9%,展示跨 STEM、人文学科和专业领域的多步推理能力
- 核心设计选择:3.8 Flash 更"努力"——复杂任务上执行额外推理步骤、迭代调用工具;高 effort 级别时可能用更多 token 换性能
- 计算效率优先的应用可用更低 effort 级别控制 token 开销,或继续用完全受支持的 3.7 Flash
Gemini 3.8 Flash Cyber:专家级网络防御
自主漏洞发现
- CyberGym(标准漏洞发现基准):达到前沿水平,超越 3.5 Flash Cyber 和显著更大的前沿模型
- 内部综合基准(覆盖 20 种编程语言代码库):漏洞发现成功率超过 70%
自动修补
- 从一开始就投资于漏洞修复,优先于利用(exploitation)等进攻能力
- CWE-Bench(Collinear 运营的修补能力外部基准):处于帕累托前沿——pass@1 达 47.2%,领先前沿模型为 47.8%,但成本显著更低
在 Google 内部的真实影响
- Chrome 安全团队:3.8 Flash Cyber 对 Chrome 漏洞产出的正确补丁是最大商业模型(大得多)的 2.6 倍
- Wiz:内部渗透测试基准上召回率高 7.5-9.7%,成本低 2.3-5.2 倍
- Google Cloud 漏洞研究团队:不到 2 小时找到关键基础性漏洞——这类漏洞的研究和发现通常要数月
安全设计
- 3.8 Flash 按 Frontier Safety Framework 提供 CBRN(化学、生物、放射、核)和网络攻击领域的滥用防护
- 3.8 Flash Cyber 携带更宽松的网络安全缓解措施,因此仅通过 Fairwind 计划提供给受信任防御者
- 提示注入鲁棒性(Gray Swan 测量)显著提升
可用性
- 开发者:Google Antigravity、Gemini API(Google AI Studio)、Android Studio 构建 agent-first 工作流;Stitch 生成 UI
- 企业:Gemini Enterprise 中可用 3.8 Flash
- 消费者:Gemini 应用、Google 搜索 AI Mode、Google Sheets 中的 Gemini(Google AI Pro 和 Ultra 订阅)
- 网络安全:通过 Fairwind 计划向受信任政府机构、关键基础设施运营者和软件维护者提供 3.8 Flash Cyber 优先访问
总结
Gemini 3.8 Flash 是 Google 六周内第三个 Flash 版本,定位"最强的推理和编码模型":DeepSWE 上超越大多数更大前沿模型、金融/法律基准领先、HLE 54.9%,核心设计是"更努力地工作"(更多推理步骤与工具迭代),开发者可按 effort 级别平衡 token 成本。3.8 Flash Cyber 聚焦防御者:20 种语言的内部基准漏洞发现成功率超 70%、CWE-Bench 修补 47.2% pass@1(与领先模型持平但成本低得多)、Chrome 正确补丁 2.6 倍于更大商业模型,通过 Fairwind 计划限流分发。定价保持 $0.75/3.75 每百万 token(入门价至 2026 年底)。对开发者,3.8 Flash 是当前性价比最高的编码/agent 模型选择之一。
来源:https://deepmind.google/blog/introducing-gemini-3-8-flash-and-38-flash-cyber/