收藏、记忆、苹果核上线了看看 →
LuoLuoLuoLuo Wiki

Gemini 3.8 Flash 发布:DeepSWE 73.7%、首发价 $0.75 / $3.75,另有只给防守方的 3.8 Flash Cyber

Google 2026-09-02 发布,gemini-3.8-flash 当天正式可用。1M 输入、64K 输出,thinking 只有 low / medium / high;首发价输入 $0.75、输出 $3.75 每百万 token,到 2026-12-31,2027 年起翻倍。网络安全版 3.8 Flash Cyber 只通过 Fairwind 计划给受信任的防守方

核对于 2026-09-29

按 2026-09-29 的状态整理。规格来自 Gemini API 的模型页和《What's new in Gemini 3.8 Flash》,价格来自 Gemini API 定价页,评测来自 Google 发布博客和 DeepMind 模型卡(两处的表一致),各项怎么测的来自 Google 的评测方法说明;3.8 Flash Cyber 的内容来自博客和 Fairwind 计划页。第三方榜单单独标注来源。页末附全部来源。

hihi!洛洛来了!

这篇是补课。Gemini 3.8 Flash 其实 9 月 2 号就发了,比 GPT-6 Astra 还早一天,可那几天洛洛光顾着盯 Astra,把它晾了快一个月。直到它进了洛洛 AI 的模型列表、标价 1 核,洛洛才想起来:这位员工的档案还没建。

它在洛洛 AI 里是「轻快」档,一问只要 1 核。下面的数字都是 Google 官方口径,洛洛只在旁边写读后感。

洛洛碎碎念

Google 这是六周里发的第三个 Flash:3.6 Flash 7 月 21 号、3.7 Flash 8 月 13 号、3.8 Flash 9 月 2 号。

洛洛期末复习都没这么勤快。更离谱的是价格一分没涨,3.8 和 3.7 的首发价一模一样。

一句话总结

赶时间的话,看完这一段就够了。

Google 在 2026-09-02 发布 Gemini 3.8 Flash(gemini-3.8-flash),当天在 Gemini API 正式可用(GA)。输入上限 1,048,576 token、输出上限 65,536 token,能看图片、视频、音频和 PDF,thinking 分 low / medium(默认)/ high 三档,不支持 minimal。首发价输入 $0.75、输出 $3.75(每百万 token),和 3.7 Flash 一样,到 2026-12-31 截止,2027-01-01 起变成 $1.50 / $7.50。Google 公布的 DeepSWE v1.1 是 73.7%,高于 GPT-5.6 Sol 的 72.7%,和 Claude Opus 5 基本持平;但 Terminal-bench 4.0、OSWorld-2.0 这类通用 agent 和操作电脑的任务,还明显落后于 Opus 5。同一天发布的 3.8 Flash Cyber 是网络安全专用版,只通过新的 Fairwind 计划开放给政府和受信任的合作方。

时间线

日期事件
2026-07-21Gemini 3.6 Flash 和 3.5 Flash-Lite 正式可用
2026-08-13Gemini 3.7 Flash 正式可用,首发价到 2026-12-31
2026-09-02发布 Gemini 3.8 Flash 和 3.8 Flash Cyber;API 更新日志收录 gemini-3.8-flash 正式可用;同日公布模型卡,Fairwind 计划上线
2026-09-02 起开发者走 AI Studio、Gemini API、Antigravity、Android Studio;企业走 Gemini Enterprise;消费端给 Google AI Pro 和 Ultra 订阅用户(Gemini App、搜索里的 AI Mode、Google Sheets 里的 Gemini)
2026-09-15同代的实时语音模型 Gemini 3.8 Live、3.8 Live Extended Thinking 正式可用
2026-09-17托管 agent 发布 antigravity-preview-09-2026,默认用 3.8 Flash
2026-09-18Google 收紧 Gemini 2.5 的访问(只给之前用过的用户),新项目建议用 3.5 Flash-Lite 或 3.8 Flash
2026-09-22语音合成模型 Gemini 3.8 Flash TTS、3.8 Flash-Lite TTS 正式可用
截至 2026-09-29本站洛洛 AI 能选 google/gemini-3.8-flash(经 ZenMux)
2026-12-31首发价截止
2027-01-01标准价 $1.50 / $7.50 生效

关键数字

这张表来自 Gemini API 模型页、迁移指南和模型卡。

项目Gemini 3.8 Flash
模型 IDgemini-3.8-flash(稳定版)
输入上限1,048,576 tokens
输出上限65,536 tokens
知识截止2026 年 3 月(模型卡说部分领域的知识只到 2025 年 1 月)
输入模态文本、图片、视频、音频、PDF
输出模态文本
thinkinglow、medium(默认)、high;传 minimal 直接报错
采样参数迁移指南要求去掉 temperature、top_p、top_k;不支持 candidate_count
支持函数调用、结构化输出、代码执行、文件搜索、Google 搜索 grounding、Google 地图 grounding、URL context、上下文缓存;computer use 为预览
不支持音频生成、图像生成、Live API
调用档位标准、Batch、Flex、Priority

架构

这一节也很短,Google 把能说的都指到了上一代。

  • 参数量、结构:未公开。 模型卡里「架构」「训练数据」「硬件」「软件」四栏写的都是同一句:3.8 Flash 基于 Gemini 3.7 Flash,详情去看 3.7 Flash 的模型卡
  • 和 Cyber 版同一个底座: 博客说 3.8 Flash 和 3.8 Flash Cyber 共用同一套基础能力,编码和推理的提升来自一系列改进,包括在网络安全这个高难领域的严格训练,以及「长时间运行、递归评估和改进底层模型的 agent 循环」
  • 设计取向是「更卖力」: 复杂任务上它会多走推理步、反复调工具、边做边自查,所以 token 可能用得更多,强度越高越明显。Google 建议效率优先的场景调低强度,或者继续用 3.7 Flash(同价、继续支持)
  • 托管 agent 换芯: Gemini 托管 agent 里的 Antigravity agent 和 Antigravity SDK 默认改用 3.8 Flash

评测

以下摘自 Google 博客和模型卡,都是 Google 发布时公布的;对手分数多数取自各家自报或公开榜单,部分由 Google 自己跑。加粗是每行最高。

基准3.8 Flash3.7 FlashClaude Opus 5Claude Sonnet 5GPT-5.6 SolGPT-5.6 Terra
输入价(美元 / 百万,无缓存)0.75(标准 1.50)0.75(标准 1.50)5.002.004.002.00
输出价(美元 / 百万)3.75(标准 7.50)3.75(标准 7.50)25.0010.0020.0012.00
DeepSWE v1.173.7%65.3%74.0%53.8%72.7%69.6%
GDPVal-AA v2(Elo)154514821824158417101528
Vals Finance Agent v261.4%59.0%58.6%53.9%53.8%54.4%
Harvey's Legal Agent Benchmark(全过率)10.0%8.8%6.7%5.0%2.5%0.8%
Terminal-bench 2.189.4%85.8%89.1%80.4%88.8%87.4%
Terminal-bench 4.019.1%11.2%51.8%12.4%37.3%23.6%
GDP.PDF(全过率)35.0%34.0%37.0%28.0%40.0%29.0%
CharXiv Reasoning(不带工具)86.2%84.5%83.7%70.1%85.8%85.9%
LVBench87.8%(agentic)/ 87.1%(static)85.4%75.4%68.5%82.1%78.9%
HLE-Verified54.9%53.6%54.4%31.0%54.5%51.1%
OSWorld-2.0(部分得分,开批量工具)59.0%50.6%75.4%42.6%62.6%50.2%
BioMysteryBench(人类可解)88.8%87.1%90.1%87.5%79.5%83.8%
BioMysteryBench(人类难解)56.5%43.5%49.4%34.1%44.7%49.4%
LABBench286.2%82.1%84.2%80.1%82.1%81.2%

怎么读这张表:

  • 编码 agent 追平了旗舰:DeepSWE 和 Terminal-bench 2.1 都贴着 Opus 5 和 GPT-5.6 Sol,而按首发价,Opus 5 的单价是它的 6.7 倍左右
  • 专业领域 agent 是它领先的地方:金融(Vals Finance Agent v2)、法律(Harvey)、生物(BioMysteryBench 难题、LABBench2)都是全表最高。不过 Harvey 的全过率本身很低,10% 已经是第一
  • 通用 agent 和操作电脑是短板:Terminal-bench 4.0 只有 19.1%,Opus 5 是 51.8%;OSWorld-2.0 59.0% 对 75.4%;知识工作的 GDPVal-AA 也差了一截
  • 对比列停在 9 月初:表里没有之后发布的 GPT-6 Astra、Sol、Luna 等模型

几条测法上的小字(来自 Google 的评测方法说明),洛洛觉得比分数本身还重要:

  • DeepSWE 的 73.7% 是 Google 自己跑的:用 mini-swe-agent 脚手架、high 强度;其它模型取 Datacurve 公开榜上各自最高强度的成绩。方法说明里还专门注了一句:Opus 5 的 74% 是当初照 Datacurve 公开榜的四舍五入误报的,但没给更正后的数字,表里也还写着 74.0%
  • HLE-Verified 里 Sonnet 5 的 31.0% 偏低有原因:相当一部分题被 Sonnet 5 的内容审核挡掉了,Opus 5 也挡了少量
  • LVBench 的帧数不一样:Gemini 和 GPT-5.6 用 1024 帧,Claude 因为接口限制只用了 300 帧
  • OSWorld-2.0 是 08-08 补丁之前跑的:和 OpenAI 用 v2026.08.08 版报的 OSWorld 2.0 分数不是同一个口径,别跨表比
  • Terminal-bench 2.1 只报默认脚手架 Terminus 2 的成绩,Gemini 自己跑,其它模型取公开榜和 Artificial Analysis

第三方榜单:Datacurve 的 DeepSWE 公开榜(页面标注 09-22 更新)上,gemini-3.8-flash(high)是 74%(±1),和 GPT-6 Astra(xhigh)、Claude Opus 5(max)并列第一档。同一张榜上它平均每个任务花 $2.36、输出约 14.3 万 token、走 166 步;Opus 5 是 $11.84、11.8 万 token、99 步,Astra 是 $4.43、3 万 token、29 步。

洛洛碎碎念

单价便宜,不等于一个任务花得少!

Datacurve 那张榜上,它做一个任务平均要吐 14 万多 token,差不多是 GPT-6 Astra 的五倍,步数也是 Astra 的五倍多。Google 自己也承认它「更卖力」。按任务算它还是比 Opus 5 便宜很多,但跑长任务之前,先把强度和预算定好。

顺带:3.8 Flash Cyber

这个洛洛和你大概率都用不上,但值得知道它的存在。

  • 是什么:和 3.8 Flash 同一个底座,网络安全方面的防护放得更宽,擅长找漏洞和自动打补丁。正因为放宽了,才只给受信任的防守方
  • 怎么拿到:只通过 09-02 上线的 Fairwind 计划。首批面向政府和国家网络安全机构、关键基础设施运营方(医疗、电信、能源、金融)、核心技术平台;官方说全球已有 650 多家合作方。要申请,访问只能开给组织内部的安全、应急响应和渗透测试团队,还要上抗钓鱼的多因素认证,不许转售或转授
  • 配套工具:和 Google 的代码安全 agent CodeMender 搭着用。普通 Google Cloud 客户可以用 CodeMender 加公开模型,但拿不到 Cyber 版
  • 官方数字(都是 Google 公布的):CyberGym pass@1 为 86.2%(图上对照:3.5 Flash Cyber 77.5%、GPT-5.6 Sol 83.6%、Mythos 5 83.8%、GPT-5.5-Cyber 85.6%);Google 内部跨 20 种编程语言的漏洞发现基准,成功率超过 70%;打补丁的 CWE-Bench(由 Collinear 运行)pass@1 为 47.2%,Fable 5 是 47.8%,但成本低得多
  • 官方举的实战例子:Chrome 安全团队说它产出的正确补丁数是最强商用大模型的 2.6 倍;Wiz 说在内部渗透测试基准上召回率高 7.5% 到 9.7%,成本低 2.3 到 5.2 倍

API 与价格

终于到了洛洛百分之百看得懂的部分:多少钱。

官方价格(付费层,美元 / 每百万 token):

计费项首发价(到 2026-12-31)2027-01-01 起
输入$0.75$1.50
输出(含思考 token)$3.75$7.50
缓存输入$0.075$0.15
缓存存储$0.50 / 百万 token / 小时$1.00 / 百万 token / 小时
Batch、Flex 输入 / 输出$0.375 / $1.875$0.75 / $3.75
Priority 输入 / 输出$1.35 / $6.75$2.70 / $13.50

几个要注意的点:

  • 首发价有期限:到 2026-12-31,明年起输入输出都翻倍。算长期预算请按 $1.50 / $7.50 算
  • 没有按上下文长度分档:不像 OpenAI 超过 272K 就整单加价,定价页上 3.8 Flash 只有一档价
  • 有免费层:AI Studio 和 API 的免费层能用 3.8 Flash,但免费层的内容会被用来改进 Google 的产品,付费层不会
  • 搜索 grounding 另算:Google 搜索 grounding 每月 5,000 次免费(所有 Gemini 3.x 模型共用),之后每千次 $14
  • 迁移要改代码:thinking_budget 换成 thinking_level;写了 minimal 的会直接报错;要去掉 temperature、top_p、top_k 和 candidate_count
  • 和 3.7 Flash 同价:3.7 Flash 继续支持,首发价也一样,效率优先的活可以留在 3.7

放到同一时期看:它的单价比 GPT-6 Sol($2 / $10)低,比 GPT-6 Luna($0.10 / $0.50)高得多,详见GPT-6 Sol 与 Luna。价格随时可能调整,以官方定价页为准。

对你意味着什么

  • Gemini App 用户:Google AI Pro 和 Ultra 订阅用户能在 Gemini App、搜索的 AI Mode 和 Google Sheets 里用到它
  • 调 API 的开发者:拿来做编码 agent 和金融、法律、科研这类专业流程很划算;复杂的通用 agent、操作电脑的活,分数上还是 Opus 5 这一档更稳。默认强度是 medium,日常任务调到 low 能省不少 token。老代码里写着 minimal 的,换模型前先改掉,不然直接报错
  • 做安全的:Flash Cyber 要走 Fairwind 申请,普通账号用不到
  • 本站用户:洛洛 AI 里 Gemini 3.8 Flash 在「轻快」档,一问 1 核。站里给它设的是推理强度 low、单次回答最多 2048 token。它在 ZenMux 上不支持或会忽略强制指定工具,所以你打开「联网」开关时,洛洛是在提示词里要求它先搜,而不是硬让它调搜索工具。苹果核现在是试运行,只显示不真扣,计划 2026-10-13 起正式扣,规则见 苹果核规则

局限

以下主要来自 Google 的模型卡。

  • 模型卡列出的已知问题:会出现幻觉;偶尔变慢或超时;高强度下可能为了效果多用 token
  • 安全自评里,多语言安全比 3.7 Flash 略有退步(+5.4 个百分点,越低越好),无理拒答也多了 1.1 个百分点;文本和图片安全基本持平
  • Google 按前沿安全框架评估的结论是:它没有达到任何需要追踪或关键的能力等级,这个判断是基于 3.7 Flash 的评估推出来的
  • 知识截止 2026 年 3 月,部分领域只到 2025 年 1 月
  • 架构、参数、训练数据全部未公开,只说基于 3.7 Flash
  • 评测都是 Google 发布时公布的,DeepSWE 那格 Opus 5 的数字 Google 自己承认有误差;computer use 目前还是预览

洛洛写完这篇最大的感受是:Google 把 Flash 这条线当成了主力在卷,六周三个版本、价格不动、分数一路往上抬,编码 agent 已经贴到了旗舰身边。代价是它更「卖力」,token 用得更多,还有一张年底到期的首发价。

数字都会过期,看到这篇的时候记得回官方页面对一眼。更多新模型速览在模型时讯。洛洛先去用 1 核问问它,今天几点睡合适。

参考来源

官方:

第三方:

本站:

  • 洛洛 AI 的档位与模型设置来自站点配置,每档扣几核见 苹果核规则(查阅于 2026-09-29)

On this page