Gemini 3.8 Flash 发布:DeepSWE 73.7%、首发价 $0.75 / $3.75,另有只给防守方的 3.8 Flash Cyber
Google 2026-09-02 发布,gemini-3.8-flash 当天正式可用。1M 输入、64K 输出,thinking 只有 low / medium / high;首发价输入 $0.75、输出 $3.75 每百万 token,到 2026-12-31,2027 年起翻倍。网络安全版 3.8 Flash Cyber 只通过 Fairwind 计划给受信任的防守方
按 2026-09-29 的状态整理。规格来自 Gemini API 的模型页和《What's new in Gemini 3.8 Flash》,价格来自 Gemini API 定价页,评测来自 Google 发布博客和 DeepMind 模型卡(两处的表一致),各项怎么测的来自 Google 的评测方法说明;3.8 Flash Cyber 的内容来自博客和 Fairwind 计划页。第三方榜单单独标注来源。页末附全部来源。
hihi!洛洛来了!
这篇是补课。Gemini 3.8 Flash 其实 9 月 2 号就发了,比 GPT-6 Astra 还早一天,可那几天洛洛光顾着盯 Astra,把它晾了快一个月。直到它进了洛洛 AI 的模型列表、标价 1 核,洛洛才想起来:这位员工的档案还没建。
它在洛洛 AI 里是「轻快」档,一问只要 1 核。下面的数字都是 Google 官方口径,洛洛只在旁边写读后感。
洛洛碎碎念
Google 这是六周里发的第三个 Flash:3.6 Flash 7 月 21 号、3.7 Flash 8 月 13 号、3.8 Flash 9 月 2 号。
洛洛期末复习都没这么勤快。更离谱的是价格一分没涨,3.8 和 3.7 的首发价一模一样。
一句话总结
赶时间的话,看完这一段就够了。
Google 在 2026-09-02 发布 Gemini 3.8 Flash(gemini-3.8-flash),当天在 Gemini API 正式可用(GA)。输入上限 1,048,576 token、输出上限 65,536 token,能看图片、视频、音频和 PDF,thinking 分 low / medium(默认)/ high 三档,不支持 minimal。首发价输入 $0.75、输出 $3.75(每百万 token),和 3.7 Flash 一样,到 2026-12-31 截止,2027-01-01 起变成 $1.50 / $7.50。Google 公布的 DeepSWE v1.1 是 73.7%,高于 GPT-5.6 Sol 的 72.7%,和 Claude Opus 5 基本持平;但 Terminal-bench 4.0、OSWorld-2.0 这类通用 agent 和操作电脑的任务,还明显落后于 Opus 5。同一天发布的 3.8 Flash Cyber 是网络安全专用版,只通过新的 Fairwind 计划开放给政府和受信任的合作方。
时间线
| 日期 | 事件 |
|---|---|
| 2026-07-21 | Gemini 3.6 Flash 和 3.5 Flash-Lite 正式可用 |
| 2026-08-13 | Gemini 3.7 Flash 正式可用,首发价到 2026-12-31 |
| 2026-09-02 | 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber;API 更新日志收录 gemini-3.8-flash 正式可用;同日公布模型卡,Fairwind 计划上线 |
| 2026-09-02 起 | 开发者走 AI Studio、Gemini API、Antigravity、Android Studio;企业走 Gemini Enterprise;消费端给 Google AI Pro 和 Ultra 订阅用户(Gemini App、搜索里的 AI Mode、Google Sheets 里的 Gemini) |
| 2026-09-15 | 同代的实时语音模型 Gemini 3.8 Live、3.8 Live Extended Thinking 正式可用 |
| 2026-09-17 | 托管 agent 发布 antigravity-preview-09-2026,默认用 3.8 Flash |
| 2026-09-18 | Google 收紧 Gemini 2.5 的访问(只给之前用过的用户),新项目建议用 3.5 Flash-Lite 或 3.8 Flash |
| 2026-09-22 | 语音合成模型 Gemini 3.8 Flash TTS、3.8 Flash-Lite TTS 正式可用 |
| 截至 2026-09-29 | 本站洛洛 AI 能选 google/gemini-3.8-flash(经 ZenMux) |
| 2026-12-31 | 首发价截止 |
| 2027-01-01 | 标准价 $1.50 / $7.50 生效 |
关键数字
这张表来自 Gemini API 模型页、迁移指南和模型卡。
| 项目 | Gemini 3.8 Flash |
|---|---|
| 模型 ID | gemini-3.8-flash(稳定版) |
| 输入上限 | 1,048,576 tokens |
| 输出上限 | 65,536 tokens |
| 知识截止 | 2026 年 3 月(模型卡说部分领域的知识只到 2025 年 1 月) |
| 输入模态 | 文本、图片、视频、音频、PDF |
| 输出模态 | 文本 |
| thinking | low、medium(默认)、high;传 minimal 直接报错 |
| 采样参数 | 迁移指南要求去掉 temperature、top_p、top_k;不支持 candidate_count |
| 支持 | 函数调用、结构化输出、代码执行、文件搜索、Google 搜索 grounding、Google 地图 grounding、URL context、上下文缓存;computer use 为预览 |
| 不支持 | 音频生成、图像生成、Live API |
| 调用档位 | 标准、Batch、Flex、Priority |
架构
这一节也很短,Google 把能说的都指到了上一代。
- 参数量、结构:未公开。 模型卡里「架构」「训练数据」「硬件」「软件」四栏写的都是同一句:3.8 Flash 基于 Gemini 3.7 Flash,详情去看 3.7 Flash 的模型卡
- 和 Cyber 版同一个底座: 博客说 3.8 Flash 和 3.8 Flash Cyber 共用同一套基础能力,编码和推理的提升来自一系列改进,包括在网络安全这个高难领域的严格训练,以及「长时间运行、递归评估和改进底层模型的 agent 循环」
- 设计取向是「更卖力」: 复杂任务上它会多走推理步、反复调工具、边做边自查,所以 token 可能用得更多,强度越高越明显。Google 建议效率优先的场景调低强度,或者继续用 3.7 Flash(同价、继续支持)
- 托管 agent 换芯: Gemini 托管 agent 里的 Antigravity agent 和 Antigravity SDK 默认改用 3.8 Flash
评测
以下摘自 Google 博客和模型卡,都是 Google 发布时公布的;对手分数多数取自各家自报或公开榜单,部分由 Google 自己跑。加粗是每行最高。
| 基准 | 3.8 Flash | 3.7 Flash | Claude Opus 5 | Claude Sonnet 5 | GPT-5.6 Sol | GPT-5.6 Terra |
|---|---|---|---|---|---|---|
| 输入价(美元 / 百万,无缓存) | 0.75(标准 1.50) | 0.75(标准 1.50) | 5.00 | 2.00 | 4.00 | 2.00 |
| 输出价(美元 / 百万) | 3.75(标准 7.50) | 3.75(标准 7.50) | 25.00 | 10.00 | 20.00 | 12.00 |
| DeepSWE v1.1 | 73.7% | 65.3% | 74.0% | 53.8% | 72.7% | 69.6% |
| GDPVal-AA v2(Elo) | 1545 | 1482 | 1824 | 1584 | 1710 | 1528 |
| Vals Finance Agent v2 | 61.4% | 59.0% | 58.6% | 53.9% | 53.8% | 54.4% |
| Harvey's Legal Agent Benchmark(全过率) | 10.0% | 8.8% | 6.7% | 5.0% | 2.5% | 0.8% |
| Terminal-bench 2.1 | 89.4% | 85.8% | 89.1% | 80.4% | 88.8% | 87.4% |
| Terminal-bench 4.0 | 19.1% | 11.2% | 51.8% | 12.4% | 37.3% | 23.6% |
| GDP.PDF(全过率) | 35.0% | 34.0% | 37.0% | 28.0% | 40.0% | 29.0% |
| CharXiv Reasoning(不带工具) | 86.2% | 84.5% | 83.7% | 70.1% | 85.8% | 85.9% |
| LVBench | 87.8%(agentic)/ 87.1%(static) | 85.4% | 75.4% | 68.5% | 82.1% | 78.9% |
| HLE-Verified | 54.9% | 53.6% | 54.4% | 31.0% | 54.5% | 51.1% |
| OSWorld-2.0(部分得分,开批量工具) | 59.0% | 50.6% | 75.4% | 42.6% | 62.6% | 50.2% |
| BioMysteryBench(人类可解) | 88.8% | 87.1% | 90.1% | 87.5% | 79.5% | 83.8% |
| BioMysteryBench(人类难解) | 56.5% | 43.5% | 49.4% | 34.1% | 44.7% | 49.4% |
| LABBench2 | 86.2% | 82.1% | 84.2% | 80.1% | 82.1% | 81.2% |
怎么读这张表:
- 编码 agent 追平了旗舰:DeepSWE 和 Terminal-bench 2.1 都贴着 Opus 5 和 GPT-5.6 Sol,而按首发价,Opus 5 的单价是它的 6.7 倍左右
- 专业领域 agent 是它领先的地方:金融(Vals Finance Agent v2)、法律(Harvey)、生物(BioMysteryBench 难题、LABBench2)都是全表最高。不过 Harvey 的全过率本身很低,10% 已经是第一
- 通用 agent 和操作电脑是短板:Terminal-bench 4.0 只有 19.1%,Opus 5 是 51.8%;OSWorld-2.0 59.0% 对 75.4%;知识工作的 GDPVal-AA 也差了一截
- 对比列停在 9 月初:表里没有之后发布的 GPT-6 Astra、Sol、Luna 等模型
几条测法上的小字(来自 Google 的评测方法说明),洛洛觉得比分数本身还重要:
- DeepSWE 的 73.7% 是 Google 自己跑的:用 mini-swe-agent 脚手架、high 强度;其它模型取 Datacurve 公开榜上各自最高强度的成绩。方法说明里还专门注了一句:Opus 5 的 74% 是当初照 Datacurve 公开榜的四舍五入误报的,但没给更正后的数字,表里也还写着 74.0%
- HLE-Verified 里 Sonnet 5 的 31.0% 偏低有原因:相当一部分题被 Sonnet 5 的内容审核挡掉了,Opus 5 也挡了少量
- LVBench 的帧数不一样:Gemini 和 GPT-5.6 用 1024 帧,Claude 因为接口限制只用了 300 帧
- OSWorld-2.0 是 08-08 补丁之前跑的:和 OpenAI 用 v2026.08.08 版报的 OSWorld 2.0 分数不是同一个口径,别跨表比
- Terminal-bench 2.1 只报默认脚手架 Terminus 2 的成绩,Gemini 自己跑,其它模型取公开榜和 Artificial Analysis
第三方榜单:Datacurve 的 DeepSWE 公开榜(页面标注 09-22 更新)上,gemini-3.8-flash(high)是 74%(±1),和 GPT-6 Astra(xhigh)、Claude Opus 5(max)并列第一档。同一张榜上它平均每个任务花 $2.36、输出约 14.3 万 token、走 166 步;Opus 5 是 $11.84、11.8 万 token、99 步,Astra 是 $4.43、3 万 token、29 步。
洛洛碎碎念
单价便宜,不等于一个任务花得少!
Datacurve 那张榜上,它做一个任务平均要吐 14 万多 token,差不多是 GPT-6 Astra 的五倍,步数也是 Astra 的五倍多。Google 自己也承认它「更卖力」。按任务算它还是比 Opus 5 便宜很多,但跑长任务之前,先把强度和预算定好。
顺带:3.8 Flash Cyber
这个洛洛和你大概率都用不上,但值得知道它的存在。
- 是什么:和 3.8 Flash 同一个底座,网络安全方面的防护放得更宽,擅长找漏洞和自动打补丁。正因为放宽了,才只给受信任的防守方
- 怎么拿到:只通过 09-02 上线的 Fairwind 计划。首批面向政府和国家网络安全机构、关键基础设施运营方(医疗、电信、能源、金融)、核心技术平台;官方说全球已有 650 多家合作方。要申请,访问只能开给组织内部的安全、应急响应和渗透测试团队,还要上抗钓鱼的多因素认证,不许转售或转授
- 配套工具:和 Google 的代码安全 agent CodeMender 搭着用。普通 Google Cloud 客户可以用 CodeMender 加公开模型,但拿不到 Cyber 版
- 官方数字(都是 Google 公布的):CyberGym pass@1 为 86.2%(图上对照:3.5 Flash Cyber 77.5%、GPT-5.6 Sol 83.6%、Mythos 5 83.8%、GPT-5.5-Cyber 85.6%);Google 内部跨 20 种编程语言的漏洞发现基准,成功率超过 70%;打补丁的 CWE-Bench(由 Collinear 运行)pass@1 为 47.2%,Fable 5 是 47.8%,但成本低得多
- 官方举的实战例子:Chrome 安全团队说它产出的正确补丁数是最强商用大模型的 2.6 倍;Wiz 说在内部渗透测试基准上召回率高 7.5% 到 9.7%,成本低 2.3 到 5.2 倍
API 与价格
终于到了洛洛百分之百看得懂的部分:多少钱。
官方价格(付费层,美元 / 每百万 token):
| 计费项 | 首发价(到 2026-12-31) | 2027-01-01 起 |
|---|---|---|
| 输入 | $0.75 | $1.50 |
| 输出(含思考 token) | $3.75 | $7.50 |
| 缓存输入 | $0.075 | $0.15 |
| 缓存存储 | $0.50 / 百万 token / 小时 | $1.00 / 百万 token / 小时 |
| Batch、Flex 输入 / 输出 | $0.375 / $1.875 | $0.75 / $3.75 |
| Priority 输入 / 输出 | $1.35 / $6.75 | $2.70 / $13.50 |
几个要注意的点:
- 首发价有期限:到 2026-12-31,明年起输入输出都翻倍。算长期预算请按 $1.50 / $7.50 算
- 没有按上下文长度分档:不像 OpenAI 超过 272K 就整单加价,定价页上 3.8 Flash 只有一档价
- 有免费层:AI Studio 和 API 的免费层能用 3.8 Flash,但免费层的内容会被用来改进 Google 的产品,付费层不会
- 搜索 grounding 另算:Google 搜索 grounding 每月 5,000 次免费(所有 Gemini 3.x 模型共用),之后每千次 $14
- 迁移要改代码:
thinking_budget换成thinking_level;写了 minimal 的会直接报错;要去掉 temperature、top_p、top_k 和 candidate_count - 和 3.7 Flash 同价:3.7 Flash 继续支持,首发价也一样,效率优先的活可以留在 3.7
放到同一时期看:它的单价比 GPT-6 Sol($2 / $10)低,比 GPT-6 Luna($0.10 / $0.50)高得多,详见GPT-6 Sol 与 Luna。价格随时可能调整,以官方定价页为准。
对你意味着什么
- Gemini App 用户:Google AI Pro 和 Ultra 订阅用户能在 Gemini App、搜索的 AI Mode 和 Google Sheets 里用到它
- 调 API 的开发者:拿来做编码 agent 和金融、法律、科研这类专业流程很划算;复杂的通用 agent、操作电脑的活,分数上还是 Opus 5 这一档更稳。默认强度是 medium,日常任务调到 low 能省不少 token。老代码里写着 minimal 的,换模型前先改掉,不然直接报错
- 做安全的:Flash Cyber 要走 Fairwind 申请,普通账号用不到
- 本站用户:洛洛 AI 里 Gemini 3.8 Flash 在「轻快」档,一问 1 核。站里给它设的是推理强度 low、单次回答最多 2048 token。它在 ZenMux 上不支持或会忽略强制指定工具,所以你打开「联网」开关时,洛洛是在提示词里要求它先搜,而不是硬让它调搜索工具。苹果核现在是试运行,只显示不真扣,计划 2026-10-13 起正式扣,规则见 苹果核规则
局限
以下主要来自 Google 的模型卡。
- 模型卡列出的已知问题:会出现幻觉;偶尔变慢或超时;高强度下可能为了效果多用 token
- 安全自评里,多语言安全比 3.7 Flash 略有退步(+5.4 个百分点,越低越好),无理拒答也多了 1.1 个百分点;文本和图片安全基本持平
- Google 按前沿安全框架评估的结论是:它没有达到任何需要追踪或关键的能力等级,这个判断是基于 3.7 Flash 的评估推出来的
- 知识截止 2026 年 3 月,部分领域只到 2025 年 1 月
- 架构、参数、训练数据全部未公开,只说基于 3.7 Flash
- 评测都是 Google 发布时公布的,DeepSWE 那格 Opus 5 的数字 Google 自己承认有误差;computer use 目前还是预览
洛洛写完这篇最大的感受是:Google 把 Flash 这条线当成了主力在卷,六周三个版本、价格不动、分数一路往上抬,编码 agent 已经贴到了旗舰身边。代价是它更「卖力」,token 用得更多,还有一张年底到期的首发价。
数字都会过期,看到这篇的时候记得回官方页面对一眼。更多新模型速览在模型时讯。洛洛先去用 1 核问问它,今天几点睡合适。
参考来源
官方:
- Google 博客《Introducing Gemini 3.8 Flash and 3.8 Flash Cyber》(定位、评测表、Flash Cyber 数字、可用渠道、首发价):https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/(2026-09-02)
- Google DeepMind 模型卡 Gemini 3.8 Flash(上下文、输出、知识截止、评测表、安全评估、已知问题):https://deepmind.google/models/model-cards/gemini-3-8-flash(2026-09-02)
- Google DeepMind 评测方法说明(各项基准的测法、Opus 5 分数误差说明):https://deepmind.google/models/evals-methodology/gemini-3-8-flash(2026-09,查阅于 2026-09-29)
- Gemini API 模型页 gemini-3.8-flash(输入输出上限、模态、能力、调用档位):https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash(页面标注更新于 2026-09-02,查阅于 2026-09-29)
- 《What's new in Gemini 3.8 Flash》(默认 thinking、minimal 报错、迁移清单、Antigravity 默认模型):https://ai.google.dev/gemini-api/docs/latest-model(页面标注更新于 2026-09-23,查阅于 2026-09-29)
- Gemini API 定价页(首发价与标准价、缓存、Batch / Flex / Priority、免费层、grounding):https://ai.google.dev/gemini-api/docs/pricing(查阅于 2026-09-29)
- Gemini API 更新日志(09-02 正式可用及前后各版本日期):https://ai.google.dev/gemini-api/docs/changelog(查阅于 2026-09-29)
- Google 博客《Proactive cyber defense for governments and enterprises》(Fairwind 计划):https://blog.google/innovation-and-ai/technology/safety-security/fairwind-program/(2026-09-02)
- Fairwind 计划页(合作方范围、使用条件、CWE-Bench 对比):https://deepmind.google/fairwind-program/(查阅于 2026-09-29)
第三方:
- Datacurve DeepSWE 公开榜(3.8 Flash 排名、每任务成本、输出 token 与步数):https://deepswe.datacurve.ai/(页面标注更新于 2026-09-22,查阅于 2026-09-29)
本站:
- 洛洛 AI 的档位与模型设置来自站点配置,每档扣几核见 苹果核规则(查阅于 2026-09-29)
GPT-6 Astra 发布:105 万上下文、$10 / $50 定价,网络安全能力首次到 Critical 级
OpenAI 2026-09-03 发布、09-04 全面可用。上下文 1,050,000、最大输出 128,000,输入 $10 / 输出 $50 每百万 token,超过 272K 输入加价;洛洛 AI 曾经的默认模型
Claude Fable 5.1 发布:价格不变、缓存读取降到 $0.25,Mythos 5.1 是同一个模型
Anthropic 2026-09-01 发布。上下文 1M、最大输出 128K,输入 $10 / 输出 $50 不变,缓存读取从 $1 降到 $0.25;Mythos 5.1 与它是同一个模型,只对审核过的网络安全和生命科学机构开放