DeepSeekDSH
独立社区指南与 DeepSeek 无隶属关系。官方源码快照

Gemini 3.8 Flash:编程评测、音视频输入与 API 价格

整理 Google 公布的 DeepSWE、Terminal-Bench 结果,以及百万上下文、输入类型、首发价与常规价。

独立编辑与核验:DeepSeekDSH源码核验:0.1.5-rc.2 · 2026-09-11
本页内容

Gemini 3.8 Flash 支持文本、图片、音频和视频输入,提供百万上下文和最多 64K 文本输出。Google 公布了软件工程与终端任务成绩;其中 Terminal-Bench 2.1 和 4.0 使用不同任务集,两个百分比不能直接比较。

Flash 成本面板

Gemini 3.8 Flash 评测与价格

结合官方跑分和当前第三方 Index 版本,不把不同年代的分数刻度混在一起。

Sep 11, 2026

Google 当前 Model Card 证据

Google 将 3.8 Flash 定位为最智能的 workhorse 模型,并在 2026 年保持 3.7 Flash 同档促销价。

DeepSWE v1.173.7%
Vals Finance Agent v261.4%
Legal Agent all-pass10.0%
上下文1M多模态输入

Google 官方公布的 Gemini 3.8 Flash 核心成绩

Google DeepMind 2026 年 9 月 Model Card 显示,3.8 Flash 相比 3.7 Flash 在软件工程与 Agent 知识工作流上都有明显提升。

BenchmarkGemini 3.8 FlashGemini 3.7 Flash
DeepSWE v1.173.7%65.3%
Terminal-Bench 2.189.4%85.8%
Terminal-Bench 4.019.1%11.2%
HLE-Verified54.9%53.6%
OSWorld 2.059.0%50.6%
GDPVal-AA v21545 Elo1482 Elo

本节来源:Google DeepMind — Gemini 3.8 Flash model card · Google — Introducing Gemini 3.8 Flash

软件工程与终端任务成绩

DeepSWE v1.1 73.7%,已经让 Gemini 3.8 Flash 在 Google 的对比表里靠近很多大型 Frontier Model;Terminal-Bench 2.1 也达到 89.4%。这类指标不是简单代码补全,而是偏 Agent 化的软件工程任务。

因此它已经可以作为 Coding Agent 的主力候选:读仓库、调用工具、连续执行多个步骤,尤其适合同时在意吞吐和调用成本的场景。

本节来源:Google DeepMind — Gemini 3.8 Flash model card

Terminal-Bench 2.1 与 4.0 不能混比

两个数字并不矛盾,它们说明 Benchmark 版本标签有多重要。Terminal-Bench 4.0 是另一套、更难的评测,不能把 2.1 和 4.0 的百分比当成同一张试卷。

这对比较 DeepSeek、OpenAI 特别重要:DeepSeek 部分发布表仍然重点展示 Terminal Bench 2.1,而 OpenAI 和 Artificial Analysis 最新页面已经大量使用 Terminal-Bench 4.0。

比较所需条件

看到“模型 A 89 分、模型 B 58 分”时,先确认 Benchmark 版本、Harness、工具配置完全一致,再讨论谁强。否则数字都可能是真的,但比较结论是假的。

本节来源:Google DeepMind — Gemini 3.8 Flash model card · DeepSeek — V4 Pro GA release · OpenAI — GPT-6 Astra

100 万上下文 + 文本、图片、音频、视频输入

Gemini 3.8 Flash 支持 Text、Image、Audio、Video,最大上下文 1M Tokens,文本最大输出 64K。这使它很适合不只是看代码的 Agent:例如看截图做 UI QA、读图表和长 PDF、分析视频,再结合工具完成后续动作。

Google 也公布了较强的图表推理和长视频成绩,但这些仍然属于厂商测试。真正上线时最好拿你自己的截图、PDF、视频类型跑一遍。

本节来源:Google DeepMind — Gemini 3.8 Flash model card

首发价与常规价

Google 当前给 Gemini 3.8 Flash 的首发优惠价是输入 $0.75 / 1M Tokens、输出 $3.75 / 1M;Model Card 同时标出了常规价 $1.50 / $7.50。计算长期预算时,应同时保留常规价格方案,工具服务和媒体处理费用另计。

API 项目Gemini 3.8 Flash
首发输入 / 1M$0.75
首发输出 / 1M$3.75
常规输入 / 1M$1.50
常规输出 / 1M$7.50
上下文1M Tokens
最大输出64K Tokens

本节来源:Google DeepMind — Gemini 3.8 Flash model card · Google — Introducing Gemini 3.8 Flash

Gemini 3.8 Flash 最适合什么任务?

如果你同时需要低成本、多模态、超长上下文和不错 Coding,它很有吸引力:UI 截图 QA、长文档分析、既要看视觉结果又要改代码的 Agent、大批量知识工作流都很适合。

但最难的自主 Terminal 任务仍然有明显上升空间,Terminal-Bench 4.0 的结果已经说明这一点。不要因为便宜就直接把更强模型全部替掉,先跑自己的回归集。

本节来源:Google DeepMind — Gemini 3.8 Flash model card · Artificial Analysis — Intelligence Index v4.3

继续看模型性能