Gemini 3.8 Flash:编程评测、音视频输入与 API 价格
整理 Google 公布的 DeepSWE、Terminal-Bench 结果,以及百万上下文、输入类型、首发价与常规价。
本页内容
Gemini 3.8 Flash 支持文本、图片、音频和视频输入,提供百万上下文和最多 64K 文本输出。Google 公布了软件工程与终端任务成绩;其中 Terminal-Bench 2.1 和 4.0 使用不同任务集,两个百分比不能直接比较。
Google 官方公布的 Gemini 3.8 Flash 核心成绩
Google DeepMind 2026 年 9 月 Model Card 显示,3.8 Flash 相比 3.7 Flash 在软件工程与 Agent 知识工作流上都有明显提升。
| Benchmark | Gemini 3.8 Flash | Gemini 3.7 Flash |
|---|---|---|
| DeepSWE v1.1 | 73.7% | 65.3% |
| Terminal-Bench 2.1 | 89.4% | 85.8% |
| Terminal-Bench 4.0 | 19.1% | 11.2% |
| HLE-Verified | 54.9% | 53.6% |
| OSWorld 2.0 | 59.0% | 50.6% |
| GDPVal-AA v2 | 1545 Elo | 1482 Elo |
本节来源:Google DeepMind — Gemini 3.8 Flash model card · Google — Introducing Gemini 3.8 Flash
软件工程与终端任务成绩
DeepSWE v1.1 73.7%,已经让 Gemini 3.8 Flash 在 Google 的对比表里靠近很多大型 Frontier Model;Terminal-Bench 2.1 也达到 89.4%。这类指标不是简单代码补全,而是偏 Agent 化的软件工程任务。
因此它已经可以作为 Coding Agent 的主力候选:读仓库、调用工具、连续执行多个步骤,尤其适合同时在意吞吐和调用成本的场景。
Terminal-Bench 2.1 与 4.0 不能混比
两个数字并不矛盾,它们说明 Benchmark 版本标签有多重要。Terminal-Bench 4.0 是另一套、更难的评测,不能把 2.1 和 4.0 的百分比当成同一张试卷。
这对比较 DeepSeek、OpenAI 特别重要:DeepSeek 部分发布表仍然重点展示 Terminal Bench 2.1,而 OpenAI 和 Artificial Analysis 最新页面已经大量使用 Terminal-Bench 4.0。
看到“模型 A 89 分、模型 B 58 分”时,先确认 Benchmark 版本、Harness、工具配置完全一致,再讨论谁强。否则数字都可能是真的,但比较结论是假的。
本节来源:Google DeepMind — Gemini 3.8 Flash model card · DeepSeek — V4 Pro GA release · OpenAI — GPT-6 Astra
100 万上下文 + 文本、图片、音频、视频输入
Gemini 3.8 Flash 支持 Text、Image、Audio、Video,最大上下文 1M Tokens,文本最大输出 64K。这使它很适合不只是看代码的 Agent:例如看截图做 UI QA、读图表和长 PDF、分析视频,再结合工具完成后续动作。
Google 也公布了较强的图表推理和长视频成绩,但这些仍然属于厂商测试。真正上线时最好拿你自己的截图、PDF、视频类型跑一遍。
首发价与常规价
Google 当前给 Gemini 3.8 Flash 的首发优惠价是输入 $0.75 / 1M Tokens、输出 $3.75 / 1M;Model Card 同时标出了常规价 $1.50 / $7.50。计算长期预算时,应同时保留常规价格方案,工具服务和媒体处理费用另计。
| API 项目 | Gemini 3.8 Flash |
|---|---|
| 首发输入 / 1M | $0.75 |
| 首发输出 / 1M | $3.75 |
| 常规输入 / 1M | $1.50 |
| 常规输出 / 1M | $7.50 |
| 上下文 | 1M Tokens |
| 最大输出 | 64K Tokens |
本节来源:Google DeepMind — Gemini 3.8 Flash model card · Google — Introducing Gemini 3.8 Flash
Gemini 3.8 Flash 最适合什么任务?
如果你同时需要低成本、多模态、超长上下文和不错 Coding,它很有吸引力:UI 截图 QA、长文档分析、既要看视觉结果又要改代码的 Agent、大批量知识工作流都很适合。
但最难的自主 Terminal 任务仍然有明显上升空间,Terminal-Bench 4.0 的结果已经说明这一点。不要因为便宜就直接把更强模型全部替掉,先跑自己的回归集。
本节来源:Google DeepMind — Gemini 3.8 Flash model card · Artificial Analysis — Intelligence Index v4.3
Google DeepMind — Gemini 3.8 Flash model card · Google — Introducing Gemini 3.8 Flash · DeepSeek — V4 Pro GA release · OpenAI — GPT-6 Astra · Artificial Analysis — Intelligence Index v4.3