AI 模型 Benchmark 怎么看:版本、工具、推理设置与成本
用公开评测示例说明测试版本、Harness、权限和推理设置如何影响分数,并给出仓库回归集的记录方法。
本页内容
Agent 评测通常测量模型、工具与执行环境组成的系统。比较两个分数前,需要核对任务集版本、Harness、权限和推理配置;条件不一致时,分数仍有参考价值,但不能直接当作模型能力差值。
比较评测结果前的六项核对
同名评测可能采用不同任务集、工具和执行预算。下列条件决定两个分数是否具有可比性。
- Benchmark 名字一样还不够,必须确认具体版本。
- 确认模型通过什么 Agent Harness / Scaffold 运行。
- 尽量对齐 reasoning effort、采样参数和 Token Budget。
- 确认是否允许 Tool、浏览器、代码执行、Vision。
- 把厂商自报分数和独立第三方评测分开。
- 看“完成一个正确任务的成本”,不要只看 Token 单价。
本节来源:Artificial Analysis — Intelligence Index v4.3 · DeepSeek API — Change Log · Google DeepMind — Gemini 3.8 Flash model card · Anthropic — Claude Fable 5.1
Benchmark 换版本以后,同一个百分比已经不是同一回事
Gemini 3.8 Flash 是最直观的例子:Google Model Card 同时写了 Terminal-Bench 2.1 = 89.4%,Terminal-Bench 4.0 = 19.1%。两项成绩对应不同版本任务集,不能据此判断模型退步。
因此 DeepSeek V4 Pro 的 Terminal Bench 2.1 = 87.9,不能直接和 GPT-6 Astra 的 Terminal-Bench 4.0 = 57.9 比。两个百分比对应不同题目和设置,差值不代表模型能力差距。
| 例子 | 成绩 | 为什么不能直接比 |
|---|---|---|
| Gemini 3.8 Flash — Terminal-Bench 2.1 | 89.4% | 版本/任务集不同 |
| Gemini 3.8 Flash — Terminal-Bench 4.0 | 19.1% | 版本/任务集不同 |
| DeepSeek V4 Pro — Terminal Bench 2.1 | 87.9 | 不是 v4.0 |
| GPT-6 Astra — Terminal-Bench 4.0 | 57.9% | 不是 2.1 |
本节来源:Google DeepMind — Gemini 3.8 Flash model card · DeepSeek — V4 Pro GA release · OpenAI — GPT-6 Astra
Agent Benchmark 里,Harness 本身就是性能的一部分
DeepSeek 明确写过,V4 Pro 的公开 Code Agent 测试使用 DeepSeek Harness Minimal Mode。Coding Harness 会决定模型怎么读取文件、怎么调用 Shell、怎么编辑、怎么接收 Tool Result、什么时候需要权限确认。执行环境改变后,同一模型的成绩也可能变化。
模型评测与 Agent 产品评测应分开记录。工具超时、错误消息缺失或不必要的审批,都可能影响任务结果,不能全归因于模型。
本节来源:DeepSeek — V4 Pro GA release · DeepSeek API — Change Log
reasoning effort 和生产保护机制也会改变跑分
DeepSeek 多项公开 Agent 测试使用 max 推理强度;OpenAI 给 Astra 提供 low 到 max 多档 reasoning effort;Anthropic 则明确说明 Fable 5.1 的生产 Safeguards 会阻止或路由部分网络安全、生物任务,从而影响相关 Benchmark。
记录具体推理配置与回退机制。不同厂商的同名 effort 档位不代表相同计算量,比较时可另外控制费用或时间预算。
本节来源:DeepSeek — V4 Pro GA release · OpenAI API — GPT-6 Astra model · Anthropic — Claude Fable 5.1
Token 单价不等于完成任务的真实成本
一个输出 Token 贵十倍的模型,如果一次就做对,而便宜模型循环、重试、最后还要人来修,那么贵模型的“单任务成本”反而可能更低。反过来,如果失败非常容易自动检测和重试,便宜模型在大规模任务里就可能更划算。
Artificial Analysis 现在越来越强调 Cost per Task。你自己的测试也应该把 Token 费用、总耗时、人工介入次数一起记录。
本节来源:Artificial Analysis — Intelligence Index v4.3 · Artificial Analysis — DeepSeek V4 Pro 0813
为 DSH 建立初始回归集
可以从已完成工作中选 20 个任务作为初始回归集,固定 Workspace 快照和 Preset。这个数量只是起点,不保证结果稳定;关键任务应重复执行,并逐步扩大样本。
记录最终正确率、Tool Call 次数、命令失败次数、人工批准次数、完成时间、输入/输出 Token,以及第一次出错后能不能自己恢复。以后 Provider 静默升级模型别名,或者像 DeepSeek 一样把旧模型名路由到新后端时,再重新跑一遍。
- 5 个仓库阅读 / 定位问题任务
- 5 个带测试的受控代码修改任务
- 5 个需要 Tool,并人为注入一次失败让模型恢复的任务
- 5 个使用真实项目文档的长上下文任务
按任务类型统计验收率、总费用和人工检查工时,保留失败任务。若采用多模型路由,首轮失败与交接费用也需要计入。
本节来源:DeepSeek API — Models & Pricing · OpenAI API — GPT-6 Astra model · Anthropic — Claude Fable 5.1 · Google DeepMind — Gemini 3.8 Flash model card
Artificial Analysis — Intelligence Index v4.3 · DeepSeek API — Change Log · Google DeepMind — Gemini 3.8 Flash model card · Anthropic — Claude Fable 5.1 · DeepSeek — V4 Pro GA release · OpenAI — GPT-6 Astra · OpenAI API — GPT-6 Astra model · Artificial Analysis — DeepSeek V4 Pro 0813 · DeepSeek API — Models & Pricing