DeepSeekDSH
独立社区指南与 DeepSeek 无隶属关系。官方源码快照

AI 模型 Benchmark 怎么看:版本、工具、推理设置与成本

用公开评测示例说明测试版本、Harness、权限和推理设置如何影响分数,并给出仓库回归集的记录方法。

独立编辑与核验:DeepSeekDSH源码核验:0.1.5-rc.2 · 2026-09-11
本页内容

Agent 评测通常测量模型、工具与执行环境组成的系统。比较两个分数前,需要核对任务集版本、Harness、权限和推理配置;条件不一致时,分数仍有参考价值,但不能直接当作模型能力差值。

Benchmark 实验室

V4 Pro 在两种评测条件下的成绩

因为它们不是同一个 Benchmark 版本,也不是同一个 Harness。先检查条件,再比较数字。

V4 Pro example
DeepSeek 官方87.9Terminal-Bench 2.1 · DSH Minimal · max effort
Artificial Analysis14%Terminal-Bench 4.0 · AA harness · max model setting

模拟可比性条件

不能直接排名0/3 项条件已勾选;不改变上方示例
另一个真实例子:Gemini 3.8 Flash 首发文章曾引用 Intelligence Index 59,而当前 v4.3 模型页是 41。Index 版本换了,不能把 59 → 41 解释成模型退化。

比较评测结果前的六项核对

同名评测可能采用不同任务集、工具和执行预算。下列条件决定两个分数是否具有可比性。

  • Benchmark 名字一样还不够,必须确认具体版本。
  • 确认模型通过什么 Agent Harness / Scaffold 运行。
  • 尽量对齐 reasoning effort、采样参数和 Token Budget。
  • 确认是否允许 Tool、浏览器、代码执行、Vision。
  • 把厂商自报分数和独立第三方评测分开。
  • 看“完成一个正确任务的成本”,不要只看 Token 单价。

本节来源:Artificial Analysis — Intelligence Index v4.3 · DeepSeek API — Change Log · Google DeepMind — Gemini 3.8 Flash model card · Anthropic — Claude Fable 5.1

Benchmark 换版本以后,同一个百分比已经不是同一回事

Gemini 3.8 Flash 是最直观的例子:Google Model Card 同时写了 Terminal-Bench 2.1 = 89.4%,Terminal-Bench 4.0 = 19.1%。两项成绩对应不同版本任务集,不能据此判断模型退步。

因此 DeepSeek V4 Pro 的 Terminal Bench 2.1 = 87.9,不能直接和 GPT-6 Astra 的 Terminal-Bench 4.0 = 57.9 比。两个百分比对应不同题目和设置,差值不代表模型能力差距。

例子成绩为什么不能直接比
Gemini 3.8 Flash — Terminal-Bench 2.189.4%版本/任务集不同
Gemini 3.8 Flash — Terminal-Bench 4.019.1%版本/任务集不同
DeepSeek V4 Pro — Terminal Bench 2.187.9不是 v4.0
GPT-6 Astra — Terminal-Bench 4.057.9%不是 2.1

本节来源:Google DeepMind — Gemini 3.8 Flash model card · DeepSeek — V4 Pro GA release · OpenAI — GPT-6 Astra

Agent Benchmark 里,Harness 本身就是性能的一部分

DeepSeek 明确写过,V4 Pro 的公开 Code Agent 测试使用 DeepSeek Harness Minimal Mode。Coding Harness 会决定模型怎么读取文件、怎么调用 Shell、怎么编辑、怎么接收 Tool Result、什么时候需要权限确认。执行环境改变后,同一模型的成绩也可能变化。

模型评测与 Agent 产品评测应分开记录。工具超时、错误消息缺失或不必要的审批,都可能影响任务结果,不能全归因于模型。

本节来源:DeepSeek — V4 Pro GA release · DeepSeek API — Change Log

reasoning effort 和生产保护机制也会改变跑分

DeepSeek 多项公开 Agent 测试使用 max 推理强度;OpenAI 给 Astra 提供 low 到 max 多档 reasoning effort;Anthropic 则明确说明 Fable 5.1 的生产 Safeguards 会阻止或路由部分网络安全、生物任务,从而影响相关 Benchmark。

记录具体推理配置与回退机制。不同厂商的同名 effort 档位不代表相同计算量,比较时可另外控制费用或时间预算。

本节来源:DeepSeek — V4 Pro GA release · OpenAI API — GPT-6 Astra model · Anthropic — Claude Fable 5.1

Token 单价不等于完成任务的真实成本

一个输出 Token 贵十倍的模型,如果一次就做对,而便宜模型循环、重试、最后还要人来修,那么贵模型的“单任务成本”反而可能更低。反过来,如果失败非常容易自动检测和重试,便宜模型在大规模任务里就可能更划算。

Artificial Analysis 现在越来越强调 Cost per Task。你自己的测试也应该把 Token 费用、总耗时、人工介入次数一起记录。

本节来源:Artificial Analysis — Intelligence Index v4.3 · Artificial Analysis — DeepSeek V4 Pro 0813

为 DSH 建立初始回归集

可以从已完成工作中选 20 个任务作为初始回归集,固定 Workspace 快照和 Preset。这个数量只是起点,不保证结果稳定;关键任务应重复执行,并逐步扩大样本。

记录最终正确率、Tool Call 次数、命令失败次数、人工批准次数、完成时间、输入/输出 Token,以及第一次出错后能不能自己恢复。以后 Provider 静默升级模型别名,或者像 DeepSeek 一样把旧模型名路由到新后端时,再重新跑一遍。

  • 5 个仓库阅读 / 定位问题任务
  • 5 个带测试的受控代码修改任务
  • 5 个需要 Tool,并人为注入一次失败让模型恢复的任务
  • 5 个使用真实项目文档的长上下文任务
结果记录

按任务类型统计验收率、总费用和人工检查工时,保留失败任务。若采用多模型路由,首轮失败与交接费用也需要计入。

本节来源:DeepSeek API — Models & Pricing · OpenAI API — GPT-6 Astra model · Anthropic — Claude Fable 5.1 · Google DeepMind — Gemini 3.8 Flash model card

模型性能文章