DeepSeekDSH
独立社区指南与 DeepSeek 无隶属关系。官方源码快照

DeepSeek V4 Pro 0813:Agent 评测、价格与使用限制

整理 V4 Pro 的官方 Agent 成绩、第三方评测和 API 价格,说明各项测试条件与当前服务状态。

独立编辑与核验:DeepSeekDSH源码核验:0.1.5-rc.2 · 2026-09-11
本页内容

V4 Pro 0813 的官方 Code Agent 成绩使用了 DeepSeek Harness Minimal Mode。它与第三方评测的测试版本和工具不同,分数需要分别阅读。V4 Pro 当前继续提供服务,并未按旧计划在 9 月 14 日后切换为 V4.1 Flash。

证据面板

V4 Pro:官方 Agent 成绩 vs 当前第三方证据

同一个模型,只要 Benchmark 版本和 Harness 变化,数字就可能完全不同。所有分数都要绑定测试条件。

Sep 11, 2026

DeepSeek 8 月 13 日 Agent 结果

公开 Code Agent 任务使用 DeepSeek Harness Minimal Mode、max effort、top_p 0.95、temperature 1.0。

Terminal-Bench 2.187.9
DeepSWE62.7
NL2Repo61.5
Toolathlon-Verified74.1
DSBench-Hard67.2

DeepSeek 官方公布的 V4 Pro 0813 Agent 跑分

8 月 13 日正式版的重点非常明确:加强生产环境里的 Agent 能力,尤其是终端、仓库级代码、工具调用和自动化任务。

BenchmarkV4 Pro 0813
HLE(无工具 / 有工具)42.7 / 60.0
Terminal Bench 2.187.9
NL2Repo61.5
DeepSWE62.7
Toolathlon-Verified74.1
AutomationBench (Public)31.8
DSBench-Hard67.2

本节来源:DeepSeek — V4 Pro GA release · DeepSeek API — Change Log

第三方指数与子任务分数

Artificial Analysis v4.3 给 DeepSeek V4 Pro 0813 的 Intelligence Index 是 36。它明显高于该模型页面列出的整体中位水平,但低于当前最前沿的 GPT-6 Astra 和 Claude Fable 5.1;后两者在同一版本 Index 中都是 53。

综合指数由多个测试组合而成,不直接表示仓库任务的通过率。评估 V4 Pro 时,还应分别考虑开放权重部署、上下文容量、API 单价和执行工具的约束。

本节来源:Artificial Analysis — DeepSeek V4 Pro 0813 · Artificial Analysis — Intelligence Index v4.3

官方 Code Agent 测试设置

DeepSeek 明确说明,V4 Pro 0813 的公开 Code Agent 任务使用 DeepSeek Harness Minimal Mode,reasoning effort 为 max,top_p=0.95,temperature=1.0。这些成绩对应指定模型、Harness 与参数,不能直接推广到任意 Agent。

如果另一家公司用不同 Coding Harness、不同工具权限、不同 Benchmark 版本跑出来一个数字,直接横向排榜很容易得出假结论。真正有效的比较需要尽量固定 Benchmark 版本、Agent Scaffold 和推理档位。

评测环境

Minimal Mode 的工具组成属于测试条件。比较两个模型时,应同时核对 Preset 和执行权限。

本节来源:DeepSeek — V4 Pro GA release · DeepSeek API — Change Log

V4 Pro 的价格和上下文

截至 2026-09-12,V4 Pro 提供 100 万上下文、最大 384K 输出;高峰未缓存输入每百万 $1.32、输出 $3.96。工作日北京时间 09:00–12:00、14:00–18:00 为高峰,其他时段价格减半。官方已确认 9 月 14 日后继续服务,计费不变。

项目V4 Pro 0813
上下文1M Tokens
最大输出384K Tokens
高峰输入(缓存未命中)$1.32 / 1M
高峰输出$3.96 / 1M
低峰输入(缓存未命中)$0.66 / 1M
低峰输出$1.98 / 1M

本节来源:DeepSeek API — Models & Pricing

长上下文与开放权重的用途

百万上下文允许在请求中容纳更多仓库资料,但不保证所有细节都能被准确检索。官方 Agent 测试提供了终端与编辑器任务的能力证据,实际稳定性还取决于工具错误处理和业务验收。

开放权重为自行部署和调整推理环境提供了选择。不过自托管需要另计硬件、吞吐和运维费用,不能沿用官方 API 的 Token 单价估算。

本节来源:DeepSeek — V4 preview release · Artificial Analysis — DeepSeek V4 Pro 0813

继续使用或主动切换

现有项目可以继续使用 V4 Pro,不需要按已变更的 9 月 14 日切换计划迁移。新项目也可将 V4.1 Flash 纳入比较,尤其是需要图片输入或较低 API 单价时。

主动切换前,检查结构化输出、工具参数和关键测试是否保持兼容,并保留原模型配置以便回退。V4 Pro 的旧评测仍可用于对照,但不能充当 V4.1 Flash 的成绩。

本节来源:DeepSeek API — Models & Pricing

继续看模型性能