DeepSeek V4 Pro 0813:Agent 评测、价格与使用限制
整理 V4 Pro 的官方 Agent 成绩、第三方评测和 API 价格,说明各项测试条件与当前服务状态。
本页内容
V4 Pro 0813 的官方 Code Agent 成绩使用了 DeepSeek Harness Minimal Mode。它与第三方评测的测试版本和工具不同,分数需要分别阅读。V4 Pro 当前继续提供服务,并未按旧计划在 9 月 14 日后切换为 V4.1 Flash。
DeepSeek 官方公布的 V4 Pro 0813 Agent 跑分
8 月 13 日正式版的重点非常明确:加强生产环境里的 Agent 能力,尤其是终端、仓库级代码、工具调用和自动化任务。
| Benchmark | V4 Pro 0813 |
|---|---|
| HLE(无工具 / 有工具) | 42.7 / 60.0 |
| Terminal Bench 2.1 | 87.9 |
| NL2Repo | 61.5 |
| DeepSWE | 62.7 |
| Toolathlon-Verified | 74.1 |
| AutomationBench (Public) | 31.8 |
| DSBench-Hard | 67.2 |
本节来源:DeepSeek — V4 Pro GA release · DeepSeek API — Change Log
第三方指数与子任务分数
Artificial Analysis v4.3 给 DeepSeek V4 Pro 0813 的 Intelligence Index 是 36。它明显高于该模型页面列出的整体中位水平,但低于当前最前沿的 GPT-6 Astra 和 Claude Fable 5.1;后两者在同一版本 Index 中都是 53。
综合指数由多个测试组合而成,不直接表示仓库任务的通过率。评估 V4 Pro 时,还应分别考虑开放权重部署、上下文容量、API 单价和执行工具的约束。
本节来源:Artificial Analysis — DeepSeek V4 Pro 0813 · Artificial Analysis — Intelligence Index v4.3
官方 Code Agent 测试设置
DeepSeek 明确说明,V4 Pro 0813 的公开 Code Agent 任务使用 DeepSeek Harness Minimal Mode,reasoning effort 为 max,top_p=0.95,temperature=1.0。这些成绩对应指定模型、Harness 与参数,不能直接推广到任意 Agent。
如果另一家公司用不同 Coding Harness、不同工具权限、不同 Benchmark 版本跑出来一个数字,直接横向排榜很容易得出假结论。真正有效的比较需要尽量固定 Benchmark 版本、Agent Scaffold 和推理档位。
Minimal Mode 的工具组成属于测试条件。比较两个模型时,应同时核对 Preset 和执行权限。
本节来源:DeepSeek — V4 Pro GA release · DeepSeek API — Change Log
V4 Pro 的价格和上下文
截至 2026-09-12,V4 Pro 提供 100 万上下文、最大 384K 输出;高峰未缓存输入每百万 $1.32、输出 $3.96。工作日北京时间 09:00–12:00、14:00–18:00 为高峰,其他时段价格减半。官方已确认 9 月 14 日后继续服务,计费不变。
| 项目 | V4 Pro 0813 |
|---|---|
| 上下文 | 1M Tokens |
| 最大输出 | 384K Tokens |
| 高峰输入(缓存未命中) | $1.32 / 1M |
| 高峰输出 | $3.96 / 1M |
| 低峰输入(缓存未命中) | $0.66 / 1M |
| 低峰输出 | $1.98 / 1M |
长上下文与开放权重的用途
百万上下文允许在请求中容纳更多仓库资料,但不保证所有细节都能被准确检索。官方 Agent 测试提供了终端与编辑器任务的能力证据,实际稳定性还取决于工具错误处理和业务验收。
开放权重为自行部署和调整推理环境提供了选择。不过自托管需要另计硬件、吞吐和运维费用,不能沿用官方 API 的 Token 单价估算。
本节来源:DeepSeek — V4 preview release · Artificial Analysis — DeepSeek V4 Pro 0813
继续使用或主动切换
现有项目可以继续使用 V4 Pro,不需要按已变更的 9 月 14 日切换计划迁移。新项目也可将 V4.1 Flash 纳入比较,尤其是需要图片输入或较低 API 单价时。
主动切换前,检查结构化输出、工具参数和关键测试是否保持兼容,并保留原模型配置以便回退。V4 Pro 的旧评测仍可用于对照,但不能充当 V4.1 Flash 的成绩。
DeepSeek — V4 Pro GA release · DeepSeek API — Change Log · Artificial Analysis — DeepSeek V4 Pro 0813 · Artificial Analysis — Intelligence Index v4.3 · DeepSeek API — Models & Pricing · DeepSeek — V4 preview release