DeepSeek V4 Pro vs GPT-6 Astra:评测结果、工具与 API 成本
对照同版本第三方指标、输入类型、工具支持与价格,区分公开评测表现和实际仓库任务的成功率。
本页内容
在所列 Artificial Analysis v4.3 测试中,Astra 的综合指数和终端任务成绩较高,V4 Pro 的 API 单价较低。Astra 还支持图片输入和多种托管工具,而 V4 Pro 以文本输入为主。V4 Pro 服务继续保留,选择不需要建立在它即将退役的假设上。
评测与价格概览
在 Artificial Analysis Intelligence Index v4.3 的同口径评测里,GPT-6 Astra max 得分 53,DeepSeek V4 Pro 0813 max 得分 36。按照这一套评测组合,能力差距是真实存在的。
但价格差距同样巨大。OpenAI 官方 API 定价是 Astra 输入 $10 / 1M Tokens、输出 $50 / 1M;DeepSeek V4 Pro 高峰缓存未命中输入 $1.32、输出 $3.96,低峰还会再减半。
本节来源:Artificial Analysis — GPT-6 Astra vs DeepSeek V4 Pro 0813 · OpenAI API — GPT-6 Astra model · DeepSeek API — Models & Pricing
同版本第三方评测
厂商发布会经常各用各的 Harness 和 Benchmark 版本。Artificial Analysis 的价值在于用同一套 v4.3 方法跑两个模型。细分结果里,差距最大的之一是 Terminal-Bench v4.0;而 SciCode 和长上下文检索 AA-LCR 的距离小得多。
| Artificial Analysis v4.3 | GPT-6 Astra max | DeepSeek V4 Pro 0813 max |
|---|---|---|
| Intelligence Index | 53 | 36 |
| AutomationBench-AA | 68% | 57% |
| Terminal-Bench v4.0 | 59% | 14% |
| SciCode | 56% | 51% |
| Humanity's Last Exam | 55% | 41% |
| AA-LCR v1.1 | 81% | 80% |
你的 Agent 可能被某一个窄问题卡死:工具调用稳定性、Shell 恢复、浏览器操作、延迟、长上下文召回。真正上线前仍然需要自己的回归任务集。
本节来源:Artificial Analysis — GPT-6 Astra vs DeepSeek V4 Pro 0813 · Artificial Analysis — Intelligence Index v4.3
API 单价与长输入费率
下表按基础费率展示单价。Astra 单次输入超过 272K 时,整次请求的输入与缓存费率提高到 2 倍、输出提高到 1.5 倍。任务级账单还需累计重试和工具费用;低单价也不等于 API 并发没有限制。
| 标准 API 定价 | GPT-6 Astra | DeepSeek V4 Pro 0813 高峰 |
|---|---|---|
| 输入 / 1M | $10.00 | $1.32(缓存未命中) |
| 缓存输入 / 1M | $1.00 | $0.044 |
| 输出 / 1M | $50.00 | $3.96 |
| 上下文窗口 | 1.05M | 1M |
| 最大输出 | 128K | 384K |
本节来源:OpenAI API — GPT-6 Astra model · DeepSeek API — Models & Pricing
Coding / Agent:Astra 的优势更集中在高难度端到端任务
OpenAI 在 GPT-6 Astra 发布评测中给出 Terminal-Bench 4.0 57.9%、DeepSWE v1.1 74.1%。Artificial Analysis 的独立评测也显示 Astra 在当前 Terminal-Bench v4.0 上明显领先 V4 Pro。
DeepSeek V4 Pro 在较早的 Terminal Bench 2.1 和自己那套 Harness Agent 评测里依然很强,但不能把 2.1 的 87.9 直接拿来和 4.0 的 57.9 比大小。Benchmark 换版本以后,题目难度可以发生巨大变化。
本节来源:OpenAI — GPT-6 Astra · Artificial Analysis — GPT-6 Astra vs DeepSeek V4 Pro 0813 · DeepSeek — V4 Pro GA release
上下文和工具:两个模型都已经面向长任务设计
两边都已经做到约百万 Token 上下文。Astra 支持图片输入,并通过 Responses API 提供 Web Search、File Search、Code Interpreter、Hosted Shell、Computer Use、MCP 等工具能力。DeepSeek V4 Pro 当前是文本输入,但也支持 Tool Calls、Responses API 与 Anthropic 兼容接口。
放进 DSH 这种 Harness 后,模型只是其中一层。Preset、工具展示和权限策略都可能显著改变最终成绩,所以生产比较最好只换模型,不要同时把整个 Agent 配置也换掉。
本节来源:OpenAI API — GPT-6 Astra model · DeepSeek API — Models & Pricing
使用条件与服务状态
需要原生图片输入或已经依赖 OpenAI 托管工具时,Astra 的接口支持更直接;以文本为主、预算受限时,V4 Pro 的较低单价值得考虑。对于复杂终端任务,可以参考同版本评测表现,再验证实际仓库中的修改质量。
DeepSeek 当前已确认 V4 Pro 在 9 月 14 日后继续服务、计费不变。若还想比较 V4.1 Flash,应独立核对新模型的能力和价格,不沿用 V4 Pro 的分数。
本节来源:DeepSeek API — Models & Pricing · Artificial Analysis — Intelligence Index v4.3
Artificial Analysis — GPT-6 Astra vs DeepSeek V4 Pro 0813 · OpenAI API — GPT-6 Astra model · DeepSeek API — Models & Pricing · Artificial Analysis — Intelligence Index v4.3 · OpenAI — GPT-6 Astra · DeepSeek — V4 Pro GA release