2026 年 8 月 13 日,DeepSeek 宣布 V4 全系列模型正式版(GA)上线。旗舰款 DeepSeek V4 Pro 的 0813 构建结束了自 4 月 24 日开源权重以来近四个月的预览期,官方 API 的 deepseek-v4-pro 端点已经指向新构建。四天后(8 月 17 日 0 点),全系列 API 切换到峰谷分时定价——高峰时段输出价从 6 元涨到 27 元/百万 Token。
一边是大涨的能力,一边是大涨的价格,这个时间点值得把 V4 Pro 正式版认真上手一遍。这篇文章不复述发布会,只解决四件事:正式版到底强在哪、接入要改什么、新计费下怎么用最省、以及两个已经有人踩过的坑。
一、正式版变了什么:架构没动,后训练暴力拉升
先说结论:0813 和预览版是完全相同的架构,总参数 1.6 万亿、每 Token 激活约 490 亿的稀疏 MoE,1M Token 上下文窗口、384K 最大输出。所有提升来自后训练——但幅度大得不像同一个模型:
| 基准 | V4 Pro 预览版 | V4 Pro 0813 | 涨幅 |
|---|---|---|---|
| DeepSWE(软件工程) | 12.8 | 62.7 | +49.9 |
| DSBench-Hard | 31.1 | 67.2 | +36.1 |
| CyberGym(网络安全) | 52.7 | 83.3 | +30.6 |
| DSBench-FullStack | 41.8 | 71.1 | +29.3 |
| NL2Repo | 38.5 | 61.5 | +23.0 |
| Terminal Bench 2.1 | 72.1 | 87.9 | +15.8 |
放到行业里看:社区对主流模型做基准几何平均,GPT-5.6 Sol 65.5、Fable 5 64.5、Opus 5 64.0,V4 Pro 0813 拿到 62.5,已经超过了 Kimi K3 的 62.3——一个开源权重模型,离最贵的闭源模型群只差约 2 分。Terminal Bench 2.1 的 87.9 分更是直接压过 Opus 4.8 的 85.0。
需要冷静的一点:它依然不支持视觉输入,DeepSeek 官方表态视觉不在 V4 Pro 系列的路线图上。截图理解、UI 还原类需求,别找它。
二、接入:模型名不用改,两个参数要重新认识
接入端有个好消息:调用模型名仍是 deepseek-v4-pro,不需要拼接带日期的模型 ID,老代码零改动自动切换到 0813。API 同时支持 OpenAI 格式、Anthropic 格式、Responses API、JSON 输出和工具调用,接到现有编程 Agent 里基本是一行配置的事。
curl https://api.deepseek.com/chat/completions \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-pro",
"messages": [
{"role": "system", "content": "你是资深后端工程师,只做最小必要改动。"},
{"role": "user", "content": "给这个 Express 路由加上请求频率限制,并解释方案取舍。"}
],
"reasoning_effort": "high"
}'
正式版支持思考/非思考双模式,以及 reasoning_effort 推理档位(含 high 和 xhigh,xhigh 映射为最大推理力度)。我的用法建议:
- 日常补全、解释、小改动:非思考模式或
high档,又快又便宜; - 跨文件重构、架构方案、疑难 bug:开思考 +
high; xhigh留给真正需要超长推理链的任务——原因见第四节的坑。
另外提醒一句数据安全:在更多第三方供应商接入前,OpenRouter 上的 deepseek/deepseek-v4-pro-0813 目前直连 DeepSeek 官方 API。发送敏感代码前,先确认你能接受对方的数据政策。
三、峰谷定价生效后:把重任务排进闲时
8 月 17 日起的分时计费规则很简单:每天北京时间 9:00–12:00、14:00–18:00 为高峰,价格为闲时的两倍。V4 Pro 高峰输出价 27 元/百万 Token,闲时约一半。落地到你的工作流,就是三条纪律:
- 批量任务夜里跑。测试生成、全库文档、批量重构这类异步任务,用 cron 或 CI 定时到 20:00 之后或清晨触发,同样工作量直接省一半输出费。
- 交互式编码尽量避开午休前后的高峰窗口,或者高峰时段把简单请求降级给 V4 Flash(输出 0.28 美元/百万 Token 量级,还有免费档)。
- 死磕缓存命中率。缓存命中输入价只有未命中的约 1/120,OpenRouter 实测 V4 Pro 的缓存命中率能到 88–92%。要点是系统提示词和对话历史逐字节稳定——别在每条消息里塞时间戳,别动态改写 system prompt。有人实测重型 Agent 负载跑一整天花 12.5 美元,而缓存命中率推到 99% 的同类负载只要几美元。
涨价应对的系统打法(多模型备胎、预算告警)我们之前专门写过,这里不展开,本篇只把和 V4 Pro 正式版直接相关的三条做到位。
四、两个真实的坑,提前知道
坑一:长程 Agent 循环会提前停止。 开发者 karminski3 实测:在长程智能体编码任务里把 reasoning_effort 设为 max/xhigh,模型倾向于提前收工——50 轮优化循环,3 次测试有 2 次在 42–43 轮左右就自己停了,没有用完所有机会,该场景成绩甚至没打过 GLM-5.1。如果你用 V4 Pro 跑长时间自主循环,务必在 harness 里加监控:检测"任务未完成但模型主动结束"的情况,触发续跑或降档重试。日常 high 档目前没有这个报告。
坑二:便宜但慢,复杂任务可能带 bug。 Hacker News 上有个 n=1 的对比:同一个功能开发任务,V4 Pro 0813 在 Codex CLI 里跑了 12 分钟、花 0.12 美元但产出了带 bug 的代码;Grok 4.6 用 3 分 18 秒、1.41 美元零 bug。样本量虽小,但符合普遍反馈:它更便宜、更慢,大多数时候够用——关键路径任务请保留测试和人工 review,别因为它分数高就裸奔上线。
五、什么时候用它,什么时候别用
| 场景 | 建议 |
|---|---|
| 纯文本 Agent 编码、批量代码任务 | 首选,性价比目前无敌 |
| 成本敏感的 CI/CD 流水线(夜跑) | 首选,闲时 + 缓存命中双重省钱 |
| 需要看图(截图、设计稿、报错图片) | 别用,换多模态模型 |
| 长程自主循环(几十轮以上) | 可用但要加提前停止监控 |
| 单任务要求最高可靠性(金融、医疗) | 关键路径仍建议 Fable 5 / Opus 级模型兜底 |
| 数据敏感的私有代码 | 官方 API 直连有数据政策顾虑,考虑自托管(MIT 协议,有人用二手 P40 攒机三四千美元跑起来了) |
小结
V4 Pro 0813 是"后训练撬动基座"路线的又一次验证:架构不变,DeepSWE 从 12.8 拉到 62.7,综合能力离一线闭源模型只差 2 分。上手记住五件事:模型名 deepseek-v4-pro 不用改,老代码自动升级;思考模式和 reasoning_effort 按任务难度显式指定;8 月 17 日起高峰 9–12 点和 14–18 点双倍价,批量任务排到闲时;系统提示词逐字节稳定,把缓存命中率当 KPI;长跑 Agent 任务监控提前停止。它不适合看图,也不该无人值守地上生产——但对纯文本编码 Agent 来说,这个性价比目前找不到对手。
