Editly

DeepSeek V4 Pro 0813

DeepSeek-V4-Pro-0813 是 DeepSeek 旗舰模型正式版的日期快照:1.6 万亿参数混合专家架构,每个 token 激活 490 亿参数,100 万 token 上下文窗口,单次最长输出 38.4 万 token。默认开启思考模式,同时提供非思考端点应对低延迟场景,权重以 MIT 许可开放,输入每百万 token 0.435 美元、输出 0.87 美元。

DeepSeek V4 Pro 0813 是什么

0813 是快照标签,不是新架构。它锁定的是 2026 年 8 月 12 日进入 DeepSeek 官方 API 文档的 V4 Pro 正式版构建,与更便宜的 DeepSeek-V4-Flash-0731 并列。旗舰档的配置如下。

1.6T 总参数,49B 激活

稀疏混合专家架构,每个 token 只激活约 3% 的权重。DeepSeek 把压缩稀疏注意力与重度压缩注意力组合使用,引入流形约束超连接,并采用 Muon 优化器训练。专家层跑 FP4,其余部分保持 FP8。

100 万 token 上下文,38.4 万 token 输出

输入可吃满一百万 token,大致相当于一个中等规模代码库或几千页文档;单次回复最多输出 38.4 万 token。长链路 Agent 任务和全仓库审查一次调用就能装下,不必再搭切块流水线。

默认思考,三档推理强度

不显式关闭的话,模型答题前会先推理。强度分 Non-think、Think High、Think Max 三档;Max 就是 DeepSeek 用来跑分的 V4-Pro-Max 配置,也是在推理与 Agent 任务上最接近闭源前沿模型的一档。

为 Agent 开发者准备的接口

结构化 JSON 输出、工具调用、Responses API,以及兼容 Anthropic API 的端点——现有客户端换个 base URL 就能指向 DeepSeek。对话前缀续写和中间填充补全目前处于 beta。

MIT 许可的开放权重

DeepSeek 在 Hugging Face 上以 MIT 许可发布 deepseek-ai/DeepSeek-V4-Pro 与 DeepSeek-V4-Pro-Base。自建部署、微调、商用都不需要额外授权,唯一的门槛是硬件而不是条款。

接近前沿的成绩,开放模型的价格

SWE-bench Verified 80.6、LiveCodeBench 93.5、Codeforces 评分 3206、GPQA Diamond 90.1,而输出价格不到每百万 token 一美元。与顶级闭源模型的差距真实存在,但已不再是数量级之差。

DeepSeek V4 Pro 0813 与 DeepSeek V4 Flash 0731 对比

两档同为 100 万 token 上下文、38.4 万 token 输出上限。Pro 多花的钱买到的是容量——更大的总参数与激活参数、更强的推理——代价是约三倍的 token 单价和只有五分之一的并发额度。

V4 Flash 0731
V4 Pro 0813Pro
总参数284B1.6T
单 token 激活参数13B49B
上下文窗口100 万 token100 万 token
最长输出38.4 万 token38.4 万 token
思考模式默认开启,可切非思考默认开启,另有 Think High 与 Think Max
输入每百万 token,缓存未命中0.14 美元0.435 美元
输出每百万 token0.28 美元0.87 美元
API 并发上限2500500
适合什么大批量分类、抽取、对话,以及便宜的长上下文过一遍硬推理、Agent 编码、深度研究、整仓库作业

DeepSeek V4 Pro 0813 跑分

以下是 DeepSeek-V4-Pro 在最高推理强度下的公布成绩,也就是 DeepSeek 记作 V4-Pro-Max 的配置。厂商自报的数字当上限看,接入流水线前先跑自己的评测集。

SWE-bench Verified:80.6

端到端解决真实的 GitHub issue。这已经站进 Agent 编码的可用区间,不过最强的闭源模型在其最佳配置下仍高于它。更难的 SWE-Bench Pro 成绩为 55.4。

LiveCodeBench:93.5

题目取自训练截止之后发布的竞赛,抗数据污染。所以这个分数反映的是对没见过的新题的推理能力,而不是背下来的答案。

Codeforces:3206

算法竞赛题上达到 grandmaster 区间的评分。用来判断它能否在约束下写出紧凑正确的实现很合适,但不代表它擅长在杂乱的生产代码库里穿行。

GPQA Diamond:90.1

研究生水平的物理、化学、生物题,出题时就刻意让搜索派不上用场。九成正确率说明它在代码之外的硬技术问答上同样撑得住。

HMMT 2026 年 2 月:95.2

奥赛难度的数学题,且赛事在模型训练窗口关闭之后举行。考的是多步证明式推理,不是算术。

Terminal-Bench 2.0:67.9,BrowseComp:83.4

这两项是工具使用最值得看的 Agent 基准:把真实 shell 一路驱动到任务完成,以及在实时网络上找到难以定位的事实。100 万 token 上下文和默认思考模式在这里最见效。

DeepSeek V4 Pro 0813 价格

以下是 DeepSeek 官方 API 的每百万 token 价格。真正值得围着做工程的一项是上下文缓存:命中价格约为未命中的一百二十分之一,所以固定的系统提示词或钉住的仓库快照几次调用就能把成本赚回来。DeepSeek 已预告 API 整体价格将有明显上调,做预算前请先看官方价格页。

V4 Flash 0731
V4 Pro 0813Pro
Grok 4.5
输入,缓存命中0.0028 美元0.003625 美元未公布
输入,缓存未命中0.14 美元0.435 美元约 2 美元
输出0.28 美元0.87 美元约 6 美元
上下文窗口100 万 token100 万 token50 万 token
权重开放,MIT开放,MIT闭源
把上下文填满一次的成本约 0.14 美元约 0.44 美元50 万 token 约 1 美元

怎么用 DeepSeek V4 Pro 0813

  1. 01

    第一步:钉住模型名

    在 DeepSeek 平台上调 deepseek-v4-pro 拿到滚动更新的旗舰版;需要一套在评测跑到一半时不会变的权重,就指名 DeepSeek-V4-Pro-0813 这个快照。端点走 OpenAI 格式,多数 SDK 只需要改 base URL 和密钥。

  2. 02

    第二步:选推理强度,缓存好前缀

    规划、调试、多步工具调用就把思考开着;补全、路由这类拼延迟的调用切到非思考端点。把系统提示词和体量大又固定的文档统统放在每次请求的最前面,让它们落进缓存命中。

  3. 03

    第三步:也可以绕开 DeepSeek 官方

    OpenRouter 这类聚合平台已上架 deepseek/deepseek-v4-pro-0813,各家推理服务商也提供托管版。因为权重是 MIT 许可的,你还可以自己部署——但要为一个 1.6T 参数的 MoE 留足预算,实际上就算跑 FP4 也得多卡节点。

  4. 04

    第四步:让输出落到实处

    前沿文本模型是上游基建——它写出方案、代码或提示词。如果最终交付物是视频或图片,就把它写出的文本交给生成模型:把 DeepSeek 写的提示词直接贴进 Editly 出片。

DeepSeek V4 Pro 0813 常见问题

把 DeepSeek 写的提示词变成视频

让前沿文本模型写分镜,再交给生成模型出片。注册 Editly,Seedance、Veo 3、Hailuo、Qwen Image 共用一份积分,不必按模型分别订阅。