WayToClawEarn
高影响DeepSeek Official + Independent Analysis

DeepSeek V4 Flash 0731发布:13B模型在编程Agent任务上超越1.6T Pro

DeepSeek V4 Flash 0731证明了一件事:AI编程Agent的能力不取决于模型大小。同样13B激活参数架构,仅靠重新后训练就在九项Agent基准测试中超越1.6T参数的V4 Pro。对开发者来说,模型突然变得更便宜、更强了。

WayToClawEarn Editorial发布 2026年8月3日

编辑基于公开来源复核 · AI 辅助整理。 内容方法

核心结论

DeepSeek 刚刚证明了一件事:AI 编程 Agent 的能力不取决于模型大小。V4 Flash 0731 版本使用了与预览版完全相同的 13B 激活参数架构——唯一改变的是后训练。结果:它在九项 Agent 基准测试中超越了 DeepSeek 自家的 1.6T 参数 V4 Pro,包括 Terminal Bench 2.1 的 82.7 分。如果你在构建或使用 AI 编程 Agent,结论很简单:驱动 Agent 的模型突然变得更便宜、更强了。

发生了什么

7 月 31 日,DeepSeek 将 V4 Flash 从预览版升级为正式发布。没有架构变化,没有参数扩展,仅仅是一次重新后训练。

关键数据:

  • Terminal Bench 2.1:82.7 分——超越 V4 Pro
  • DeepSWE:54.4 分——在软件工程任务上超过 V4 Pro
  • 九项 Agent 基准测试全部显示 V4 Flash 领先于体积大得多(1.6T 参数)的 V4 Pro

相同的 284B 总参数 / 13B 激活参数的 MoE 架构。两个模型之间的差距纯粹是后训练差距。

价格保持不变:约 0.14 美元/百万输入 token,约为 V4 Pro 的三分之一,比前沿闭源模型便宜一个数量级。

为什么这对 AI 编程很重要

我认为有三个值得关注的点。

第一,缩放假设正在裂开。 过去两年,行业的剧本一直是:更大模型意味着更好编程能力。GPT-4 击败 GPT-3.5,Opus 击败 Sonnet。你投入更多参数,就能获得更好结果。V4 Flash 0731 以一种具体的、可测量的方式打破了这个模式:在 Agent 编程任务上,一个训练方式不同的 13B 模型,超越了旧方式训练的 1.6T 模型。

第二,后训练是新的主战场。 如果不动基础模型就能获得如此大的提升,那么在编程 Agent 领域胜出的公司,不一定是拥有最大预训练集群的公司,而是拥有最佳后训练配方的公司——针对 Agent 工作流优化的 RL、人类反馈和合成数据的正确组合。

第三,廉价编程 Agent 真的来了。 以 0.14 美元/百万输入 token 的价格,在 V4 Flash 上运行 Agent 循环的成本,是在 Claude Opus 或 GPT-5.6 上运行的一小部分。对于每个会话进行数十甚至数百次 API 调用的编程 Agent 来说,成本差异就是「我每天都在用」和「我省着用」之间的区别。

需要注意的陷阱

在把你的 Agent 切换到 V4 Flash 之前,有几件事得说清楚:

基准测试是 DeepSeek 自己报告的。他们用自己的测试框架运行,不是第三方评估。在我们看到独立复现之前——在 SWE-bench Verified、真实编码任务、多轮 Agent 工作流上——这些数字是方向性的,不是定论。

模型权重还没上 Hugging Face。API 已经上线且与预览版向后兼容,你可以通过 OpenRouter 或 DeepSeek 自己的 API 今天就试用。但如果想在本地运行,还得等等。

而且 V4 Flash 是纯文本模型。没有视觉能力,没有多模态。如果你的编程 Agent 依赖截图理解或 UI 交互,这不能直接替代 GPT-5.6 或 Claude Opus 5。

对编程 Agent 生态意味着什么

我的看法是:这次发布对 DeepSeek 本身的意义,远不如它对开源编程模型管道的意义大。

半年前,在开源模型上运行一个能用的编程 Agent,意味着接受显著的质量妥协。今天,开源和闭源模型在 Agent 编程任务上的差距正在快速缩小——而像这样的后训练改进,正在从底层向上弥合这个差距。

对于 Cline、Aider、OpenCode、Continue 这类允许接入任意模型的工具来说,一个在 Terminal Bench 上得分 82.7、价格 0.14 美元/百万 token 的模型,彻底改变了「自带模型」编程 Agent 的经济学。你不再需要在「便宜但平庸」和「昂贵但好用」之间二选一。

对前沿实验室来说,这个信号令人不安:如果一个重新后训练的 13B 模型能在 Agent 任务上击败你的旗舰模型,你的护城河可能比你想象的要薄。

底线

如果你在运行编程 Agent 且关心成本,DeepSeek V4 Flash 0731 值得一试。基准测试的故事很有说服力,即便考虑到自报数据的保留意见。更重要的是,它是一个趋势中的数据点:后训练才是编程能力提升的关键所在,模型大小正在成为一个越来越不可靠的能力指标。

至少,在你通常使用更便宜模型的场景下试试它,看看你是否能感受到差异。你可能会发现,你并不像你以为的那么需要大模型。

deepseekv4-flashcoding-agentbenchmarkopen-sourceai-model
免责声明:本站案例均为知识分享内容,仅供灵感与参考,不构成收益承诺;由此进行的外部执行与结果请自行判断并承担相应责任。
DeepSeek V4 Flash 0731发布:13B模型在编程Agent任务上超越1.6T Pro · WayToClawEarn