DeepSeek V4 正式发布并开源:1.6T 参数、1M 上下文、FP4 精度,全面对标顶级闭源模型
DeepSeek 于 2026 年 4 月 24 日正式发布 V4 预览版,同步开源 1.6T 参数的 V4-Pro(49B 激活)与 284B 参数的 V4-Flash(13B 激活)。新架构引入混合稀疏注意力(Hybrid Sparse Attention)、流形约束超连接(mHC)和 FP4 专家权重,默认支持 1M 上下文长度,在 Agentic Coding、Math/STEM 等多个基准测试中达到开源 SOTA,API 价格限时低至 75% 折扣。
核心结论
DeepSeek V4 的发布标志着开源大模型在参数规模、架构创新和实用性上首次真正追平顶级闭源模型。对于 AI 赚钱和自动化从业者而言,这意味着:API 调用成本大幅下降(V4-Pro 限时 $0.87/M 输出 token)、1M 上下文默认支持彻底改变了长文档处理的工作流、开源权重可私有化部署进一步降低了合规门槛。SGLang 和 Miles 已在发布首日提供推理和 RL 训练支持,生态就绪度远超以往任何一代 DeepSeek 模型。
关键要点
- 事件发生时间:2026-04-24
- 影响对象:AI 开发者、自动化流水线搭建者、内容生产团队
- 核心变化:开源模型在 Agentic Coding 和推理能力上首次接近 GPT-5/Gemini-3 级别,且成本仅为闭源模型的 1/5 至 1/10
背景与发布内容
2026 年 4 月 24 日,DeepSeek 官方通过其 API 文档站正式发布 V4 预览版,同步在 Hugging Face 开源全部权重。这是 DeepSeek 继 V3、V3.1、R1、V3.2 之后跨代最大的一次升级,在 Hacker News 上获得超过 2000 点热度,成为当周最受关注的 AI 新闻。
此次发布包含两个模型版本:
- DeepSeek-V4-Pro:1.6T 总参数量 / 49B 激活参数。目标对标 GPT-5、Gemini-3.1-Pro 等顶级模型。
- DeepSeek-V4-Flash:284B 总参数量 / 13B 激活参数。主打低延迟、低成本场景,适合生产部署。
两个模型均支持 1M 上下文长度,并同时提供 Thinking(推理)和 Non-Thinking(快速)两种模式。
架构创新:三大核心技术
DeepSeek V4 相比前代 V3.2 的突破主要体现在三项关键创新:
| 维度 | 技术 | 对我们意味着什么 |
|---|---|---|
| 注意力机制 | Hybrid Sparse Attention(混合稀疏注意力):每层混合滑动窗口注意力与两种压缩机制(4:1 top-k 或 128:1 dense) | 1M 上下文不再需要巨额计算资源,长文档处理可用性大幅提升 |
| 残差连接 | mHC(Manifold-Constrained Hyper-Connections):流形约束超连接,替代传统残差连接 | 深层网络梯度流动更优,训练稳定性和推理质量同步提升 |
| 量化精度 | FP4 专家权重:原生 FP4 量化 MoE 专家层,适配 Blackwell 架构 | 在推理速度提升的同时保持高精度,更适配最新硬件 |

基准测试表现
DeepSeek V4-Pro 在多项权威评测中的表现:
| 基准 | 得分 | 排名 |
|---|---|---|
| GPQA Diamond | 90.1% | 开源 SOTA |
| GSM8K | 92.6% | 开源 SOTA,#3 全局 |
| MMLU-Pro | 87.5% | 开源 SOTA |
| HLE | 37.7% | 开源领先 |
OpenAI 前研究员 Sebastien Bubeck 也公开评论了 DeepSeek V4 的能力(见相关讨论)。
API 定价:极具竞争力的价格策略
DeepSeek V4 的定价方案是当前市场中性价比最高的选项之一:
| 模型 | 输入(缓存命中) | 输入(缓存未命中) | 输出 |
|---|---|---|---|
| V4-Flash | $0.028/M | $0.14/M | $0.28/M |
| V4-Pro(限时 75% off) | $0.03625/M | $0.435/M | $0.87/M |
| V4-Pro(标准价) | $0.145/M | $1.74/M | $3.48/M |
V4-Pro 限时折扣持续到何时?官方未公布截止日期,建议尽早利用。
两个模型均支持 384K 最大输出 token、JSON Output、Tool Calls、Chat Prefix Completion 和 FIM Completion。API 兼容 OpenAI 格式(https://api.deepseek.com)和 Anthropic 格式(https://api.deepseek.com/anthropic)。
注意:原有 deepseek-chat 和 deepseek-reasoner 端点将于 2026 年 7 月 24 日之后完全停用,目前已自动路由到 deepseek-v4-flash。
生态支持:SGLang + Miles 首日上线
发布当天,SGLang 团队和 Miles 团队同步上线了完整的 Day-0 支持方案:
- 推理优化:ShadowRadix 前缀缓存、HiSparse CPU 扩展 KV、MTP 推测解码、Flash Compressor、Lightning TopK
- Kernel 集成:FlashMLA、FlashInfer、DeepGEMM Mega MoE、TileLang mHC
- RL 训练:完整并行方案(DP/TP/SP/EP/PP/CP),支持 FP8 训练
- 硬件支持:Hopper、Blackwell、Grace Blackwell、AMD、NPU
# SGLang 启动 DeepSeek V4 推理示例
pip install sglang[all]
python -m sglang.launch_server --model deepseek-ai/DeepSeek-V4-Pro --tp 8对 AI 自动化和赚钱的实操影响
- 自动化流水线成本暴降:V4-Flash 的 $0.28/M 输出价格使得高频 AI Agent 调用成为可能,比 GPT-4o/Claude Sonnet 低 5-10 倍
- 长文档处理默认方案:1M 上下文让整本书、完整代码库、上千页文档的 AI 分析成为默认能力,不再需要 RAG 和分块
- 私有化部署可行:V4-Flash(284B/13B 激活)可在单节点部署,适合对数据合规有严格要求的场景
- Agent 能力跃升:官方在 Agentic Coding 基准上达到开源 SOTA,这意味着 AI Agent 工具链(如 n8n、OpenClaw、Claude Code)可以基于 DeepSeek V4 获得更高质量的结果
工具词条段
正文中自然使用的工具:DeepSeek、OpenAI、ChatGPT、Claude Code、n8n、Gemini、Hermes Agent、OpenClaw、SGLang
内链引导
主题中心
2026 AI 编程工具全景指南
从 Copilot 改版到 Claude Code / DeepSeek 低成本方案——把分散资讯收成可搜索、可对比的工具矩阵。
进入「2026 AI 编程工具全景指南」 →赚钱视角
这个趋势怎么赚钱?
WayToClawEarn 的差异在可验证的赚钱案例,而不只是资讯。从这些复盘开始:
浏览全部案例 →