DeepSeek V4 Pro 正式版(版本号 DeepSeek-V4-Pro-0813)是深度求索(DeepSeek)于2026年8月12日深夜无预告上线的V4系列旗舰模型首个正式版本,承接2026年4月24日发布的预览版。该模型为大规模混合专家(MoE)架构,总参数量约1.6T,每次推理激活约49B参数(注:也有来源披露其总参数为2840亿、激活参数130亿,不同来源在参数统计口径上存在差异),支持100万Token上下文窗口和最高384K Token输出。与预览版相比,正式版的核心变化并非架构升级,而是针对Agent场景的后训练数据与策略做了针对性重做,使Agent能力实现跨越式提升——DeepSWE基准从12.8飙升至62.7(+390%),Terminal Bench 2.1从72.1跳至87.9,多项指标逼近甚至反超Anthropic的Fable 5和Opus 4.8。模型采用MIT许可证开源权重,API已全面开放调用。

DeepSeek V4 Pro 正式版核心特点
- Agent能力飞跃式提升:正式版通过针对性后训练,在软件工程Agent(DeepSWE)、终端操作(Terminal Bench 2.1)、安全攻防(CyberGym)、全栈编码(DSBench)等Agent核心基准上实现翻倍乃至数倍增长,从预览版的”几乎无法完成自主编码任务”跃升至主流Agent产品第一梯队。
- 百万级超长上下文:1M Token上下文窗口在开源旗舰中处于顶尖水平,配合384K最大输出,可一次性容纳整个大型代码仓库、数十份长文档或长程Agent任务的完整执行日志,避免频繁压缩记忆导致的信息丢失。
- 原生多模态支持:预览版为纯文本模型,正式版首次原生支持图像推理,DeepThink引擎可在同一思考流程中分析图片、解读截图、处理混合文档,实现”看图干活”的Agent能力突破。
- 三档推理深度可选:支持Non-Think(快速响应)、Think High(复杂分支)、Think Max(最深推理)三档模式,开发者可根据任务复杂度灵活调节推理深度,在速度、Token消耗与推理能力之间取得最优平衡。
- 极致性价比:当前定价为输入3元/百万Token、输出6元/百万Token,综合成本约为Anthropic Fable 5的1/46、Kimi K3的1/3,在”单位智能成本”维度具有碾压级优势。
- 双协议全面兼容:同时支持OpenAI Chat Completions、Anthropic API和Responses API三种接口格式,可零迁移成本接入Claude Code、OpenAI Codex、OpenCode等主流Agent工具生态。
- 国产算力适配:已在华为昇腾平台提供服务,并适配寒武纪MTT S5000等国产芯片,计划于2026年下半年在昇腾950超节点上批量部署。
DeepSeek V4 Pro 正式版技术原理
- 大规模MoE稀疏激活架构:模型每层配置384个专家,推理时仅动态激活其中6个,激活比例约3%,以极低的计算成本获得远超同规模稠密模型的知识容量。配合负载均衡机制防止专家退化,确保各专家均匀参与训练。
- CSA+HCA混合注意力架构:采用压缩稀疏注意力(CSA)与重度压缩注意力(HCA)的组合设计,在Token维度压缩KV缓存,结合序列维度的DSA稀疏注意力机制,使1M上下文场景下单Token推理FLOPs仅为前代V3.2的27%,KV缓存占用仅为V3.2的10%。
- 流形约束超连接(mHC):升级传统残差连接为流形约束超连接,增强深层网络的建模能力,使模型在保持训练稳定性的同时提升深层特征表达的上限。
- Muon优化器:采用Muon优化器替代传统AdamW,加速收敛并提升训练稳定性,在大规模MoE模型训练中表现尤为突出。
- FP4+FP8混合精度量化:MoE专家权重与QK路径采用FP4量化感知训练,其余层使用FP8精度,在保证模型质量的前提下大幅减少显存占用与算力消耗。
- KV Cache滑窗与压缩算法:首次引入KV Cache滑窗机制和压缩算法,大幅减少Attention计算和访存开销,使百万级上下文下的长程推理在工程上可行。
- 针对性Agent后训练:正式版与预览版共用同一架构和参数规模,能力跃升完全来自后训练阶段的重做——包括大规模Agent轨迹数据、工具调用链路数据、多步代码修改数据的专项训练,以及强化学习对齐优化。
DeepSeek V4 Pro 正式版主要功能
- 复杂代码Agent:支持自主读取代码仓库、批量修改源码文件、运行单元测试、定位Bug并自主修复,在DeepSWE基准上得分62.7,已进入全球第一梯队。
- 长文档分析与知识库问答:1M上下文窗口可一次处理整本技术文档、数百页财务报告或大型论文合集,支持跨文档信息关联与推理。
- 工具调用(Tool Calls):原生支持函数调用协议,可驱动搜索Agent、数据分析Agent、自动化工作流等需要与外部系统交互的智能体应用。
- Responses API:新增Responses API支持,可接入OpenAI Codex等新一代Agent工具,实现多步骤自主任务的编排与执行。
- 思考模式深度推理:默认开启思考模式,模型在输出答案前进行显式推理链生成,支持设置
reasoning_effort=max获得最深推理能力,适用于数学竞赛、复杂逻辑分析等高难度任务。 - 结构化输出(JSON Output):稳定生成符合JSON Schema的结构化数据,适合作为后端数据处理管道和自动化工作流的核心引擎。
- 图像推理:首次原生支持图像输入,可在同一思考流程中分析截图、解读图表、处理混合文档,拓展Agent的感知边界。
- 代码补全(FIM):支持Fill-in-the-Middle代码补全(仅限非思考模式),适配主流IDE的代码补全场景。
- 对话前缀续写(Beta):支持对已有对话进行前缀续写,便于在长程Agent任务中保持上下文连贯性。
DeepSeek V4 Pro 正式版应用场景
- 软件工程全流程自动化:作为Coding Agent的底层模型,驱动代码生成、审查、调试、重构、Pull Request处理等全链路开发任务。实测可一次性生成700+行完整可运行的HTML应用,代码质量达到”一次运行通过”的水平。
- 企业级智能Agent系统:结合Tool Calls和1M上下文,构建长时运行的自主Agent,执行跨系统数据查询、报告生成、流程审批等复杂多步骤任务,并发限制500适合高价值复杂任务。
- 安全攻防与网络运维:在CyberGym基准上得分83.3,略超Fable 5的83.1,可用于安全日志分析、漏洞检测、自动化渗透测试等安全智能体场景。
- 科学研究与竞赛数学:在HMMT Feb 2026上达到94.0分,IMO Answer Bench达到88.0分,GPQA Diamond达到89.1分,适用于数学建模、论文分析、科学假设生成等研究辅助场景。
- 长程自动化任务:在AutomationBench上得分31.8反超Fable 5的29.1,适合需要连续执行大量步骤、跨多个工具协作的端到端自动化工作流。
- 企业知识库与智能客服:1M上下文可容纳企业全量知识文档,结合RAG架构实现精准的长文档问答和信息抽取。
- AI编程工具后端:已适配Claude Code、OpenCode、CodeBuddy等主流编程Agent工具,开发者可零成本切换模型后端,享受旗舰级编码能力。
定价与接入方式
表格
| 计费类型 | 价格(元/百万Token) | 说明 |
|---|---|---|
| 输入(缓存命中) | 0.025 | 前缀缓存命中时享受极低价格 |
| 输入(缓存未命中) | 3 | 首次输入或新上下文 |
| 输出 | 6 | 模型生成内容 |
| 并发限制 | 500 | 低于Flash的2500,适合复杂任务 |
重要提示:DeepSeek官方已在价格页面标注”计划近期整体上调API服务定价,预计涨幅较大”,并已预告峰谷定价机制——工作日9:00-12:00和14:00-18:00为高峰时段,价格将翻倍(输入6元、输出12元)。当前价格为窗口期低价,建议重度用户提前评估成本。
接入方式:base_url不变,将model参数设为deepseek-v4-pro即可自动指向0813正式版,支持OpenAI格式(https://api.deepseek.com)和Anthropic格式(https://api.deepseek.com/anthropic)两种接口。旧模型名deepseek-chat和deepseek-reasoner已于7月24日停用,需迁移至新模型名。
与竞品横向对比
表格
| 基准测试 | V4 Pro 0813 | Fable 5 | Opus 4.8 | Kimi K3 |
|---|---|---|---|---|
| Terminal Bench 2.1 | 87.9 | 88.0 | 85.0 | 88.3 |
| DeepSWE | 62.7 | 70.0 | 58.0 | 67.5 |
| CyberGym | 83.3 | 83.1 | 78.3 | 78.3 |
| AutomationBench | 31.8 | 29.1 | 27.2 | 30.8 |
| DSBench-Hard | 67.2 | 68.3 | — | 63.0 |
| HLE(带工具) | 60.0 | 63.0 | 57.9 | 54.7 |
| 输入价格( $ /M) | ≈0.42 | 10 | — | 3 |
| 输出价格( $ /M) | ≈0.84 | 50 | — | 15 |
V4 Pro在9项可比基准中,Terminal Bench 2.1几乎持平Fable 5(差0.1),CyberGym和AutomationBench实现反超,整体进入全球Agent模型第一梯队,而综合成本仅为Fable 5的约1/46。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



