北京时间8月3日,海外知名开源AI Agent工具OpenCode公布了一组令全球AI行业震动的数据:DeepSeek V4 Flash在其平台上的单日Token处理量达到8万亿(8T)。
这不是一个抽象的数字。8万亿Token大约等同于5600万套《三体》三部曲的文字总量,相当于数百万程序员全天不间断调用AI编程助手所产生的信息流。更令人震撼的是对比维度——全球最大模型路由平台OpenRouter接入了400多款大模型,全平台日均处理量约为6.6万亿Token。仅DeepSeek V4 Flash一款模型、在单一渠道上的单日吞吐,就已超越数百款模型的总和。
数据拆分来看,8万亿Token中5万亿来自平台免费试用额度消耗,3万亿为开发者通过付费套餐OpenCode Go产生的真实商业调用。后者代表着开发者用真金白银投票的结果。
从上线到登顶:不到一周的闪电战
DeepSeek V4 Flash于2026年4月24日正式发布并全面开源,而其在OpenCode平台上的爆发式增长始于近日正式版接入后的短短数天。
OpenCode首席执行官Jay在8月1日公开透露,自DeepSeek V4 Flash上线以来,平台整体使用量一天之内飙升了30%,付费订阅量同步激增。”最近的订单电话都被打爆了,而且指名道姓只要DeepSeek V4 Flash。”
与此同时,模型API分发平台OpenRouter的最新周报显示,在7月27日至8月2日的统计周期内,DeepSeek V4 Flash以7.22万亿Token的周调用量登顶全球第一,较前一周增长13%。中国AI大模型包揽了全球调用量前五名,这一格局在OpenRouter历史上前所未有。
为什么是DeepSeek V4 Flash?
极致性价比的成本
DeepSeek V4 Flash的技术参数本身就是一份宣言:
表格
| 指标 | 数据 |
|---|---|
| 总参数量 | 2840亿(284B) |
| 激活参数量 | 130亿(13B) |
| 上下文窗口 | 原生100万Token |
| 训练数据 | 32万亿Token |
| 精度格式 | FP4 + FP8混合 |
| 开源协议 | MIT(完全开放,可商用) |
每次推理仅激活4.58%的参数,这意味着模型拥有2840亿参数的知识储备,却只需承担130亿参数的算力成本。这种”以小博大”的稀疏MoE架构,使得V4 Flash的推理成本比旗舰版V4-Pro低90%,API单次调用价格压至极低水平。
在定价层面,即使OpenAI已将GPT-5.6 Luna的价格下调80%,DeepSeek V4 Flash在其自有API上的单任务成本仍比前者低约60%。有开发者在OpenAI产品负责人的推广帖下留言:”我们希望得到DeepSeek的价格。”这句话被业内视为2026年夏天全球开发者”用脚投票”的最佳注脚。
百万Token上下文的”基础设施化”
V4 Flash原生支持100万Token上下文,且通过混合注意力机制将长文本推理的计算量压缩至前代的27%、KV Cache显存占用压缩至10%。对AI编程场景而言,这意味着模型可以一次性”读完”整个代码仓库,无需分段拆解,大幅降低了开发者使用门槛。
全栈国产算力支撑
DeepSeek V4系列全栈适配华为昇腾算力,技术报告将华为昇腾与英伟达GPU并列,采用昇腾950芯片原生支持的FP4精度格式。这一选择不仅实现了供应链自主可控,更通过软硬件深度协同将推理效率推至极限,为8万亿Token的日吞吐量提供了底层算力保障。
OpenAI被迫应战:降价80%仍难追赶
DeepSeek V4 Flash的爆发式增长直接倒逼海外头部厂商展开价格竞争。OpenAI罕见地将GPT-5.6 Luna价格下调80%,试图以降价策略挽回开发者。
然而,市场的反应说明了一切。美国模型长期按”稀缺性”定价——烧数十亿美元训练最强模型,API高价售卖以回收成本。而DeepSeek走出了一条截然不同的路:用极致工程效率将推理成本压到地板价,用开源策略将生态壁垒彻底拆除。当”免费够用、付费极便宜”成为现实,高价闭源模型的护城河正在被快速侵蚀。
值得注意的是,DeepSeek母公司深度求索仅有约139名员工,平均年龄二十余岁。这支”青年近卫军”以不到行业巨头十分之一的人力规模,在全球AI竞技场中持续制造冲击波。
冷静视角:8万亿背后的结构性信号
行业分析人士指出,本次8万亿Token流量集中在代码垂直赛道,不能简单等同于通用C端场景对海外闭源模型的全面超越。此外,免费流量占比较高(5万亿),付费的3万亿Token才是衡量商业价值的核心指标。
但不可否认的是,流量暴涨背后预示着AI行业的深层趋势转变:
大模型竞争不再只追逐纸面评测分数,推理吞吐、调用成本、稳定可用性正在成为新的胜负手。 当Agent工作流成为主流开发范式,单次任务可能触发数十轮模型调用,Token消耗呈指数级增长。谁能以最低成本承接最大规模的并发调用,谁就掌握了下一代AI基础设施的入场券。
全球AI调用格局:中国模型持续领跑
事实上,DeepSeek的统治力并非一日之功。早在今年5月,OpenRouter数据就显示中国AI大模型周调用量已连续四周超过美国,稳居全球首位。DeepSeek旗下模型周调用总量达5.74万亿Token,环比增长25.9%,超过Anthropic和谷歌,连续两周位居第一。
从5月的”周榜登顶”到8月的”单日8万亿”,中国开源模型在全球开发者生态中的渗透速度远超预期。全球AI产业的”调用重心”正在不可逆地向东迁移。
写在最后
8万亿Token,是一个数字,更是一面镜子。它照出的不仅是DeepSeek V4 Flash的产品力,更是整个AI产业正在经历的范式转移——从”谁更聪明”到”谁更便宜、更快、更稳定”。
当一家139人的中国公司,用开源和极致效率逼得全球最强大的AI企业不得不打折应战时,旧时代的定价逻辑已经宣告终结。2026年的夏天,全球开发者已经做出了选择。

© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



