Qwen3.8-Flash – 通义千问发布并开源的新一代多模态大语言模型

Qwen3.8-Flash是阿里通义千问团队正式发布并开源的新一代多模态大语言模型,同时也是全新一代千问大模型 Qwen4 架构的技术预览版。该模型采用全新下一代(Next)架构,主模型 Transformer 参数量为125B(约1250亿),额外配备51B的 N-gram Embedding 参数,但每次推理仅激活6B参数,以极致的参数效率实现了超越 Claude Opus 4.6、接近 Opus 4.8 的前沿性能,创下模型效率的全球新基准。模型原生支持262,144 tokens上下文窗口,可通过 YaRN 扩展至1M tokens。得益于架构和训练的全面革新,其训练成本较前代 Qwen3.7-Plus 骤降近90%,推理定价为每百万Tokens输入1元、输出3元,仅为 Claude Opus 4.6 的3%,最低至 DeepSeek-V4-Flash 价格的1/3。Qwen3.8-Flash-Next 模型权重已在 Hugging Face 和魔搭社区全面开源,同步发布 FP8 量化版本。

Qwen3.8-Flash - 通义千问发布并开源的新一代多模态大语言模型

Qwen3.8-Flash核心特点

  • 极致参数效率:125B总参数中每token仅激活6B,以不到5%的激活比例实现了超越 Claude Opus 4.6 的性能,在效率维度上重新定义了”大模型”的含义。仅完成预训练的基座模型,在通用知识(SuperGPQA)、数学推理(GSM8K)、编程(SWEBench-Pretrain)等基础能力上已超越参数量为其3倍的 Qwen3.7-Plus 基座模型。
  • 颠覆性性价比:训练成本仅为前代 Qwen3.7-Plus 的1/9;推理定价每百万Tokens输入1元、输出3元,是 Claude Opus 4.6 的3%,是 DeepSeek-V4-Flash 闲时价格的2/3、忙时价格的1/3,将全球模型性价比”斩杀”至极致新水平。
  • 原生多模态能力:作为多模态 MoE 模型,原生支持文本、图像、视频、文档等多种模态输入,在视觉推理、移动端操作、具身智能等多模态任务中表现显著领先。
  • 百万级长上下文:原生支持262K tokens上下文,通过 YaRN 可扩展至1M tokens。在高缓存命中的长上下文实际场景中,QSA注意力机制可提速8倍以上。
  • Qwen4架构雏形:所采用的 Next 新架构是 Qwen4 系列的技术预览,在 Attention、Residual、Embedding、Optimization 四个维度进行了全面革新,为下一代千问大模型奠定基础。
  • 全面开源:模型权重(含 FP8 量化版本)在 Hugging Face 和魔搭社区同步开源,开发者可使用 Transformers、SGLang、vLLM 等主流框架进行部署。

Qwen3.8-Flash技术原理

Qwen3.8-Flash 的架构与此前所有千问大模型完全不同,围绕四个核心方向进行了系统性革新:

GDN + QSA 混合注意力架构

在 Attention 层,Qwen3.8-Flash 采用 GDN(Gated DeltaNet)与 QSA(Qwen Sparse Attention)高效融合的混合架构。GDN 负责高效压缩历史信息,形成”浓缩笔记”;QSA 则通过轻量级 Indexer 在 micro-block 粒度上精准筛选重要上下文,显著降低长序列注意力计算开销。面对1M token的超长上下文,QSA 的 Attention Kernel 在 Prefill 和 Decode 阶段分别实现最高7.6倍和4.9倍的加速。这种设计使模型在处理超长文档、代码仓库和多轮对话时,既能保持全局信息的完整理解,又不会因计算量爆炸而拖慢响应速度。

Gated Residual 多分支信息传递

在 Residual 层,引入自研的 Gated Residual(GR)机制,将传统 Transformer 的单条信息主通道拆分并拓展为4条并行分支,通过动态 Gate 控制信息的读写量。这种设计让模型可以根据需求动态决定哪些信息走哪条路径,早期关键信息可经长距离通道直达深层网络,显著提升跨层传递效率与训练稳定性。残差状态支持 FP8 存储,大幅降低访存开销。

N-gram Embedding 外挂记忆库

在 Embedding 层,引入51B参数的 N-gram Embedding,利用局部上下文查表为模型 Transformer 参数提供更高效的寻址能力。这51B参数存放于 Host Memory(主机内存),通过异步 Prefetch 与模型计算重叠,无需长期占用 GPU 显存,以极少的资源消耗为模型”外挂”了一个大规模的”记忆指南手册”。在每次 token 计算时,N-gram Embedding 无需参与计算,却能有效扩展模型的容量和知识覆盖面。

Muon Optimizer 与训练优化

在 Optimization 层,采用 Muon Optimizer,并针对正交化精度、与 AdamW 的参数分工及融合参数拆分等策略进行优化,使模型可稳定使用更大学习率与 Batch Size。同时,因架构改进,过去常用的”批次大小预热”策略被证明不再必要,实现了去预热化训练,训练效率进一步提升。模型结构和训练优化协同进行,收敛效率和训练吞吐量大幅提升,针对新架构重新拟合了 Scaling Law。


Qwen3.8-Flash主要功能

智能体编程

在 SWE-bench Pro 智能体编程评测中领先 Claude Opus 4.6 达9.1分,在 DeepSWE 1.1 上得分58.7。模型能够自主理解代码仓库结构、定位问题、编写修复方案并验证结果,适用于自动修bug、代码重构、功能开发等场景。

专业办公任务

在 CoWorkBench 办公工作流基准上得分73.9分(远超 Opus 4.6 的45.1分),在 JobBench 专业工作任务评测中领先 Opus 4.6 近20分。已首发上线”千问办公”标准模式,可覆盖95%的日常办公任务,包括公文写作、文档处理、数据分析、信息检索等。

多模态理解与推理

在 AndroidWorld 移动端智能体评测中比 Opus 4.6 高出22.5分,在 MathVision 视觉数学推理任务中超出25.1分,在具身智能 ERQA 任务中领先31.5分。模型能够理解图像内容、分析图表、解读视频,并将视觉信息与文本推理深度融合。

长程任务与工具调用

在 CoWorkBench 长程专业任务、Toolathlon Verified 真实工具调用等智能体任务中均超越 DeepSeek-V4-Flash,展现出处理复杂多步骤任务的能力。支持函数调用(Function Calling)、联网搜索、代码解释器等内置工具。

百万级上下文处理

原生支持262K tokens上下文,可扩展至1M tokens,最大输出131K tokens。支持 Context Cache 缓存长上下文请求的公共前缀,缓存命中时输入价格低至每百万Tokens 0.1元,大幅降低长文档重复处理的成本。

多格式兼容与生态接入

兼容 OpenAI 与 Anthropic 主流接口协议,可无缝接入 Claude Code、Codex 等开发者工具。支持结构化输出(JSON格式)、前缀补全(Partial Mode)、批量任务、微调等高级功能。

Qwen3.8-Flash同类产品对比

表格

对比项Qwen3.8‑FlashLing‑3.0‑Flash
研发主体阿里通义千问蚂蚁百灵(InclusionAI)
产品定位高效 MoE 多模态高速基座,主打高吞吐、中文办公场景原生混合推理 MoE 基座,面向生产级智能体与高并发业务
核心特色总参 125B,推理激活 6B;N‑gram Embedding 增强,原生 262K 可扩至 1M 上下文,多模态能力完整,文档处理能力强总参 124B,推理激活 5.1B;Hybrid‑linear MoE 架构,推理吞吐高,支持多量化版本,工具调用表现优异
开源情况开源权重开放开源权重开放,支持 INT4/FP8 多量化部署
适用场景千问办公、长文档解析、私有化部署、多模态应用开发企业高并发 API 服务、Agent 智能体、轻量化私有化、批量任务处理

Qwen3.8-Flash应用场景

企业办公自动化

作为”千问办公”标准模式的内置模型,Qwen3.8-Flash 可处理公文写作、会议纪要整理、Excel数据分析、PPT内容生成、合同审查等日常办公任务。极低的推理成本使其适合大规模企业级部署,让AI办公助手不再是高成本奢侈品。

智能体开发与自动化工作流

在智能体编程、工具调用、多步骤任务规划等方面表现突出,适合构建自动化运维、客服机器人、数据处理流水线等 Agent 应用。百万级上下文窗口使其能处理完整的代码仓库和长对话历史,为复杂 Agent 场景提供充足的”工作记忆”。

移动端与具身智能

在 AndroidWorld 和 ERQA 评测中的领先表现,表明模型具备操作手机界面和理解物理环境的能力,可用于移动端自动化测试、手机助手、机器人控制等场景。

长文档分析与知识处理

1M tokens上下文窗口结合 QSA 稀疏注意力机制,使模型能高效处理完整法律文档、学术论文合集、大型代码库等超长输入,适用于法律审查、学术研究、代码审计等需要深度理解长文本的专业场景。

开发者工具与代码辅助

在 SWE-bench Pro 和 DeepSWE 上的优异表现,使其成为代码生成、调试、重构的强力助手。兼容 OpenAI/Anthropic 接口协议,可直接嵌入现有 IDE 和开发工具链。

私有化部署与定制化训练

完全开源的模型权重(含 FP8 量化版本)支持企业在自有硬件上部署,满足数据安全和合规要求。支持微调功能,可基于企业私有数据训练专属模型。6B激活参数的设计使单卡部署成为可能,大幅降低了私有化部署的硬件门槛。

多模态内容理解

原生支持图像、视频、文档等多模态输入,可用于图表分析、视频内容理解、图文混合检索等场景,为内容审核、媒体分析、教育辅助等应用提供多模态智能支撑。


最后想说

Qwen3.8-Flash 的发布标志着大模型行业在”效率”维度上的一次范式突破。它证明了前沿性能不再必须依赖海量参数激活——通过 GDN+QSA 混合注意力、Gated Residual 多分支传递、N-gram Embedding 外挂记忆和 Muon 优化器等四项架构创新的协同,125B参数中仅激活6B即可超越 Claude Opus 4.6,同时将训练和推理成本压缩至前代的零头。作为 Qwen4 架构的技术预览,它不仅是一个独立可用的生产级模型,更是下一代千问大模型家族的技术基石。对于开发者和企业而言,Qwen3.8-Flash 意味着前沿AI能力第一次真正进入了”用得起、用得快、用得广”的阶段。

© 版权声明
为这篇文章评分
10.0/ 10
2 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...