Qwen3.8-27B-DFlash2 – Inco AI开源的推测解码草稿模型

Qwen3.8-27B-DFlash2 是由 Inco AI 发布的、专为阿里通义千问 Qwen3.8-27B 模型定制的 DFlash 2 推测解码草稿模型(Drafter)。它不是一个独立的大语言模型,而是一个推理加速插件——配合 Qwen3.8-27B 目标模型使用,通过并行草稿生成技术,将推理吞吐量提升至自回归解码的 2.7–3.4 倍

DFlash 系列是 Inco AI 推出的推测解码技术,DFlash 1 将草稿生成从自回归改为全并行,DFlash 2 在此基础上进一步解决并行草稿的连贯性和后缀衰减问题,实现”每个验证 pass 多输出 20% 以上 token,仅增加约 1% 延迟”的突破。

Qwen3.8-27B-DFlash2 - Inco AI开源的推测解码草稿模型


Qwen3.8-27B-DFlash2核心特点

表格

特点说明
并行草稿生成整个 token 块的所有位置一次性并行预测,而非逐 token 自回归生成
路径选择器保留每个位置 top-16 候选 token,通过轻量级双线性注意力评分相邻 token 对,选出最连贯的路径
局部卷积模块在每个 attention 和 MLP 子层前后插入两抽头动态深度卷积,仅增加 3% 参数和 0.7% 延迟,有效缓解后缀衰减
输出不变性加速前后模型输出分布严格一致,不损失生成质量
生态兼容支持 SGLang、vLLM、TensorRT-LLM、llama.cpp、Ollama 等主流推理引擎
轻量高效路径选择器仅增加 2.0M 参数,卷积仅增加 16.5M 参数,总开销极低

Qwen3.8-27B-DFlash2技术原理

1. 推测解码基础

推测解码的核心思路是”小模型猜、大模型验”:一个小型草稿模型快速生成 token 候选块,大型目标模型(Qwen3.8-27B)一次性验证整个块。猜对了,一次前向传播产出多个 token;猜错了,丢弃重试。

2. DFlash 1:并行草稿

传统草稿模型仍是自回归生成(逐 token)。DFlash 1 的突破是让草稿也变成全并行——块内每个位置独立预测,极大加速草稿生成阶段。

3. DFlash 2 的两项改进

路径选择器(Path Selector) 并行预测的每个位置独立选 top-1,容易导致相邻位置不连贯(如重复词、语法断裂)。DFlash 2 的解决方案:

  • 每个位置保留 top-16 候选(而非只保留 top-1)

  • 用低秩双线性注意力为每对相邻候选打分

  • 从候选图中贪心选出最连贯的整段路径

  • 仅增加 2.0M 参数和 0.6% 延迟,但接受长度提升 0.34–0.47 token

轻量级局部卷积(Lightweight Local Convolution) 并行预测存在”后缀衰减”现象——块越靠后的位置准确率越低。原因是注意力层对块内局部依赖的建模不足。DFlash 2 在每个子层前后插入两抽头动态深度卷积:

  • 每个位置混合自身表示与前一个位置的表示

  • 第一个位置读取上一个已验证 token 的表示

  • 仅增加 16.5M 参数(3%)和 0.7% 延迟,但后缀衰减显著降低


Qwen3.8-27B-DFlash2项目地址

  • 项目官网:https://inco.ai/blog/dflash2/
  • GitHub仓库:https://github.com/z-lab/dflash

Qwen3.8-27B-DFlash2性能表现

在 Qwen3.8-27B 上,DFlash 2 相比原生 MTP 和社区 DSpark 草稿模型:
表格

数据集MTPDSparkDFlash 2
GSM8K5.024.365.46
MATH-5004.723.925.28
HumanEval3.913.304.39
MBPP3.993.514.79
MT-Bench3.743.014.10
平均接受长度4.283.624.80
  • 平均接受长度比 MTP 提升 12%,比 DSpark 提升 33%
  • SGLang 上吞吐量达到自回归解码的 2.7–3.4 倍
  • 每个 token 的计算成本降至约 三分之一

Qwen3.8-27B-DFlash2核心功能

表格

功能描述
推理加速作为 Qwen3.8-27B 的草稿模型,通过推测解码将推理速度提升 2.7–3.4 倍
成本降低相同硬件下服务更多请求,或相同请求量下使用更少 GPU 资源
质量无损带拒绝采样的无损验证机制,输出分布与原始模型严格一致
即插即用一行命令即可接入现有 SGLang/vLLM/llama.cpp/Ollama 服务
批量兼容支持 batch size 1 到高并发的各种生产场景

Qwen3.8-27B-DFlash2应用场景

表格

场景说明
大规模 Agent 服务Agent 的 token 消耗量是聊天的数倍,DFlash 2 可将推理成本降至约三分之一
低延迟交互应用客服机器人、实时代码补全、对话助手等对响应速度敏感的场景
高并发 API 服务在相同 GPU 集群上承载更多并发请求,提升资源利用率
本地部署加速配合 llama.cpp/Ollama 在 Apple Silicon 或消费级 GPU 上流畅运行 Qwen3.8-27B
长文本生成论文写作、报告生成、代码生成等长序列任务,累积加速效果更显著

Qwen3.8-27B-DFlash2部署方式

SGLang:
bash
python -m sglang.launch_server \
  --model-path Qwen/Qwen3.8-27B \
  --speculative-algorithm DFLASH \
  --speculative-draft-model-path incoai/Qwen3.8-27B-DFlash2 \
  --speculative-num-draft-tokens 8
vLLM:
bash
vllm serve Qwen/Qwen3.8-27B \
  --speculative-config '{"method": "dflash", "model": "incoai/Qwen3.8-27B-DFlash2", "num_speculative_tokens": 7}'
llama.cpp / Ollama 也已通过 PR 合并支持。

最后想说

通过并行草稿生成、路径选择器和轻量级局部卷积三项技术,在几乎不增加延迟和参数开销的前提下,将推理吞吐量提升至自回归解码的 2.7–3.4 倍,输出质量严格无损,是 Agent 时代大规模推理降本增效的关键基础设施。

© 版权声明
为这篇文章评分
0.0/ 10
0 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...