Qwen3.8-27B-DFlash2 是由 Inco AI 发布的、专为阿里通义千问 Qwen3.8-27B 模型定制的 DFlash 2 推测解码草稿模型(Drafter)。它不是一个独立的大语言模型,而是一个推理加速插件——配合 Qwen3.8-27B 目标模型使用,通过并行草稿生成技术,将推理吞吐量提升至自回归解码的 2.7–3.4 倍。
DFlash 系列是 Inco AI 推出的推测解码技术,DFlash 1 将草稿生成从自回归改为全并行,DFlash 2 在此基础上进一步解决并行草稿的连贯性和后缀衰减问题,实现”每个验证 pass 多输出 20% 以上 token,仅增加约 1% 延迟”的突破。

Qwen3.8-27B-DFlash2核心特点
表格
| 特点 | 说明 |
|---|---|
| 并行草稿生成 | 整个 token 块的所有位置一次性并行预测,而非逐 token 自回归生成 |
| 路径选择器 | 保留每个位置 top-16 候选 token,通过轻量级双线性注意力评分相邻 token 对,选出最连贯的路径 |
| 局部卷积模块 | 在每个 attention 和 MLP 子层前后插入两抽头动态深度卷积,仅增加 3% 参数和 0.7% 延迟,有效缓解后缀衰减 |
| 输出不变性 | 加速前后模型输出分布严格一致,不损失生成质量 |
| 生态兼容 | 支持 SGLang、vLLM、TensorRT-LLM、llama.cpp、Ollama 等主流推理引擎 |
| 轻量高效 | 路径选择器仅增加 2.0M 参数,卷积仅增加 16.5M 参数,总开销极低 |
Qwen3.8-27B-DFlash2技术原理
1. 推测解码基础
推测解码的核心思路是”小模型猜、大模型验”:一个小型草稿模型快速生成 token 候选块,大型目标模型(Qwen3.8-27B)一次性验证整个块。猜对了,一次前向传播产出多个 token;猜错了,丢弃重试。
2. DFlash 1:并行草稿
传统草稿模型仍是自回归生成(逐 token)。DFlash 1 的突破是让草稿也变成全并行——块内每个位置独立预测,极大加速草稿生成阶段。
3. DFlash 2 的两项改进
路径选择器(Path Selector) 并行预测的每个位置独立选 top-1,容易导致相邻位置不连贯(如重复词、语法断裂)。DFlash 2 的解决方案:
每个位置保留 top-16 候选(而非只保留 top-1)
用低秩双线性注意力为每对相邻候选打分
从候选图中贪心选出最连贯的整段路径
仅增加 2.0M 参数和 0.6% 延迟,但接受长度提升 0.34–0.47 token
轻量级局部卷积(Lightweight Local Convolution) 并行预测存在”后缀衰减”现象——块越靠后的位置准确率越低。原因是注意力层对块内局部依赖的建模不足。DFlash 2 在每个子层前后插入两抽头动态深度卷积:
每个位置混合自身表示与前一个位置的表示
第一个位置读取上一个已验证 token 的表示
仅增加 16.5M 参数(3%)和 0.7% 延迟,但后缀衰减显著降低
Qwen3.8-27B-DFlash2项目地址
- 项目官网:https://inco.ai/blog/dflash2/
- GitHub仓库:https://github.com/z-lab/dflash
Qwen3.8-27B-DFlash2性能表现
在 Qwen3.8-27B 上,DFlash 2 相比原生 MTP 和社区 DSpark 草稿模型:
表格
| 数据集 | MTP | DSpark | DFlash 2 |
|---|---|---|---|
| GSM8K | 5.02 | 4.36 | 5.46 |
| MATH-500 | 4.72 | 3.92 | 5.28 |
| HumanEval | 3.91 | 3.30 | 4.39 |
| MBPP | 3.99 | 3.51 | 4.79 |
| MT-Bench | 3.74 | 3.01 | 4.10 |
| 平均接受长度 | 4.28 | 3.62 | 4.80 |
- 平均接受长度比 MTP 提升 12%,比 DSpark 提升 33%
- SGLang 上吞吐量达到自回归解码的 2.7–3.4 倍
- 每个 token 的计算成本降至约 三分之一
Qwen3.8-27B-DFlash2核心功能
表格
| 功能 | 描述 |
|---|---|
| 推理加速 | 作为 Qwen3.8-27B 的草稿模型,通过推测解码将推理速度提升 2.7–3.4 倍 |
| 成本降低 | 相同硬件下服务更多请求,或相同请求量下使用更少 GPU 资源 |
| 质量无损 | 带拒绝采样的无损验证机制,输出分布与原始模型严格一致 |
| 即插即用 | 一行命令即可接入现有 SGLang/vLLM/llama.cpp/Ollama 服务 |
| 批量兼容 | 支持 batch size 1 到高并发的各种生产场景 |
Qwen3.8-27B-DFlash2应用场景
表格
| 场景 | 说明 |
|---|---|
| 大规模 Agent 服务 | Agent 的 token 消耗量是聊天的数倍,DFlash 2 可将推理成本降至约三分之一 |
| 低延迟交互应用 | 客服机器人、实时代码补全、对话助手等对响应速度敏感的场景 |
| 高并发 API 服务 | 在相同 GPU 集群上承载更多并发请求,提升资源利用率 |
| 本地部署加速 | 配合 llama.cpp/Ollama 在 Apple Silicon 或消费级 GPU 上流畅运行 Qwen3.8-27B |
| 长文本生成 | 论文写作、报告生成、代码生成等长序列任务,累积加速效果更显著 |
Qwen3.8-27B-DFlash2部署方式
SGLang:
bash
python -m sglang.launch_server \
--model-path Qwen/Qwen3.8-27B \
--speculative-algorithm DFLASH \
--speculative-draft-model-path incoai/Qwen3.8-27B-DFlash2 \
--speculative-num-draft-tokens 8
vLLM:
bash
vllm serve Qwen/Qwen3.8-27B \
--speculative-config '{"method": "dflash", "model": "incoai/Qwen3.8-27B-DFlash2", "num_speculative_tokens": 7}'
llama.cpp / Ollama 也已通过 PR 合并支持。
最后想说
通过并行草稿生成、路径选择器和轻量级局部卷积三项技术,在几乎不增加延迟和参数开销的前提下,将推理吞吐量提升至自回归解码的 2.7–3.4 倍,输出质量严格无损,是 Agent 时代大规模推理降本增效的关键基础设施。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



