FreeToken – 边缘原生的 MoE(混合专家)模型推理服务系统

FreeToken 是一个边缘原生(Edge-Native)的 MoE(混合专家)模型推理服务系统,由 UC Berkeley、UT Austin 等机构的联合研究团队开发并开源。它的核心使命是让消费级硬件本地运行前沿级大模型,口号为”Bring Frontier to Edge”(将前沿智能带到边缘)。

传统上,运行数百亿甚至千亿参数的前沿模型必须依赖数据中心级 GPU 集群。FreeToken 打破了这一假设——它将个人电脑视为一个统一的弹性推理平台(而非”一块小 GPU”),通过全栈协同设计,让 8GB 显存的笔记本也能流畅运行 350 亿参数模型,让单张游戏显卡跑起 2840 亿参数模型,甚至让单张工作站 GPU 服务 7530 亿参数的 GLM-5.2。

FreeToken - 边缘原生的 MoE(混合专家)模型推理服务系统


FreeToken特点

表格

维度具体特点
全栈开源Apache 2.0 许可证,代码、论文、桌面 App 全部开放
边缘原生专为个人/消费级硬件设计,非数据中心方案的降级移植
带宽自适应不采用固定的权重卸载策略,而是根据机器实际带宽动态调度计算
语义感知针对 Agent 工作负载中频繁的上下文编辑,避免重复计算
弹性内存运行时动态调整专家缓存和 KV 缓存的显存分配,无需重启
广泛兼容支持 20+ MoE 模型、多种量化格式(MXFP4、NVFP4、FP8、BF16)、RTX 30/40/50 全系显卡
API 兼容提供 OpenAI 和 Anthropic 兼容的 API 端点,无缝接入现有 Agent 生态

FreeToken技术原理

FreeToken 的核心设计围绕两级专家内存层次结构展开:CPU 内存中保存完整的专家权重池作为”真相源”,GPU 显存中维护一个共享的 LRU 专家缓存。

1. 带宽自适应执行(q* 策略)

这是 FreeToken 最核心的创新。传统方案在 GPU 缓存未命中时,只能被动地从 CPU 内存通过 PCIe 拉取专家权重,导致严重 I/O 阻塞。FreeToken 则动态决策每个缺失专家的归宿

  • 测量机器的两个实际带宽:PCIe 传输带宽和 CPU 计算带宽

  • 将缺失的专家集划分为两部分:一部分通过 PCIe 加载到 GPU 缓存,另一部分直接在 CPU 上就地计算

  • GPU 和 CPU 的部分输出精确合并

这使得系统不再受限于单一瓶颈,而是充分利用机器的所有可用资源。

2. 全层双缓冲预填充流式

在预填充阶段(处理长 Prompt),MoE 模型几乎激活每层所有专家,产生海量数据传输。FreeToken 采用全层双缓冲

  • 分配两个全层缓冲区

  • GPU 计算第 l 层时,后台流传输第 l+1 层的完整专家集

  • 计算与传输完全重叠,将权重移动隐藏在计算背后

3. 语义感知缓存

Agent 工作负载的特点是上下文频繁被编辑(如删除思考块、替换工具输出)。FreeToken 在语义边界(思考段、工具调用、对话轮次等特殊 token 处)设置循环状态检查点

  • 编辑发生后,从最近的存活检查点恢复

  • 全注意力层复用 KV 缓存,循环层从检查点恢复

  • 只需重新计算真正新增的后缀,避免整段重算

4. 语义感知专家缓存

解码阶段,相邻 token 经常路由到重叠的专家。FreeToken 利用这种时间局部性,维护一个共享的 LRU 专家缓存:

  • 缓存命中直接在 GPU 执行

  • 缓存未命中由 q* 策略处理

  • 缓存内容随模型计算动态演进,始终跟踪当前工作集

5. 弹性内存管理

在调度安全点,FreeToken 可在不重启引擎、不重新加载权重的前提下,动态调整 GPU 显存中专家缓存和 KV 缓存的比例,适应变化的内存条件。


FreeToken项目地址

  • 项目官网:https://www.flashml.ai/
  • GitHub仓库:https://github.com/FlashML-org/FreeToken

FreeToken功能

  1. 边缘 MoE 推理服务:高效运行 DeepSeek-V4-Flash、Qwen3.6-35B-A3B、GLM-5.2 等前沿模型
  2. 带宽自适应 CPU-GPU 协同执行:根据硬件实际能力动态分配计算
  3. 语义感知状态缓存:Agent 上下文编辑后的增量计算
  4. 弹性显存重分配:运行时调整缓存策略
  5. FTW 快速权重格式:自研的高效权重加载格式
  6. 多量化支持:MXFP4、NVFP4、FP8、BF16
  7. OpenAI/Anthropic 兼容 APIft serve 在 1919 端口暴露标准端点
  8. Agent 生态集成:一键连接 Claude Code、Codex、OpenCode、OpenClaw、DeepSeek Harness
  9. 跨平台桌面 App:Windows、Linux(Ubuntu/Arch/AppImage)带 GUI
  10. CLI 工具uv pip install "freetoken[accel]" 一行安装

FreeToken性能表现

表格

硬件模型成绩
8GB RTX 4060 笔记本Qwen3.6-35B39.3 tok/s(超过 Codex 生产中位速度 33 tok/s)
RTX 5090 桌面Qwen3.6-35B-A3B77-83 tok/s
RTX 5090 桌面DeepSeek-V4-Flash (284B)22-25 tok/s
32GB 游戏桌面284B 模型可交互式服务
RTX PRO 6000 工作站GLM-5.2 (753B)吞吐量是 llama.cpp 的 2 倍
  • 解码吞吐量比现有边缘服务系统高 1.5-2.3 倍
  • 首 Token 延迟(TTFT)降低 42-58%
  • 最坏情况 TTFT 保持在 44 秒以下,而基线在某些场景中超过 150 秒
  • Agent 负载下的解码速率与单轮设置相差不超过 12%,而竞品系统显著退化

FreeToken应用场景

表格

场景说明
本地编码 Agent运行 Codex、Claude Code 等编程 Agent,Token 账单归零
私有代码审查源代码不离开本地机器,满足企业安全合规
离线合同分析法律文档本地处理,无需上传云端
医疗数据推理患者数据永不出境,满足 HIPAA 等隐私法规
金融风控分析敏感交易数据本地推理
涉密场景完全离线运行,物理隔离
合成数据生成本地批量生成训练数据,降低 API 成本
批量评估本地运行评测管线,避免云端调用费用
个人开发者/初创团队Agent Token 费用已超过自购 GPU 成本时,将”弹药库搬回家”

FreeToken使用方式

  • 桌面 App:访问 flashml.ai 下载 Windows 或 Linux 安装包
  • CLI 安装uv pip install "freetoken[accel]"
  • 启动服务ft serve(暴露 OpenAI/Anthropic 兼容 API)
  • 连接 Agentft launch claude / ft launch codex / ft launch opencode

最后想说:FreeToken 是 2026 年边缘 AI 推理领域最具突破性的开源项目之一。它证明了一件事:限制本地运行大模型的不是硬件,而是服务软件。通过带宽自适应执行、语义感知缓存和弹性内存管理三大核心技术,FreeToken 将”数据中心级智能”真正带到了个人桌面,让开源权重变成了可部署的本地软件,为隐私敏感场景和高昂 Token 账单提供了一条切实可行的出路。

© 版权声明
为这篇文章评分
0.0/ 10
0 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...