FreeToken 是一个边缘原生(Edge-Native)的 MoE(混合专家)模型推理服务系统,由 UC Berkeley、UT Austin 等机构的联合研究团队开发并开源。它的核心使命是让消费级硬件本地运行前沿级大模型,口号为”Bring Frontier to Edge”(将前沿智能带到边缘)。
传统上,运行数百亿甚至千亿参数的前沿模型必须依赖数据中心级 GPU 集群。FreeToken 打破了这一假设——它将个人电脑视为一个统一的弹性推理平台(而非”一块小 GPU”),通过全栈协同设计,让 8GB 显存的笔记本也能流畅运行 350 亿参数模型,让单张游戏显卡跑起 2840 亿参数模型,甚至让单张工作站 GPU 服务 7530 亿参数的 GLM-5.2。

FreeToken特点
表格
| 维度 | 具体特点 |
|---|---|
| 全栈开源 | Apache 2.0 许可证,代码、论文、桌面 App 全部开放 |
| 边缘原生 | 专为个人/消费级硬件设计,非数据中心方案的降级移植 |
| 带宽自适应 | 不采用固定的权重卸载策略,而是根据机器实际带宽动态调度计算 |
| 语义感知 | 针对 Agent 工作负载中频繁的上下文编辑,避免重复计算 |
| 弹性内存 | 运行时动态调整专家缓存和 KV 缓存的显存分配,无需重启 |
| 广泛兼容 | 支持 20+ MoE 模型、多种量化格式(MXFP4、NVFP4、FP8、BF16)、RTX 30/40/50 全系显卡 |
| API 兼容 | 提供 OpenAI 和 Anthropic 兼容的 API 端点,无缝接入现有 Agent 生态 |
FreeToken技术原理
FreeToken 的核心设计围绕两级专家内存层次结构展开:CPU 内存中保存完整的专家权重池作为”真相源”,GPU 显存中维护一个共享的 LRU 专家缓存。
1. 带宽自适应执行(q* 策略)
这是 FreeToken 最核心的创新。传统方案在 GPU 缓存未命中时,只能被动地从 CPU 内存通过 PCIe 拉取专家权重,导致严重 I/O 阻塞。FreeToken 则动态决策每个缺失专家的归宿:
测量机器的两个实际带宽:PCIe 传输带宽和 CPU 计算带宽
将缺失的专家集划分为两部分:一部分通过 PCIe 加载到 GPU 缓存,另一部分直接在 CPU 上就地计算
GPU 和 CPU 的部分输出精确合并
这使得系统不再受限于单一瓶颈,而是充分利用机器的所有可用资源。
2. 全层双缓冲预填充流式
在预填充阶段(处理长 Prompt),MoE 模型几乎激活每层所有专家,产生海量数据传输。FreeToken 采用全层双缓冲:
分配两个全层缓冲区
GPU 计算第 l 层时,后台流传输第 l+1 层的完整专家集
计算与传输完全重叠,将权重移动隐藏在计算背后
3. 语义感知缓存
Agent 工作负载的特点是上下文频繁被编辑(如删除思考块、替换工具输出)。FreeToken 在语义边界(思考段、工具调用、对话轮次等特殊 token 处)设置循环状态检查点:
编辑发生后,从最近的存活检查点恢复
全注意力层复用 KV 缓存,循环层从检查点恢复
只需重新计算真正新增的后缀,避免整段重算
4. 语义感知专家缓存
解码阶段,相邻 token 经常路由到重叠的专家。FreeToken 利用这种时间局部性,维护一个共享的 LRU 专家缓存:
缓存命中直接在 GPU 执行
缓存未命中由 q* 策略处理
缓存内容随模型计算动态演进,始终跟踪当前工作集
5. 弹性内存管理
在调度安全点,FreeToken 可在不重启引擎、不重新加载权重的前提下,动态调整 GPU 显存中专家缓存和 KV 缓存的比例,适应变化的内存条件。
FreeToken项目地址
- 项目官网:https://www.flashml.ai/
- GitHub仓库:https://github.com/FlashML-org/FreeToken
FreeToken功能
- 边缘 MoE 推理服务:高效运行 DeepSeek-V4-Flash、Qwen3.6-35B-A3B、GLM-5.2 等前沿模型
- 带宽自适应 CPU-GPU 协同执行:根据硬件实际能力动态分配计算
- 语义感知状态缓存:Agent 上下文编辑后的增量计算
- 弹性显存重分配:运行时调整缓存策略
- FTW 快速权重格式:自研的高效权重加载格式
- 多量化支持:MXFP4、NVFP4、FP8、BF16
- OpenAI/Anthropic 兼容 API:
ft serve在 1919 端口暴露标准端点 - Agent 生态集成:一键连接 Claude Code、Codex、OpenCode、OpenClaw、DeepSeek Harness
- 跨平台桌面 App:Windows、Linux(Ubuntu/Arch/AppImage)带 GUI
- CLI 工具:
uv pip install "freetoken[accel]"一行安装
FreeToken性能表现
表格
| 硬件 | 模型 | 成绩 |
|---|---|---|
| 8GB RTX 4060 笔记本 | Qwen3.6-35B | 39.3 tok/s(超过 Codex 生产中位速度 33 tok/s) |
| RTX 5090 桌面 | Qwen3.6-35B-A3B | 77-83 tok/s |
| RTX 5090 桌面 | DeepSeek-V4-Flash (284B) | 22-25 tok/s |
| 32GB 游戏桌面 | 284B 模型 | 可交互式服务 |
| RTX PRO 6000 工作站 | GLM-5.2 (753B) | 吞吐量是 llama.cpp 的 2 倍 |
- 解码吞吐量比现有边缘服务系统高 1.5-2.3 倍
- 首 Token 延迟(TTFT)降低 42-58%
- 最坏情况 TTFT 保持在 44 秒以下,而基线在某些场景中超过 150 秒
- Agent 负载下的解码速率与单轮设置相差不超过 12%,而竞品系统显著退化
FreeToken应用场景
表格
| 场景 | 说明 |
|---|---|
| 本地编码 Agent | 运行 Codex、Claude Code 等编程 Agent,Token 账单归零 |
| 私有代码审查 | 源代码不离开本地机器,满足企业安全合规 |
| 离线合同分析 | 法律文档本地处理,无需上传云端 |
| 医疗数据推理 | 患者数据永不出境,满足 HIPAA 等隐私法规 |
| 金融风控分析 | 敏感交易数据本地推理 |
| 涉密场景 | 完全离线运行,物理隔离 |
| 合成数据生成 | 本地批量生成训练数据,降低 API 成本 |
| 批量评估 | 本地运行评测管线,避免云端调用费用 |
| 个人开发者/初创团队 | Agent Token 费用已超过自购 GPU 成本时,将”弹药库搬回家” |
FreeToken使用方式
- 桌面 App:访问 flashml.ai 下载 Windows 或 Linux 安装包
- CLI 安装:
uv pip install "freetoken[accel]" - 启动服务:
ft serve(暴露 OpenAI/Anthropic 兼容 API) - 连接 Agent:
ft launch claude/ft launch codex/ft launch opencode
最后想说:FreeToken 是 2026 年边缘 AI 推理领域最具突破性的开源项目之一。它证明了一件事:限制本地运行大模型的不是硬件,而是服务软件。通过带宽自适应执行、语义感知缓存和弹性内存管理三大核心技术,FreeToken 将”数据中心级智能”真正带到了个人桌面,让开源权重变成了可部署的本地软件,为隐私敏感场景和高昂 Token 账单提供了一条切实可行的出路。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



