详细介绍
产品定位
FreeToken 是由 UC Berkeley 的 FlashML-org 团队开源的边缘原生 MoE 推理服务引擎,采用 Apache-2.0 协议,目标是让个人电脑也能跑起数据中心级别的大模型。它不把个人电脑简单视为一块小显卡,而是把 GPU、CPU、主机内存和互连带宽组织成统一弹性的推理平台,让有限硬件尽可能释放大模型能力,免费开源且内存越大体验越好。
核心功能
它针对 MoE 架构中每问一句话只激活少数专家的特点,把高频专家缓存进显存,低频专家常驻内存由 CPU 就地计算,减少来回搬运。GPU 与 CPU 各算各的,按实际速度自动分工,并通过带宽自适应的 CPU-GPU 协同执行优化性能。同时支持 LRU 专家缓存、动态调整 KV 缓存与专家缓存内存分配,提供 OpenAI 与 Anthropic 兼容 API,支持语义感知缓存,在智能体编辑上下文时避免重复计算,把编码代理首 token 延迟从 232 秒降到 44 秒以下。
技术特点
FreeToken 把模型状态与计算动态映射到实际可用资源,兼容 MXFP4、NVFP4、FP8、BF16 等量化格式,支持 20 多种 MoE 模型,包括 DeepSeek-V4-Flash、Qwen3.6-35B-A3B、GLM-5.2。实测在仅 8GB 显存的 RTX 4060 笔记本显卡上可运行 Qwen3.6-35B-A3B 达到 39.3 tokens/s,比 ollama 快 2 到 4 倍,而该 35B 模型权重通常需约 70GB 内存。其他规模上,32GB 内存游戏台式机可交互式运行 284B 模型,RTX 5090 上约 22 到 25 tok/s,单张工作站显卡可跑 753B 的 GLM-5.2。
适用场景
它适合只有个人电脑或边缘设备、却希望本地运行大 MoE 模型的开发者与研究者。支持 RTX 30 到 50 系显卡,Windows 和 Linux 均有桌面版应用,也可从 PyPI 安装,CLI 面向 Linux x86_64 加 NVIDIA GPU。Codex、Claude Code 等编程工具不改配置即可对接,因此适合本地编码助手、隐私敏感推理、模型实验、低成本智能体开发与高性能工作站部署等场景。









