这个叫 FreeToken 的开源项目,号称能用 8G 显存、以 40 TPS 的速度跑 35B 级别的大语言模型,GitHub 上已经拿下 13000 多颗星了。它凭什么?

因为现在的开源大模型基本都是 MoE 架构:你每问一句话,内部几十个专家只激活几个干活,其余都闲着。FreeToken 就盯上了这一点——用得勤的专家缓存进显存,用得少的常驻在内存条里,由 CPU 就地计算,不用搬来搬去;GPU 和 CPU 各算各的,按两边实际的速度自动分工。所以 8G 卡也敢跑 35B。当然,你的内存是越大越好。

接口上它兼容 OpenAI 和 Anthropic 格式,编程工具不用改配置就能接上;支持 RTX 30 到 50 系显卡,Windows 和 Linux 都有桌面版。

本地折腾大模型、被速度劝退过的兄弟,建议整一份:先拿 Qwen 那台 35B 的小钢炮试一圈,体验一下不联网满速吐字的感觉。用得好不好,都回来评论区说一说。