12G 显存就能跑 125B 的 Qwen 3.8 Flash Next,说的就是这个叫 Strata 的开源项目。它用 C++ 写成,GitHub 上已经攒了五千八百多颗星。硬件门槛不高:Nvidia RTX 20 到 50 系都能上,AMD 的 RX 9070 XT 也支持;内存 32G 起步,想跑满所有档位建议上 64G;硬盘要留出 80G。Windows 和 Linux 两个平台都支持。

安装只有一步。Windows 双击 START-HERE.bat,Linux 跑 setup.sh,它会自己认出你的显卡,再问你用哪个模型、多大、要不要读图。拿不准就一路回车用推荐值,然后下载模型,大概 70G,断了还能续。装完浏览器会自动跑在本地 8080 端口。第一次启动会卡一两分钟,看着像死机其实是正常的——它要往内存里塞 35 到 50 个 G。

同一个模型分好几个量化档位,规律很简单:压得狠的快,压得松的聪明。32G 内存可以选 coder 那版,体积砍掉一半,让小专家专攻写代码,能保留原版 91% 的成绩,代价是中文能力偏弱;64G 内存就直接上 IQ2_XS。界面分成聊天、监控、关于三块,监控能实时看显卡、CPU 和内存占用,思考深度有低、中、高几档可调,写代码、聊天、看图都行。最关键的是,数据一个字节都不出你的电脑。

最实用的一点,是它能当你编程助手的后端。本机开的接口同时兼容 OpenAI 和 Anthropic,Claude Code、Cursor、Codex 只要把地址指到本地 8080 端口就能用——等于你平时写代码那个助手还在,背后的模型换成了自己电脑上跑的这个。

原理是这个模型内部有 24000 多个小专家,每个词只叫醒其中 10 个。Strata 让最常被叫到的几个常驻显卡,全部专家在内存里备着,没进显卡的交给 CPU 一起算,固态上再放一张查找表,所以 12G 的卡也带得动。它还有个巧劲:先让小助手猜几个词,大模型一次性核对,答案一样就能快 1.6 到 1.8 倍。速度上,RTX 5070 每秒能吐 50 到 90 个 token,24G 的 3090 能到 140。不想再按 token 交钱的朋友,可以立刻去跑起来试试。