详细介绍
产品定位
Strata 是一个开源免费的本地大模型推理引擎,用 C++ 编写、MIT 协议发布,目标是把 125B 参数的 Qwen3.8-Flash-Next 搬到普通游戏 PC 上跑,推理全程不出本机。硬件门槛为 12GB 以上显存的 NVIDIA RTX 20/30/40/50 系或 AMD Radeon RX 7000/9000 系显卡,内存 32GB 起(64GB 可跑满全部档位),硬盘约 80GB 并建议用 SSD,支持 Windows 10/11、Linux 以及多卡共享模型。
核心功能
安装只需一步:Windows 双击 START-HERE.bat,Linux 运行 setup.sh,脚本自动识别显卡并引导选择模型体积和是否启用图像输入,随后下载约 70GB 权重、支持断点续传。装完服务在本地 8080 端口启动,首次启动要一两分钟把 35-50GB 权重载入内存。模型提供四个量化档位——Q2_0(37.6GB,最快)、IQ2_XS(39.2GB,推荐)、IQ3_XXS(47GB)、IQ3_S(54.8GB,质量最好),另有 Coder 变体专攻编程,体积减半仍保留原版 91% 的代码能力。界面分聊天、监控、关于三区,监控可实时查看显卡、CPU 与内存占用,思考深度可调低中高。
技术特点
核心在于 MoE 稀疏架构的专家分层调度:模型内含 24576 个专家,每个 token 只激活约 10 个,Strata 把高频专家常驻显存、全部专家备在系统内存,未进显存的交给 CPU 并行计算,固态硬盘上再放一张查找表按需读取,因此 12GB 显存也带得动。此外还有 MTP 投机解码,由小模型先猜、大模型批量核对,带来 1.6-1.8 倍加速,以及 QSA 稀疏注意力、CUDA Graph 重放等优化。实测 RTX 5070 在 Q2_0 档每秒 94 token、IQ3_S 档 53 token,AMD RX 9070 XT 为 60 token,24GB 的 RTX 3090 可达 100-140 token/s。
适用场景
适合想在本机跑大模型、又在意数据隐私的开发者和离线团队。本地 8080 端口同时兼容 OpenAI 的 /v1 与 Anthropic 的 /v1/messages 接口,Claude Code、Cursor、Codex 等编程助手把地址指向本机即可直连,等于把背后的模型换成自己电脑上的那个。编程任务可选 Coder 变体,日常聊天与资源监控用内置界面即可。





