Strata 工作原理图解GPU内存SSD三级存储如何让125B模型塞进消费级显卡【免费下载链接】StrataQwen3.8-Flash-Next on any consumer hardware: one-click install for Windows / Linux. Strata inference engine, OpenAI/Anthropic API on localhost, optional image input.项目地址: https://gitcode.com/gh_mirrors/strata11/StrataStrata 是一个开源的本地大模型推理引擎它用 GPU 显存、系统内存和 SSD 组成的三级存储架构把 1250 亿参数125B的 Qwen3.8-Flash-Next MoE 模型塞进一张 12-24 GB 的消费级显卡还能以 60-95 tokens/s 的速度写出回答。这篇文章把它的原理拆给你看为什么能跑、靠什么不慢。先看效果12GB 显卡上长这样下图是 Strata 驱动的模型在一张 RTX 507012GB 显存IQ3_S 量化128K 上下文上用一次提示词生成的体素宝塔花园网页动画核心矛盾125B 参数 vs 12GB 显存传统跑法里模型权重必须整体放进显存。125B 参数即便 4-bit 量化也要 60GB 显存普通显卡根本放不下。Strata 的思路是把厨房里的东西分级存放最常用的放台面显存常用的放柜子内存备用的放储藏室SSD。它利用了这个模型的关键特性——模型由 24,576 个小型专家expert组成每个 token 只需要其中 10 个。也就是说根本不需要让所有专家同时待在显卡上。三级存储分工显存、内存、SSD 各存什么这是 Strata 工作原理的核心对照官方架构图理解最直观图在 README 中层级存放内容职责️ GPU 显存注意力层、DeltaNet 混合器、路由、共享专家、MTP 草稿层、KV 缓存以及一块专家缓存每个字必做的计算 最常用的几千个专家 系统内存RAM全部 24,576 个专家pinned 锁页GPU 没缓存到的专家由CPU 就地计算与 GPU 并行 SSD28.8 GB 的 n-gram 查找表每个 token 只读其中几行小数据上面这张是 Strata 自带网页应用的 Monitor 面板——左边能直接看到Experts in VRAM: 1644 / 3.2 GB显存里缓存了多少专家、PCIe 带宽、CPU 占用等。三级存储的运行状态一目了然这也是判断模型到底吃不吃你这块卡最直接的窗口。更细的分配规则见 docs/DETAILS.md 的 How it works 章节。专家缓存显存里的自适应货架显存装不下全部专家那装哪些Strata 的答案是动态专家缓存启动时用预制的专家使用频率排名仓库自带 data/expert-profile.bin把最常用的约 4,500 个专家装进显存对话过程中持续学习你当前会话高频用到的专家缓存会随之调整在 12 GB 显卡上实测约72% 的专家读取直接命中显存剩下的才落到 CPU 内存里算。而且 CPU 和 GPU 是并行干活的GPU 算缓存命中的专家CPU 同时算未命中的AVX-512/AVX2 内核谁也不等谁。显存越大缓存能装的专家越多每多 1 GB 约多装 700 个专家CPU 的负担就越轻——所以 24 GB 的 RTX 3090 能跑到 100-140 tokens/s比 12 GB 卡快一倍。缓存的设计细节可以看 include/strata/core/expert_cache.hpp 顶部那段注释写得很直白它的所有尺寸都来自实测而不是拍脑袋。想针对自己的使用习惯生成排名可以用 tools/make_profile.py。推测解码先猜后验一步出多个字单靠三级存储还不够快Strata 还用了推测解码Speculative Decoding模型内置的小 MTP 草稿层先快速猜出接下来最多 3 个 token主模型一次性过完全部 48 层并行验证所有猜测猜中的保留猜不中的由主模型自己写正确的。平均每步能产出 2.4-3.2 个 token整体提速 1.6-1.8 倍。当回复在复述上下文改代码、引用原文时还会启用提示查找从上下文里已有的副本直接抄最多 5 个 token代码编辑场景再快 6-11%。关键是草稿层只猜、主模型决定每个字所以输出质量不变。相关逻辑在 include/strata/spec/controller.hpp 与 src/spec/controller.cpp。长文本为什么读得快分块预填充 专家流式传输喂一份 32K token 的长文档或代码库专家权重得先上显存。Strata 把提示词切成最多 8,192 token 的大块处理同时在当前层做注意力时下一层的专家经 PCIe 流式传输上来两个动作重叠执行。结果RTX 5070 上读 32K 提示约 2,170 tokens/sQ2_0长文档十几秒读完64K 以上还会把 KV 缓存的大部分留在内存、只把注意力要读的部分放进显存KV streaming给专家缓存腾地方。预填充引擎实现见 src/prefill/prefill.cpp。实测速度一张 12GB 卡能跑多快RTX 507012 GB Ryzen 5 7600 64 GB 内存的官方数据README 速查表量化档位写回答短对话写回答128K 上下文读提示词Q2_093 tokens/s74 tokens/s2,170 tokens/sIQ2_XS推荐79 tokens/s63 tokens/s2,090 tokens/sIQ3_S质量最佳53 tokens/s46 tokens/s1,620 tokens/s所有测试数据在 bench/results/ 目录按日期归档其他显卡的估算见 docs/DETAILS.md。延伸阅读源码与论文导读想深入原理按这个顺序看docs/paper/Strata-Paper.pdf— 完整论文每个数字都有实测支撑docs/DETAILS.md— 引擎工作原理、全部实测数据与排错表include/strata/core/expert_cache.hpp— 专家缓存的核心设计注释docs/MULTI_GPU.md— 多卡流水线每张卡存自己那几层的专家提示词在卡间流动实测读提示提速 18-20%。一句话总结 Strata 的工作原理用 MoE 稀疏性换显存空间用三级存储换模型容量用并行计算和推测解码换速度——这才是 125B 模型能塞进消费级显卡的完整答案。【免费下载链接】StrataQwen3.8-Flash-Next on any consumer hardware: one-click install for Windows / Linux. Strata inference engine, OpenAI/Anthropic API on localhost, optional image input.项目地址: https://gitcode.com/gh_mirrors/strata11/Strata创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考