Strata 使用指南浏览器Chat/Monitor/About界面与4级思考模式完整玩法【免费下载链接】StrataQwen3.8-Flash-Next (125B MoE) on a 8GB NVIDIA GPU: one-click install for Windows / Linux. Strata inference engine, OpenAI/Anthropic API on localhost, optional image input.项目地址: https://gitcode.com/gh_mirrors/strata11/StrataStrata 是一个让 1250 亿参数 MoE 大模型 Qwen3.8-Flash-Next 跑在 8GB 以上显存 N 卡电脑上的开源推理引擎支持 Windows/Linux 一键安装。启动后浏览器自动打开 Strata 网页应用http://127.0.0.1:8080提供Chat 聊天、Monitor 实时监控、About 关于三大界面以及off / low / medium / high 四级思考模式还能看图片。本文带你完整玩转这三个界面和 4 级思考模式的全部用法。一键启动浏览器里的本地 AI 助手安装时双击START-HERE.batLinux 为./setup.sh按提示选模型、上下文和图片支持即可。模型启动后浏览器会自动打开 Strata 应用。图Strata 应用的 Monitor 界面左正在监控一个编码 Agent 写代码的过程右速度、显存、温度、上下文占用一目了然它的真实实力如何下面这座在浏览器里运行的像素风宝塔花园就是模型一次生成的完整 Web 应用代码图由 Strata 上的模型单条提示词写出、在浏览器中运行的像素宝塔花园RTX 5070 IQ3_SChat 界面聊天、传图与导出Chat 是默认打开的标签页界面很克制但功能齐全页面结构见 serve/web/index.html直接提问模型回答速度可达 60-95 tokens/s比阅读还快。对话会保留上下文后续追问只读取新增内容几秒内开始回答 附件按钮可拖入或粘贴图片需安装时开启图片支持单张 20MB 以内和文本文件代码、笔记、日志、数据——看图片能力对应图片输入选项✨ 新对话清空上下文开始新聊天⬇ 导出把当前对话保存为 Markdown 文件⚡ Stop 按钮生成过程中可随时停止停止会真正中断模型下一个请求立刻开始底部还有设置Sampling抽屉是本文的主角——4 级思考模式就在这里详见下节。4级思考模式off/low/medium/high 怎么选模型会先思考再回答。打开 Chat 输入框旁的齿轮图标在 Thinking 一栏有四个档位档位界面提示适合场景Offanswers right away闲聊、简单问答最快Lowshort日常任务快速但要一点点思考Mediummedium一般复杂问题High默认thorough难题、推理、写代码最准几个要点思考内容会流式显示在回答上方可折叠并显示Thought for N s的思考耗时serve/web/app.js档位是训练出来的行为指令不是硬性 token 上限简单问题即使 high 也会快速思考难题 high 才体现差距同一档位还能在别处设置终端聊天/think low用法见 chat.pyAPI 请求OpenAI 格式传reasoning_effort: lowAnthropic 格式传thinking参数详见 docs/DETAILS.md抽屉里还有Temperature / Top-p / Top-k / Max tokens / Seed等采样参数温度设 0 为贪心解码答案可复现。勾选Use for other apps too后这些设置会作为其他 API 客户端的默认值Monitor 界面模型与硬件的实时仪表盘切到 Monitor 标签页能看到 Strata 当前在干什么界面源码见 serve/web/index.htmlModel stateIdle / Reading / Generating / Queued / Error 五种状态徽章 进度条。长提示词阶段显示Reading prompt 97%这样的实时进度8 张指标卡速度tokens/s、GPU 负载、VRAM 与已缓存专家数、GPU 温度、功耗、PCIe 带宽、CPU、磁盘读都带实时曲线Context fill上下文占用环形仪表外加专家在显存中和系统内存占用条——想判断还能不能塞更长对话看这里最直观Recent requests最近每次请求的状态、提示词/输出 token 数、速度、专家命中率Hit rate与耗时帮你评估长文本表现About 界面确认配置与连接你的应用About 页回答两个问题现在跑的是什么、怎么连进来Model and engine模型、引擎版本、上下文上限、图片是否开启This PC显卡、显存、CPU 等硬件信息Connect your tools直接展示 API 地址——任何支持 OpenAI 协议的应用填 base URLhttp://127.0.0.1:8080/v1、任意 API key 即可用 Anthropic 协议的应用填http://127.0.0.1:8080/v1/messages。聊天应用、Claude Code、omp 都能这样接入Settings如果服务器配置了 API key 可在此填写也可切换深色主题。聊天记录、设置和 key 只保存在本浏览器本地快速上手清单 双击START-HERE.bat启动 → 浏览器自动打开 Chat齿轮里选思考档位日常 Low、难题 High、纯闲聊 Off长文档任务切到 Monitor 盯Reading prompt进度与上下文占用需要接入自己的应用打开 About 抄走/v1地址即可想校准本机最快的引擎设置运行START-HERE.bat --calibrate约 5-10 分钟更多参数、API 细节与故障排查表参考 docs/DETAILS.md 与 README.md。 /输出文章等等我发现上面误用了同一张图片两次pagoda-preview.webp需要修正为每张图片只用一次。以下是修正后的完整文章输出文章Strata 使用指南浏览器Chat/Monitor/About界面与4级思考模式完整玩法Strata 是一个让 1250 亿参数 MoE 大模型 Qwen3.8-Flash-Next 跑在 8GB 以上显存 N 卡电脑上的开源推理引擎支持 Windows/Linux 一键安装。启动后浏览器自动打开 Strata 网页应用http://127.0.0.1:8080提供Chat 聊天、Monitor 实时监控、About 关于三大界面以及off / low / medium / high 四级思考模式还能看图片。本文带你完整玩转这三个界面和 4 级思考模式的全部用法。一键启动浏览器里的本地 AI 助手安装时双击START-HERE.batLinux 为./setup.sh按提示选模型、上下文和图片支持即可。模型启动后浏览器会自动打开 Strata 应用。图Strata 应用的 Monitor 界面左正在监控一个编码 Agent 写代码的过程右速度、显存、温度、上下文占用一目了然Chat 界面聊天、传图与导出Chat 是默认打开的标签页界面很克制但功能齐全页面结构见 serve/web/index.html直接提问模型回答速度可达 60-95 tokens/s比阅读还快。对话会保留上下文后续追问只读取新增内容几秒内开始回答 附件按钮可拖入或粘贴图片需安装时开启图片支持单张 20MB 以内和文本文件代码、笔记、日志、数据✨ 新对话清空上下文开始新聊天⬇ 导出把当前对话保存为 Markdown 文件⚡ Stop 按钮生成过程中可随时停止停止会真正中断模型下一个请求立刻开始它的实力如何下面这座在浏览器里运行的像素风宝塔花园就是模型一次提示词生成的完整 Web 应用图由 Strata 上的模型单条提示词写出、在浏览器中运行的像素宝塔花园RTX 5070 IQ3_S输入框底部还有设置Sampling抽屉是本文的主角——4 级思考模式就在这里详见下节。4级思考模式off/low/medium/high 怎么选模型会先思考再回答。打开 Chat 输入框旁的齿轮图标在 Thinking 一栏有四个档位档位界面提示适合场景Offanswers right away闲聊、简单问答最快Lowshort日常任务快速但要一点点思考Mediummedium一般复杂问题High默认thorough难题、推理、写代码最准几个要点思考内容会流式显示在回答上方可折叠并显示Thought for N s的思考耗时serve/web/app.js档位是训练出来的行为指令不是硬性 token 上限简单问题即使 high 也会快速思考难题 high 才体现差距同一档位还能在别处设置终端聊天/think low用法见 chat.pyAPI 请求OpenAI 格式传reasoning_effort: lowAnthropic 格式传thinking参数详见 docs/DETAILS.md抽屉里还有Temperature / Top-p / Top-k / Max tokens / Seed等采样参数温度设 0 为贪心解码答案可复现。勾选Use for other apps too后这些设置会成为其他 API 客户端的默认值Monitor 界面模型与硬件的实时仪表盘切到 Monitor 标签页能看到 Strata 当前在干什么界面源码见 serve/web/index.htmlModel stateIdle / Reading / Generating / Queued / Error 五种状态徽章 进度条。长提示词阶段会显示Reading prompt 97%这样的实时进度8 张指标卡速度tokens/s、GPU 负载、VRAM 与已缓存专家数、GPU 温度、功耗、PCIe 带宽、CPU、磁盘读都带实时曲线Context fill上下文占用环形仪表外加专家在显存中和系统内存占用条——想判断还能不能塞更长对话看这里最直观Recent requests最近每次请求的状态、提示词/输出 token 数、速度、专家命中率Hit rate与耗时帮你评估长文本表现About 界面确认配置与连接你的应用About 页回答两个问题现在跑的是什么、怎么连进来Model and engine模型、引擎版本、上下文上限、图片是否开启This PC显卡、显存、CPU 等硬件信息Connect your tools直接展示 API 地址——任何支持 OpenAI 协议的应用填 base URLhttp://127.0.0.1:8080/v1、任意 API key 即可用 Anthropic 协议的应用填http://127.0.0.1:8080/v1/messages。聊天应用、Claude Code 等编码工具都能这样接入Settings如果服务器配置了 API key 可在此填写也可切换深色主题。聊天记录、设置和 key 只保存在本浏览器本地快速上手清单 双击START-HERE.bat启动 → 浏览器自动打开 Chat齿轮里选思考档位日常 Low、难题 High、纯闲聊 Off长文档任务切到 Monitor盯Reading prompt进度与上下文占用需要接入自己的应用打开 About 抄走/v1地址即可想校准本机最快的引擎设置运行START-HERE.bat --calibrate约 5-10 分钟更多参数、API 细节与故障排查表参考 docs/DETAILS.md 与 README.md。【免费下载链接】StrataQwen3.8-Flash-Next (125B MoE) on a 8GB NVIDIA GPU: one-click install for Windows / Linux. Strata inference engine, OpenAI/Anthropic API on localhost, optional image input.项目地址: https://gitcode.com/gh_mirrors/strata11/Strata创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考