多显卡玩家福音LLM Checker 跨平台硬件检测与 gpu-plan 部署规划指南【免费下载链接】llm-checkerAdvanced CLI tool that scans your hardware and tells you exactly which LLM or sLLM models you can run locally, with full Ollama integration.项目地址: https://gitcode.com/gh_mirrors/ll/llm-checker手上有双显卡甚至四张卡到底能跑多大的本地大模型该不该把模型摊到多卡上LLM Checker 是一款跨平台硬件检测工具一条命令识别 NVIDIA CUDA、AMD ROCm、Apple Silicon、Intel Arc 等硬件并用内置的gpu-plan命令生成带安全显存上限的多卡部署规划帮你在部署前先算清楚账。一、LLM Checker 是什么 ️LLM Checker 是一个纯 JavaScript 编写的命令行工具Node.js 18无原生依赖核心能力包括跨平台硬件检测自动识别各平台 GPU 加速后端与显存容量支持多显卡清点33k 多源模型注册表内置 Hugging Face、Ollama、GPT4All 的可安装模型清单4D 评分引擎从质量、速度、适配度、上下文四个维度对模型打分排序整体安装只需两行npm install -g llm-checker llm-checker hw-detect运行hw-detect后你会看到每张显卡的品牌、显存、加速后端CUDA/ROCm/Metal/...和系统内存预算这就是后续所有规划的输入数据。二、跨平台硬件检测一张表看懂支持范围 不同检测器按平台分工位于 src/hardware/ 目录平台检测模块说明NVIDIAcuda-detector.jsCUDA 后端识别 RTX/GTX 等独显AMDrocm-detector.jsROCm 后端含 Windows/Linux 差异检查Intelintel-detector.jsIntel Arc 独立显卡Apple Siliconapple-silicon.jsMetal 统一内存通用unified-detector.js聚合各后端输出统一硬件画像多显卡的关键在于统一检测器会逐卡清点即使两张卡型号完全相同也会保留为两个独立设备避免双卡变单卡的误判。三、gpu-plan一键生成多卡部署规划 ⚡这是多显卡玩家最该收藏的命令llm-checker gpu-plan它会基于硬件检测结果输出一份部署规划核心内容见 src/commands/roadmap-tools.js 中的buildGpuPlan实现。规划包含四部分1️⃣ 部署策略自动判断无需你拍脑袋策略触发条件含义single_gpu检测到 1 张 GPU模型权重固定在单卡distributed检测到 ≥2 张 GPU摊派调度每类设备承载一个模型分片cpu_fallback无兼容 GPU退回 CPU 方案cpu_only加--cpu-only参数忽略显卡按系统内存规划2️⃣ 安全显存上限单卡上限 最强显卡显存 − 2GB为系统与 KV 缓存预留池化上限 全部显存 − 2GB多卡摊派时的总容量3️⃣ 推荐环境变量直接用于 Ollama 配置环境变量推荐值逻辑OLLAMA_SCHED_SPREAD多卡时设为 1摊派调度单卡为 0OLLAMA_NUM_PARALLEL1 卡12 卡24 卡及以上4OLLAMA_MAX_LOADED_MODELS1 卡12 卡24 卡及以上34️⃣ 针对你硬件的文字建议例如建议模型 ≤ 23GB 以获得确定的单卡驻留。常用参数组合# 验证某个目标模型尺寸能否装下如 14GB 的 7B Q8 模型 llm-checker gpu-plan --model-size 14 # 强制按纯 CPU/内存规划显卡只作参考 llm-checker gpu-plan --cpu-only # 输出 JSON方便接入自己的自动化脚本 llm-checker gpu-plan --json--model-size会额外给出三个布尔结论能否放进单卡、能否放进多卡池、CPU 模式下能否放进内存一眼判断买不买得起这个模型。四、与模型推荐命令配合使用 规划好显存之后接着让 LLM Checker 推荐能跑在规划上限内的模型# 完整系统分析兼容模型 推荐 llm-checker check # 按用途智能推荐coding / reasoning / multimodal 等 llm-checker recommend --category coding推荐命令的评分核心与gpu-plan共享同一套确定性评分体系保证规划上限和推荐模型用的是同一把尺子。更完整的命令说明可参考 docs/guides/usage-guide.md多卡场景背后的设计动机多 GPU 放置顾问最初来自真实用户的 OOM 痛点记录在 docs/guides/ollama-critical-needs-roadmap.md。五、常见问题 FAQ Q1只有核显或没有独显还能用吗能。gpu-plan会给出cpu_fallback策略并退化为选小量化模型 CPU 安全档位的建议--cpu-only可以显式只看内存预算。Q2AMD 显卡检测到了但跑不起来除了gpu-plan项目还提供amd-guard命令专门做 AMD/Windows 可靠性检查检测 ROCm 用户态是否缺失等配合使用更稳妥。Q3怎么把规划结果接进自动化流程加--json直接输出结构化 JSON含策略、上限、环境变量、适配结论相关逻辑有专门的测试覆盖 tests/roadmap-tools.test.js。六、小结 需求命令看看我的硬件能干嘛llm-checker hw-detect多卡怎么部署、上限多大llm-checker gpu-plan某尺寸模型装不装得下llm-checker gpu-plan --model-size 14推荐具体模型llm-checker recommend --category coding多显卡不再靠猜先hw-detect摸清家底再gpu-plan划定安全边界最后recommend选出最优模型——这就是 LLM Checker 给本地大模型部署准备的完整闭环。【免费下载链接】llm-checkerAdvanced CLI tool that scans your hardware and tells you exactly which LLM or sLLM models you can run locally, with full Ollama integration.项目地址: https://gitcode.com/gh_mirrors/ll/llm-checker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考