1. 6G 显存跑 35B 模型这件事到底卡在哪先说结论6G 显存能跑 Qwen3.6-35B-A3B靠的不是玄学而是 MoE 架构加低比特量化这两层压缩。Qwen3.6-35B-A3B 是 MoEMixture of Experts混合专家结构总参数 35B但每个 token 推理时只激活约 3B 参数。再叠加 IQ2_M 这类 2-bit 工业量化权重文件能压到 11GB 左右配合 llama.cpp 的分层卸载把放不下的层丢给系统内存6G 显存就能把它拉起来。这套方案适合谁手上有入门级独显RTX 2060 6G、RTX 3050 6G 这类、想本地跑 Agent 做工具调用、又不想每月付 API 费用的开发者。跑通之后你能得到三样东西一个本地 OpenAI 兼容接口、一个能看图的多模态对话界面、一个能接 Cline 或 CC Switch 的 Agent 后端。但这里有个容易被忽略的点本地模型跑起来只是第一步真正让 Agent 干活还需要一个稳定的 API 通道。我的做法是本地 llama-server 负责推理TaoToken 负责统一 Key 和模型路由两边各司其职。下面从环境准备一路写到配置骨架和排障。2. 前置准备TaoToken 统一 Key 与本地推理引擎2.1 为什么本地部署还要接 TaoToken纯本地跑有个现实问题6G 显存下 IQ2_M 量化的模型复杂工具调用和长链推理会掉质量遇到难题时你想临时切到云端更强的模型就得改一堆配置。TaoToken 的价值在于提供一个统一的 API 通道和 Key 管理把本地端点和云端模型放在同一套接入规范下。你可以在 Cline 里配一个 provider 指向本地另一个指向 TaoToken需要时切换不用重写代码。TaoToken 的接入地址是https://taotoken.net/api兼容 OpenAI SDK 格式。先去控制台创建 API Key这个 Key 后面会用在 Cline 和 CC Switch 的配置里。2.2 硬件与软件清单配置项最低要求推荐配置操作系统Windows 10/11 64位Windows 11 64位显卡显存6GB8-12GB系统内存16GB32GB磁盘空间25GB40GB SSD显卡类型NVIDIA 独显RTX 30/40 系列纯 CPU 也能跑但 IQ2_M 量化下大概 1-3 token/s只适合批量处理。想要对话流畅建议 10 token/s 以上也就是得有 GPU 加速。2.3 下载 llama.cpp打开 llama.cpp 的 Releases 页面找最新版本。NVIDIA 用户下载llama-b9326-bin-win-cuda-12.4-x64.zip同时必须下载cudart-llama-bin-win-cuda-12.4-x64.zip后者包含 CUDA 运行时 DLL缺了会报 missing DLL。解压到纯英文路径比如D:\llama-cpp。路径里有中文会报各种莫名其妙的错这是铁律。CUDA DLL 包的内容也解压到同一目录覆盖。然后新建models子目录放模型文件。3. 可复制配置量化加载与 settings.json 骨架3.1 选对量化等级在 HuggingFace 搜Qwen3.6-35B-A3B GGUF推荐从 bartowski 或 unsloth 的仓库下载。6G 显存选 IQ2_M文件约 11GB8-12G 选 IQ4_NL 或 Q3_K_M24G 显存直接上 Q4_K_M。想要看图功能还要下载mmproj投影文件约 1.3GB没有它上传图片按钮是灰的。3.2 启动命令6G 显存用户的启动命令注意-ngl不要无脑给 999后面调优会讲.\llama-server.exe -m models\Qwen3.6-35B-A3B-IQ2_M.gguf --mmproj models\mmproj-Qwen3.6-35B-A3B-f16.gguf -ngl 28 -c 8192 -n 4096 -t 8 -ub 1024 --flash-attn --jinja --port 8080参数逐个说清楚-m是模型路径--mmproj是多模态投影文件不加不能看图-ngl是卸载到 GPU 的层数-c是上下文长度8192 约等于 6000 字中文-n是最大生成长度-t是 CPU 线程数-ub是批处理大小--flash-attn降低显存占用--jinja是 Qwen3.6 必须加的不加会出现回复异常和无限重复。看到main: server is listening on http://127.0.0.1:8080就成功了。3.3 Cline 的 settings.json 骨架Cline 是 VS Code 里的 Agent 插件配置本地模型走 OpenAI Compatible 模式。在 Cline 设置里选 OpenAI Compatible然后填{ apiProvider: openai, openAiBaseUrl: http://127.0.0.1:8080/v1, openAiApiKey: not-needed, openAiModelId: qwen3.6-35b-a3b, openAiModelInfo: { maxTokens: 4096, contextWindow: 8192, supportsImages: true } }本地 llama-server 不校验 Key填任意值即可。supportsImages设为 true 才能用多模态。3.4 CC Switch 的 config.toml 骨架CC Switch 用来在多个 API 端点之间切换。配置文件里加两个 provider一个本地一个 TaoToken[[providers]] name local-qwen base_url http://127.0.0.1:8080/v1 api_key not-needed model qwen3.6-35b-a3b [[providers]] name taotoken base_url https://taotoken.net/api api_key 你的TaoToken Key model claude-sonnet-4-5这样遇到本地模型搞不定的复杂任务切到 TaoToken 通道就行配置不用动。4. 验证请求与显存占用检查4.1 用 curl 验证接口启动 llama-server 后开一个新终端发一条请求curl http://127.0.0.1:8080/v1/chat/completions \ -H Content-Type: application/json \ -d { model: qwen3.6-35b-a3b, messages: [{role: user, content: 用一句话解释MoE架构}], max_tokens: 128 }返回里有choices[0].message.content就说明接口通了。4.2 用 Python SDK 验证from openai import OpenAI client OpenAI( base_urlhttp://127.0.0.1:8080/v1, api_keynot-needed ) response client.chat.completions.create( modelqwen3.6-35b-a3b, messages[ {role: system, content: 你是一个AI编程助手}, {role: user, content: 用Python写一个冒泡排序} ], max_tokens2048, temperature0.7 ) print(response.choices[0].message.content)4.3 检查显存占用Windows 下开任务管理器看 GPU 显存或者用nvidia-sminvidia-smi --query-gpumemory.used,memory.total --formatcsv6G 显存跑 IQ2_M 8192 上下文显存占用大概在 5.2-5.8GB 之间留一点余量给系统。如果直接爆 OOM先把-c降到 4096再把-ngl从 28 降到 20。4.4 验证 Agent 工具调用在 Cline 里发一条需要工具调用的指令比如「读取当前目录下的 package.json 并告诉我依赖列表」。如果 Cline 能正常触发文件读取工具并返回结果说明 Agent 链路通了。llama-server 窗口会打印请求日志能看到 tool_calls 的往返。5. 本篇常见错排查启动报file not found路径有中文或者模型文件名写错了。检查路径纯英文确认文件确实在 models 目录下。error loading modelGGUF 文件损坏或没下载完整。重新下载对比文件大小和 HuggingFace 标注是否一致。回复异常、无限重复启动时没加--jinja。Qwen3.6 必须加这个参数加上重启。上传图片按钮灰色没下载 mmproj 文件或者启动时没加--mmproj参数。missing DLL错误CUDA DLL 缺失。下载 cudart 包DLL 放到同一目录。显存爆了 OOMContext 太大或量化等级太高。减小-c或换更低的量化。模型文件只有几十 KB下载受限文件没下全。用curl -I URL验证链接或换镜像源。速度极慢低于 2 tok/s没开 GPU 加速或-ngl太小。确认用的是 CUDA 版本-ngl给到 20 以上。Cline 连不上Base URL 配置错误。确认 llama-server 已启动端口是 8080URL 结尾带/v1。TaoToken 通道报 401Key 没填对或者 Key 已失效。去控制台重新生成一个。6. 性能调优与接入建议-ngl不是越大越好。6G 显存下-ngl 20到-ngl 30可能比-ngl 999更快因为减少了显存和内存之间的频繁数据交换。建议从 28 开始逐步调低找最佳吞吐量点。-t设成物理核心数比如 8 核给-t 8。--flash-attn在长上下文场景能明显降显存。不同配置的预期性能RTX 4090 Q4_K_M 能到 130 tok/sRTX 3060 12G IQ4_XS 约 40-60 tok/sRTX 2060 6G IQ2_M 约 8-15 tok/s纯 CPU 约 1-3 tok/s。10 tok/s 以上对话就够流畅了。如果你打算长期用 Agent 做编码任务本地模型负责日常轻量对话和隐私数据处理遇到复杂重构、长链推理时切到 TaoToken 的 Coding Plan 通道两边配合比单用一边效率高。TaoToken 的接入文档里有完整的模型列表和参数说明API Key 在控制台生成模型对话页面可以直接测试通道是否正常。最后说个实际经验6G 显存跑 35B 模型瓶颈往往不在显存本身而在系统内存带宽。如果你的内存只有 16GB模型层卸载到内存后读取速度会拖慢整体推理。加到 32GB 内存同样的-ngl设置速度能提升 30% 左右。这个投入比换显卡划算得多。