先交代一下背景我原来的卡是 RTX 2060 6GB用了快五年平时打打游戏和剪剪视频没什么问题真正让我动换卡念头的是本地跑大模型。前阵子折腾 Ollama 和 llama.cpp发现 7B 模型 Q4 量化后勉强能跑但生成速度只有 8~10 token/s换个长上下文窗口直接被填满稍微大一点的 14B 模型连加载都失败。当时我就很清楚地意识到本地 AI 体验的瓶颈根本不是显卡核心而是那 6GB 显存和可怜的显存带宽。后来我花了 4400 元换了张 12GB 显存的新卡。换完以后第一件做的事不是跑游戏而是立刻跑了一遍熟悉的模型。结果可以用“天翻地覆”来形容同样的 7B Q4 模型生成速度从 9 token/s 飙到了 40 token/s而且我能同时加载 14B 模型上下文能开到 8K 以上还不爆显存。这篇博文就详细记录一下我这次换卡的前前后后包括选卡思路、实测数据、日常配置和踩过的坑给还在纠结“本地跑大模型到底需要什么样显卡”的朋友一点参考。1. 换卡前旧卡跑大模型的真实瓶颈在哪里1.1 从 6GB 显存开始的一路妥协先说老卡。RTX 2060 作为一张 2019 年的中端卡放在当年还算能打6GB 显存跑游戏也够用但在大模型场景里它暴露出一堆问题。最开始我下载的是 llama.cpp用 Q4_K_M 量化后的 7B 模型如 Llama 3模型文件大约 4.4GB放在 6GB 显存里勉强装得下。但系统还有其他显存占用比如浏览器硬件加速、桌面层缓存实际可用也就 5GB 多加载时经常在 99% 附近反复横跳。即使加载成功推理中也一直处于“显存不够来回换”的状态。我留意到任务管理器里 GPU 的“共享 GPU 内存”这一项经常有大量占用说明部分权重被挤到了 CPU 内存里。这就是为什么同一款模型在别人的 12GB 卡上能跑 40 token/s而我的 2060 只有个位数——权重一部分在显存一部分在内存每次生成都要经过 PCIe 总线来回搬运速度直接被拖死。后来我也试过把模型卸载、关掉一切占用显存的应用用 --n-gpu-layers 让更多层交给 GPU但 6GB 容量上限放在那里7B Q4 都只是刚过门槛想要跑 14B 模型、想要长上下文完全没有办法。于是我开始认真研究本地跑大模型到底卡在哪个环节。1.2 决定本地大模型体验的核心指标显存容量和显存带宽很多新手以为大模型靠显卡的 CUDA 核心数、AI 算力TFLOPS决定一切实际用过就知道在“单机本地推理”这个场景里最要命的两个参数是显存容量决定你能不能装下一个模型。比如 7B FP16 格式要 14GB 显存Q4 量化后要 4GB 左右14B Q4 大约要 8.5GB32B Q4 大约要 18GB。显存不够模型就只能缩小量化等级、降低上下文长度或者让部分层跑到内存里速度断崖式下降。显存带宽决定你生成 token 有多快。Transformer 在自回归解码阶段每一步都需要把模型全部参数从显存读取一遍。参数读取速度越慢token 生成越慢。RTX 2060 的显存带宽大约是 336 GB/s而定位于 4070 Super 这一类的新卡能有 500 GB/s 以上这就是为什么同样层数分配在显存中新卡能快出好几倍。算力当然也有影响尤其是在“同时处理多个请求”或“跑长文本预填充阶段”时CUDA 核心和 Tensor Core 更强优势明显。但单机个人使用、短上下文场景下显存带宽往往是木桶最短的那块板。所以我换卡的首要目标很明确把显存容量和显存带宽同时往上拉一档而不是盲目追求“最强核心数”。2. 选卡思路4400 元的预算怎么分配才合理2.1 候选卡对比哪张卡最符合本地大模型需求我先列了几张当时价位在 4000~4500 的卡用表格做个对比。这里的关键不是“哪张游戏跑分高”而是“哪张卡能让我顺畅跑 14B 甚至 20B 模型”。显卡显存容量显存类型/位宽显存带宽近似本地大模型适合点RTX 4060 Ti 8GB8GBGDDR6 128bit288 GB/s显存小带宽比 2060 还低不适合RTX 4060 Ti 16GB16GBGDDR6 128bit288 GB/s容量够但带宽太低7B 可能没 2060 快多少RTX 407012GBGDDR6X 192bit504 GB/s容量带宽均衡但价格稍高RTX 4070 Super12GBGDDR6X 192bit504 GB/s核心更多性价比不错4400 左右能拿下RTX 3070 Ti / 3080 二手8GB / 10GB各种608 GB/s二手水太深且显存偏小当时也考虑过二手 RTX 3090 24GB但价格太高而且矿卡风险大。最终我把目标锁定在 RTX 4070 Super 12GB。它的显存带宽跟 4070 一致比 2060 高了约 50%显存容量则是两倍而且新架构对大模型推理的优化更好。CUDA 核心数也比普通 4070 多了大约 20%预填充阶段的速度也会有明显提升。2.2 为什么不选“显存更大但带宽低”的卡我差点买了一张 4060 Ti 16GB因为 16GB 显存听起来很诱人——它甚至能跑 32B 的 Q4 模型。但后来查了下参数发现这卡是 128bit 位宽显存带宽只有 288 GB/s比老 2060 还低。这意味着如果你只跑 7B 模型它的生成速度可能反而不如 RTX 2060跑大模型容量是够了但每生成一个 token 都要慢慢读显存速度会让人崩溃。这里顺便给一个经验公式token 生成速度 ≈ 显存带宽 / 模型权重体积。一个 7B Q4 模型权重在 4.5GB 左右如果带宽是 288 GB/s理论极限大约 64 token/s但实际一两百瓦功耗下不会跑满再加上 overhead能到 30~40 token/s 就已经很好。而占用显存更大的 14B Q48GB 多用 4060 Ti 16GB 跑带宽 288 除了喂模型还有背景开销估计只能到 20 token/s 上下。换成 4070 Super12GB 显存跑 14B Q4 其实很勉强模型上下文系统缓存会超过但跑 7B 或 12B 时会快很多。后来我也想明白了如果你只有一张卡希望在“能跑”和“跑得快”之间取平衡12GB 显存 高带宽是甜点位。它能覆盖 7B~14B 主流模型速度快也不容易被新模型淘汰。16GB 低带宽卡看起来容量大实际用起来挺难受的。2.3 装机细节与供电适配这里补充一个很多人忽略的点换显卡不只是换显卡本身还要查电源和机箱尺寸。我旧电源是 550W 的铜牌4070 Super 的 TDP 大约 220W加上 CPU 和主板550W 比较紧保险起见我换了 650W 金牌电源多花了 200 多不在 4400 预算里。另外显卡长度超过 30cm我的机箱是紧凑型中塔正好放下但电源线位置很尴尬装的时候把硬盘位挡了需要重新理线。所以如果你的目标也是 4070 Super 这个级别买之前一定要看三样东西电源额定功率建议 650W 以上、机箱显卡限长、显卡供电接口类型新卡普遍用 8pin 或 12VHPWR。不然卡到了装不上尤其供电线不够长真的很折腾。3. 换卡前后实测从 6GB 到 12GB体验提升多少3.1 测试环境与方法先交代一下我的测试环境方便你对比参考CPUi5-12400F内存32GB DDR4 3200旧卡RTX 2060 6GB新卡RTX 4070 Super 12GB系统Windows 11驱动均为最新版本推理框架Ollama 0.3.x llama.cpp同一模型测试多次取峰值模型Llama 3 8B Instruct Q4_K_M文件大小约 4.9GB以及 Qwen2.5 14B Instruct Q4_K_M约 9GB测试方法很简单用 Ollama 加载模型然后固定使用 “请回复一篇关于人工智能的短文大约 300 字” 这类提示词测量首次生成至最后一个 token 的平均速度并统计显存占用峰值。每项跑三次取中间值。3.2 模型加载能力对比这一项是最直观的。旧卡 6GB 显存遇到 Llama 3 8B Q4 已经是极限加载时系统内存暴涨显存占用约 5.7GB几乎沾满。而 Qwen2.5 14B Q4_K_M 这个模型总共约 9GB在旧卡上直接加载失败Ollama 提示需要至少 10GB 显存。我当时试过使用 CPU only 模式跑速度只有 1~2 token/s基本没法用。换成 12GB 新卡后8B Q4 模型载荷都润绰有余显存峰值约 5.9GB还剩下 6GB 左右可以开长上下文或者同时挂另一个终端。14B Q4 也能顺利加载显存占用约 9.5GB加上上下文 8K 后大约 11GB不会爆显存。如果不开浏览器硬件加速甚至可以再塞一个小模型做工具调用。模型与量化旧卡 6GB 是否可跑新卡 12GB 是否可跑7B Q44.5GB勉强加载慢速度低轻松速度高8B Q44.9GB极限容易爆显存轻松14B Q49GB不可跑需 CPU offload速度极慢可跑余量有限20B Q412GB 左右不可跑基本刚好需严格关闭其他占用3.3 推理速度实测我用表格记录一下实际测得的生成速度所有结果均为生成阶段decode的速度单位 token/s。模型RTX 2060 6GBRTX 4070 Super 12GBLlama 3 8B Q4_K_M上下文 2K8~10 token/s41~44 token/sLlama 3 8B Q4_K_M上下文 16K2~4 token/s卡顿明显32~35 token/sQwen2.5 14B Q4_K_M上下文 2K无法在显存中运行CPU offload 约 1.5 token/s23~26 token/sQwen2.5 14B Q4_K_M上下文 8K无法在显存中运行19~22 token/s如果只看倍数新卡在 8B 小模型上比我旧卡快 4 倍以上而更刁钻的是长上下文。旧卡一开 16K 上下文显存不仅被 token 挤爆还反复把中间层卸载到内存速度掉到 2~4 token/s完全不可用新卡即使上下文 16K依然能稳定在 30 token/s。这种体验差距已经不是单纯的“快”了而是“能不能正常用”的区别。3.4 预填充速度也提升很大很多人只关注生成速度却忽略 prefill预填充速度。就是你抛出问题时首 token 需要等待的时间。模型在预填充阶段会并行处理输入文本算力核心影响很大。我拿一份 2000 字的输入测了一下旧卡首 token 延迟大约 6.8 秒新卡只用 1.2 秒。这个差异在交互式对话里非常明显——换卡前敲完回车总要倒杯水等一会儿换卡后感觉基本是“秒回”。所以如果你像我一样不只是拿模型聊天还经常拿大段文档做总结、写代码分析那么 CPU 算力强的卡优势会被进一步放大。4. 换卡后的环境搭建与日常使用配置4.1 驱动、CUDA 与显存释放换卡后第一步就是卸干净旧驱动然后安装新驱动。我用 DDU 在安全模式下清理了旧 N 卡驱动避免残留配置导致新卡识别异常。之后安装最新 Game Ready 驱动再装 CUDA 12.4因为 Ollama 和 llama.cpp 目前普遍基于 CUDA 12.x 编译建议不要图旧版本直接用 CUDA 11.x不然部分预编译包可能不识别。还有一点容易被忽略Windows 显示设置里的“硬件加速 GPU 计划”会影响显存占用。我建议在跑大模型时关闭浏览器硬件加速或者至少把浏览器的 GPU 进程限制一下。之前我开着一个 Chrome 视频页面12GB 显存被吃掉了 1.5GB导致 14B 模型加载到 98% 直接爆显存。后来养成习惯跑大模型前先看看任务管理器里显存占用关掉不必要的软件。驱动装好后可以用nvidia-smi验证一下。命令行输入后能看到显存总量、温度、驱动版本等信息。要是看到 12GB 变成了 11.9GB 或更低可能是系统或驱动占用了部分显存正常现象。4.2 Ollama 与 llama.cpp 的配置实践我现在主要用 Ollama因为用起来真的省心。换卡后我调整了几个参数环境变量OLLAMA_KEEP_ALIVE120让模型在 2 分钟内保持加载状态避免频繁切换模型时每次都要重新加载。OLLAMA_NUM_PARALLEL2允许两个并发请求但 12GB 显存跑 14B 模型时并发太高容易爆所以我实际只开 1。在启动任何 14B 模型之前我会先在命令行执行ollama ps查看当前已加载的模型如果有小模型还占着显存先ollama stop把它释放。如果是 llama.cpp 用户可以关注一下--n-gpu-layers参数。比如跑 14B Q4 模型把层数设置为 99 表示所有层都放显存效果最好但 12GB 显存跑 14B Q4 加上上下文某些层可能需要 offload这时可以试着调低--n-gpu-layers比如设置为 85让一部分层留在 CPU。实测下来如果非要调低层数速度会掉得比较快所以我的策略是优先保证上下文长度在 8K 以内让模型层完全进显存。4.3 本地大模型微调LoRA 也能跑起来了换卡前 6GB 显存基本没法做任何微调实验因为做大模型微调哪怕用 LoRA模型权重本身和梯度占用动不动十几 GB。换到 12GB 以后我终于实际跑了一次 LoRA 微调。我用的是 HuggingFace PEFT 库准备对 Qwen2.5-7B 做指令微调。Q4 量化后加载基础模型约 4.8GBLoRA 适配器大概额外占 1~2GB4K 序列长度、batch size 1整体显存峰值约 10.5GB新卡跑得动。训练速度大概每 step 1.8 秒虽然不能和 A100 比但至少我能自己调试数据、看 loss 曲线了。这对学习大模型微调流程很有帮助。如果说以前 6GB 显存只能在“跑推理”边缘试探那 12GB 让我真正接触到“模型训练与微调”这个领域。如果你想玩 LoRA我的建议是优先选 7B 模型用 8bit/4bit 量化加载序列长度控制在 4096 以内batch size 先用 1观察显存峰值后再慢慢调大。4.4 日常使用本地知识库问答和 Agent 工具调用换卡后我还把之前一直没跑起来的本地知识库问答搭起来了。用 Ollama 加载嵌入模型如 nomic-embed-text加上本地向量库配合 8B 模型做检索增强生成RAG。以前用 6GB 卡加载嵌入模型 生成模型总要来回卸现在 12GB 可以同时放两个模型体验好了很多。还有一点是 Agent 工具调用。很多 Agent 框架会同时加载多个模型一个主模型、一个工具调用模型、一个嵌入模型。虽然可以共用同一个模型但显存紧张时会导致 Agent 运行缓慢。现在我的 12GB 显存能同时加载一个 8B 主模型和一个 1.5B 嵌入模型跑 Agent 的流程顺畅了不少。未来如果继续加大上下文和多模型并行我感觉 12GB 也只是一个入门口长期玩的话可能还要瞄着 24GB 以上的卡。5. 常见问题与避坑指南5.1 显存明明 12GB为什么加载 14B 模型还是爆这个问题我遇到过原因一般有三类。第一系统里有其他程序占用显存比如浏览器、游戏空间录制、侧边栏小组件建议跑模型前用任务管理器看 GPU 内存占用。第二上下文长度设置太大14B Q4 大约 9GB 参数加上 12K 上下文的 KV cache 可能要 3GB 以上总共超过 12GB 时就爆了。第三你用的量化格式不是 Q4_K_M比如 Q8 或 FP16模型体积会大很多14B Q8 要 15GB12GB 卡根本跑不了。解决方式很简单要么降低上下文长度比如 2K~4K要么换更激进的量化格式Q4 或 Q3要么用 Ollama 的OLLAMA_GPU_OVERHEAD512之类的参数预留空间但效果有限。实在不行就老老实实用 8B 模型。5.2 换卡后为什么感觉速度提升不明显如果你从 2060 换到 4070但速度只提升了一倍多甚至不到先别怀疑卡有问题。最可能的原因是模型层没有完全放显存。Ollama 通常会自动做但如果用 llama.cpp 手动跑层数设置不对就会有一部分层落到 CPU速度就被 CPU 拖死了。解决办法是检查启动日志里类似llama_kv_cache_init和offload的信息确认所有层都在 CUDA 侧。还有一种情况是 CPU 太弱。即使是纯显存推理模型的一部分逻辑比如采样、tokenizer依然在 CPU 上跑CPU 性能不足会成为整体瓶颈。我测试时用的 i5-12400F 算中等水平如果你还在用 i3-8100 这类老 CPU最好一起换掉否则 GPU 速度可能被拖到 60% 左右。5.3 4400 元值不值什么时候建议换什么时候不建议这个问题不能一概而论。如果你的主要需求是跑小模型1B~3B 级别每天就翻译、写写摘要那 8GB 显存的 RTX 4060 Ti 完全够没必要花 4400。但如果你日常要跑 7B 以上模型经常处理长文本或者想动手做微调那就值得。我之前 6GB 卡连加载 8B 都困难花 4400 属于直接跨过门槛体验升级非常明显。但也要提醒一下物理显存只有 12GB未来想跑 70B 甚至更大的模型12GB 还是远远不够。如果你手头预算充足且确实有长期折腾大模型的打算直接上二手 3090 24GB 或 5090 级别可能更省心。不过这些卡价格高功耗也更高需要更大电源和更好的散热普通用户没必要。4400 元这个档位在我看来是“性价比甜点区”能流畅跑 7B~14B 主流模型又不至于为了回显存储器掏空钱包。5.4 混合显卡/双显卡用户特别提醒如果你笔记本或主机上有两张显卡比如 Intel 核显 N 卡一定要在驱动中确认大模型程序用的是独显。Windows 默认可能让 Ollama 或 llama.cpp 跑在核显上那样速度会慢到离谱。解决方法是在 Windows 设置 系统 显示 图形设置中为ollama.exe或llama-cli.exe指定“高性能 NVIDIA 处理器”。我试过在某个模型上没指定时速度只有 10 token/s指定后立刻回到 35 token/s。这种问题在大模型场景里特别隐蔽因为程序不会主动提示你在用哪张卡。如果你会用双显卡直通最好把独显直连打开就是让显示器直接接到独显上避免通过核显转出。不然显存访问路径会多一层虽然对推理影响不明显但实测几轮下来还是有 5%~10% 的损耗。最后再分享一点个人体会这次花 4400 元换显卡对我来说并不是一次简单的硬件升级而是把本地大模型从“玩具”变成了“工具”。以前我只能小心翼翼玩小模型还要忍受一秒一个字的慢速输出现在我可以任意切换 8B/14B 模型跑长上下文、做 RAG、甚至微调 LoRA整个工作流完全不一样了。如果让我给后来人一个最直接的建议那就是决定本地大模型体验的第一指标是显存容量第二是显存带宽第三才是核心算力。不要只看显卡的“AI 算力”宣传先算清楚你想跑的模型量化后占多大空间、需要多长上下文。预算有限时优先保证显存容量预算稍充裕就选容量和带宽兼顾的卡比如我这张 12GB 4070 Super。最后还有个细节换卡以后记得把旧卡拿去给朋友跑游戏或者挂个二手平台回血回血的钱还能买个 2TB NVMe 硬盘存模型和数据集这样整个本地 AI 环境才算完整。实际上我后来就是这么干的把 2060 卖了 300 块自己贴钱换了内存和硬盘现在跑模型、存数据集、写代码整套流程顺畅得不像同一台机器。希望这篇记录能帮你少走点弯路花同样的钱换到最适合你的卡。