换硬盘这件事说大不大说小也真不小。我自己的群晖从 4TB 时代一路走到 20TB 时代中间替别人换过不下二十台最早那台踩过的坑至今还记得——当时手快直接拔了一块盘换上新的结果存储池降级状态下又碰上一次意外断电两个月的家庭照片差点没救回来。所以这篇内容我想讲清楚一件事在 DSM 7.0 下把硬盘换成更大容量同时把原有数据一寸不少地保住到底该怎么走。核心关键词就三个群晖、DSM7.0、保留数据换大硬盘适合手里有一台跑着 DSM 7.0 的群晖、存储池快满了、买好新盘但不敢动手的人看也适合刚入门 NAS、想搞明白 RAID 和存储池到底是什么关系的朋友。下面不讲虚的全是能照着做的流程、能算出来的时间账还有那些官方文档里不会写的注意事项。1. 动手之前先搞清楚你的存储池是什么模式这一步看着像废话实际上决定了你后面所有操作能不能走通。DSM 7.0 里的存储结构分两层存储池Storage Pool负责把多块物理硬盘组成一个 RAID 阵列存储空间Volume建在存储池之上负责文件系统通常是 Btrfs 或 ext4。换盘扩容的本质是把阵列里的旧盘一块块换成更大的盘再让阵列吃下新增容量能不能吃、吃多少全看存储池的类型。1.1 Basic、JBOD、RAID1、SHR、RAID5/6 六种情形的换盘差异先别急着拆机打开存储管理器看一眼自己的存储池类型。我第一次帮朋友换盘的时候他信誓旦旦说是做的 RAID结果点开一看是 Basic两块盘各自独立这种情形和 RAID 完全是两条路。Basic单盘基础一块盘一个存储池。没有任何冗余所以没有换一块修一块的操作空间。想扩容只能走外部备份—重建—回拷这条路。JBOD线性拼接多块盘首尾相接容量相加同样没有冗余。它的换盘方式和 Basic 类似而且更麻烦因为逻辑卷横跨多块盘单独抽掉一块整个存储池就废了。RAID 1镜像两块盘互为镜像可用容量等于最小那块盘的容量。支持热插拔替换是最容易操作的场景。SHR / SHR-1群晖混合 RAID这是群晖自家的方案本质是分层 RAID允许你混插不同容量的硬盘并且尽量榨出每块盘的容量。双盘 SHR-1 的底层行为非常接近 RAID 1多盘 SHR-1 则接近 RAID 5。SHR-2 / RAID 6允许同时坏两块盘需要至少四块盘。安全性最好但换来的是容量利用率低、重建时间长。RAID 5至少三块盘容量利用率 n-1允许坏一块。重建期间性能下降明显。判断方法很简单存储管理器 → 存储池 → 看RAID 类型这一列。如果你是 SHR它还会额外标注SHR-1或SHR-2。1.2 为什么能不能直接扩容取决于存储池类型这个逻辑其实很好理解。RAID 阵列的容量规则是绑定在最小盘容量上的冗余信息也是按这个规则算出来的。你换进去一块大盘阵列不会自动解锁多出来的空间因为它还需要其他盘也跟上才能重新计算布局。举个最常见的例子两块 4TB 做 SHR-1可用 4TB。你买了一块 8TB只换掉其中一块。这时候存储池会按照最小盘 4TB来计算可用容量依然是 4TB多出来的 4TB 处于未使用状态。只有当你把第二块也换成 8TB两次修复都完成点下扩充才会变成 8TB 可用。反过来说Basic 和 JBOD 连 RAID 层都没有压根不存在阵列重新计算布局这种机制所以只能重建。我见过有人想给 Basic 存储池换盘直接关机拔盘插新盘开机后系统提示存储池已损毁——这不是 BUG这是必然结果。提示如果你现在就是 Basic也别急着骂自己当初选错。Basic 的好处是单盘损坏不影响其他盘恢复时不需要重建整个阵列。只是换大容量时流程会多一步。1.3 换盘前必做的一次全身体检这一步我强烈建议做哪怕你觉得自己的盘才用了半年。把下面几件事在换盘前一天就做完别等到盘都拔了才发现问题。看 SMART 全项存储管理器 → HDD/SSD → 选中每块盘 → 健康信息 → 详细信息。重点关注 05重定位扇区数、C5待映射扇区数、C6无法校正扇区数、187报告的不可修正错误。这几项只要有非零值就别拿这块盘当即将扩大的阵列里的成员先把它换掉。看剩余空间如果存储空间已经用到 90% 以上重建过程中的临时文件、快照、套件数据库都有可能导致写满进而让修复失败。建议提前清到 85% 以下。看硬盘型号是不是 SMR这是个大坑后面单独讲。看电源和散热新盘如果是 7200 转的大容量盘启动电流会高一些。四盘位以上的机器电源适配器标称功率要留出余量。我见过一台四盘位塞满 16TB 企业盘开机瞬间电源扛不住硬盘反复重启SMART 直接报错。看备份是否可用备份设备能不能正常读出来比备份本身还重要。请务必实际打开看一眼文件而不是只看备份任务显示成功。注意体检没做完就开始换盘等于闭着眼过马路。RAID 只是让你少停机不是让你不做备份。2. Basic 和 JBOD 用户的唯一可行路线这两类存储池的用户占了我接触过的群晖用户里差不多三分之一很多是早期只装了一块盘、后来慢慢加盘的。他们的换盘路线只有一条先把数据挪出去再重建最后挪回来。没有任何捷径也不存在插上就扩容的可能。2.1 为什么单盘不能靠插新盘来实现扩容有人会问群晖不是有更换硬盘向导吗对的但那个向导是针对 RAID 阵列的它做的事情是把某块盘标记为缺失让阵列降级然后引导你插新盘做修复。Basic 存储池没有冗余一旦标记缺失整个存储池就直接不可用了向导也不会给你这个机会。那能不能把新盘插上去用别的工具直接把数据拷过去可以但那本质上就是复制不是扩容。而且群晖的系统分区在每个存储池的第一块盘上都有分布Basic 换盘之后系统分区的位置、套件的安装路径、共享文件夹的权限映射都需要重新建立这也是为什么重建比复制更省心。2.2 用外接硬盘盒做中转的完整操作流程我自己用的是 USB 3.0 硬盘盒 一块跟数据量匹配的空盘这样不占机器盘位速度也够。具体步骤如下接入外接盘在控制面板 → 外接设备里确认识别正常。用 Hyper Backup 做一次完整备份目标选外接盘勾选启用客户端加密可选勾上备份完成后验证更稳。检查备份完整性在 Hyper Backup 里点备份资源管理器随机打开几个大文件和目录结构确认能读。这一步至少花 10 分钟但能救命。关机控制面板 → 终端机和 SNMP 可以先不管直接主菜单 → 关机。等指示灯全灭拔掉电源线等 30 秒。拔出旧盘装上新盘。注意托架的固定螺丝一定要上全2.5 寸盘用底部四颗3.5 寸用侧面四颗。我见过有人只拧两颗搬运时机箱一晃硬盘接口松动开机检测不到。开机进入存储管理器旧存储池会显示已损毁或未初始化这是正常的直接删除旧存储池和存储空间。新建存储池和存储空间文件系统建议选 Btrfs支持快照和数据校验。装回 Hyper Backup从外接盘恢复。恢复时可以只恢复共享文件夹套件配置单独恢复这样更快。核对数据恢复完成后对比文件数量和总容量再看看几个关键目录的修改时间对不对。2.3 中转时间与硬盘选型的实际账时间账得算清楚不然容易在半夜慌乱。以常见的机械盘为例数据量USB 3.0 外接盘读写约 120MB/s千兆局域网传输约 110MB/s1TB约 2.5 小时约 2.7 小时4TB约 10 小时约 11 小时8TB约 20 小时约 22 小时16TB约 40 小时约 45 小时小文件多的话实际时间会翻倍甚至更多。我有一台存了 200 多万张缩略图的机器8TB 数据跑了将近 60 小时主要卡在小文件随机读写上。选外接盘的时候有个经验别拿二手盘或者来路不明的盘当中转盘。中转盘的可靠性直接决定你的数据在无保护这段时间里的安全。如果数据量在 4TB 以内用一块全新 CMR 机械盘就够如果超过 10TB我一般建议直接买两块一块做中转另一块留着当冷备份。3. 双盘 SHR-1 与 RAID1 的四步换盘法这是最典型的场景也是操作体验最舒服的一类。整个流程可以概括成换第一块 → 修复 → 换第二块 → 修复 → 扩充。只要中途不出意外全程可以在开机状态下完成服务基本不中断。3.1 先确认存储池处于健康状态在存储管理器 → 存储池里存储池状态必须是正常。如果是已降级或者堪用说明已经有一块盘出问题了那就先修复再换盘别在降级状态下动手。同时确认两件事一是新盘已经被系统识别插上后在 HDD/SSD 里能看到二是新盘容量大于或等于旧盘。RAID 修复不支持用更小的盘替换这一点没有例外。如果你买的是同容量盘流程一样只是最后没有扩容这一步。3.2 用更换硬盘向导替换第一块盘DSM 7.0 里群晖内置了一个很贴心的功能路径是存储管理器 → 存储池 → 选中存储池 → 右上角…或动作 → 更换硬盘。它会弹出一个向导让你选择要替换哪一块然后自动把这台盘标记为待替换状态。向导之后系统会提示你关机换盘。这里的顺序很重要先让向导把盘标记完成此时存储池状态会变成已降级这是预期行为。主菜单 → 关机等指示灯全灭。拔电源线等 30 秒让电容放电。拔出旧盘装入新盘固定好。开机进入存储管理器此时存储池依然是已降级。选中存储池 → 动作 → 修复选择刚才那块新盘。注意有些版本的 DSM 在更换硬盘向导里会直接让你选新盘、自动开始修复不用手动点修复。两种流程效果一样按界面提示走就行。3.3 第二块盘的替换与第二次修复等第一次修复彻底跑完存储池状态回到正常再动手换第二块。千万不要在第一块还没修复完的时候就把第二块也拔了那样阵列会直接失效数据就真的要靠备份来救。第二次流程和第一次完全一样唯一的区别是第二次修复完成后存储池的容量会变成新的容量但你可能还看不到扩充按钮因为还需要手动点一下。3.4 扩容按钮到底在哪里很多人在这一步卡住说我盘都换完了容量怎么没变。答案是存储池修复完成后还需要在存储空间上点扩充。路径是存储管理器 → 存储空间 → 选中你的存储空间 → 动作 → 扩充。DSM 会提示可以扩充到多少容量确认后它会调整文件系统大小这个过程从几分钟到半小时不等取决于数据量。如果存储池下有多个存储空间就要逐个扩充直到把池容量用满。我一般建议一个存储池只建一个存储空间管理起来简单扩容时也不会漏。3.5 修复耗时估算与期间的操作禁忌修复速度受硬盘、CPU、后台负载影响很大下面是我根据多次实测整理的估算表单位是小时实际可能偏差 30% 以上单盘容量RAID1 / 双盘 SHR-1 镜像修复RAID5 / SHR-1多盘校验重建1TB约 3 小时约 5 小时4TB约 12 小时约 20 小时8TB约 23 小时约 39 小时12TB约 35 小时约 58 小时16TB约 46 小时约 77 小时20TB约 58 小时约 97 小时修复期间有几件事绝对不能做不要执行第二次换盘前面说过这会让阵列直接失效。不要跑大批量的小文件写入比如照片索引、视频转码、Docker 容器全量拉取会让重建速度掉一半。不要手动重启或断电重建中断后虽然能续但风险陡增。不要在这期间做存储池的数据清理或RAID 一致性检查这两个任务和重建抢 IO等于自己给自己添堵。我一般会在修复开始后把下载任务、同步任务都暂停等重建完成再恢复。多花的那点时间比重新拷贝一遍数据便宜太多。4. RAID5、RAID6 与多盘 SHR 的容量释放逻辑多盘用户的换盘流程和双盘一样只是重复次数更多而且容量的释放规则更绕。搞懂这套规则你才知道自己换完之后到底能拿到多少可用空间。4.1 容量计算规则速查不同 RAID 类型的可用容量算法完全不同我整理成一张表方便对照阵列类型可用容量公式举例Basic单盘容量1×8TB 8TBJBOD各盘容量之和4TB8TB 12TBRAID 1最小盘容量4TB8TB 4TBRAID 5(n-1) × 最小盘容量4×(4TB) 12TBRAID 6(n-2) × 最小盘容量4×(4TB) 8TBSHR-1总容量 − 最大单盘容量448 8TBSHR-2总容量 − 最大两块盘之和4444 8TB这里有个反直觉的点SHR-1 的冗余空间等于最大那块盘的容量。所以如果你做的是 SHR-1只换掉一块小盘容量很可能一点都没涨。举个真实例子我之前那台 448 的 SHR-1可用 8TB我先把两块 4TB 换成 8TB结果可用还是 8TB ——因为总容量变成 24TB减去最大盘 8TB 等于 16TB不对这里要重新算。当三块都是 8TB 时SHR-1 就是 RAID5可用 (3-1)×8 16TB。确实涨了。但如果我只换了一块变成 848总容量 20TB冗余等于最大盘 8TB理论可用 12TB可实际上阵列还没重新分层容量不会立即释放需要全部换完并修复。所以结论很简单要涨就一次换齐中途换一半基本看不到收益。4.2 逐块替换的顺序与注意事项多盘换盘建议按顺序一块一块来每一块都要走完换盘 → 修复 → 状态恢复正常这三步再动下一块。顺序本身没有硬性要求但我习惯从盘位号小的开始这样不容易记混。有一点要特别提醒多盘 SHR 在部分换盘的情况下可能不会立即触发扩容。比如四盘 SHR-1你换了两块大盘另外两块还是小盘此时存储池容量通常不变因为阵列还是按最小盘的规则在跑。要等全部换成大盘、所有修复完成点扩充之后新容量才会一次性释放。4.3 校验重建期间阵列到底有多脆弱这是我最想强调的部分。RAID5 和 SHR-1 在正常状态下允许坏一块盘但在重建期间这个保护其实非常薄弱。原因有两个第一重建过程本身要对剩下所有盘做全盘读取如果其中某块盘有潜在的坏道在这个高负载下很容易暴露出来。行业里有个说法叫重建期间的二次故障率实际经验是硬盘越老、负载越高风险越大。第二重建期间如果断电或者系统崩溃阵列可能进入已损毁状态这时候就只能靠备份恢复了。所以在重建期间我一般会做三件事把 UPS 接上如果还没接、暂停所有非必要任务、每天看一次 SMART 和重建进度。看进度的命令很简单SSH 登录后执行cat /proc/mdstat输出里会有[....] resync 42.5%这样的进度条finish后面是预计完成时间。如果进度长时间停在某个百分比不动那就是出问题了要立刻看 dmesg 里有没有 IO 错误dmesg | tail -50看到I/O error或者medium error就说明那块盘有问题得赶紧准备备份。5. 实操中最容易踩的坑与排查实录这一节全是踩出来的经验。我帮人处理过的故障里九成都集中在这几个点上。5.1 修复按钮灰掉点不动最常见的原因是阵列没有真正进入降级状态。如果你是通过停用硬盘操作那停用完成后存储池应该显示已降级修复按钮才会亮。如果显示还是正常说明停用没生效重新操作一次。第二个原因是新盘容量小于被替换的盘。系统会直接拒绝修复按钮灰掉。这时候要换一块容量够大的盘。第三个原因是新盘上残留了旧的分区表。如果这块盘是从别的设备拆下来的建议先在 Windows 的磁盘管理里把所有分区删干净或者用群晖的安全擦除功能处理一遍。残留分区有时会让 DSM 认为它不属于这个存储池。5.2 重建速度慢到怀疑人生如果重建速度只有几 MB/s按这个顺序排查看硬盘是不是 SMRSMR叠瓦式磁记录硬盘在持续写入时性能会断崖式下跌尤其在做 RAID 重建这种全盘写入时速度可能掉到个位数 MB/s严重时还会因为超时报错导致重建失败。买盘前一定要查清楚CMR垂直磁记录才是 NAS 的正确选择。常见的大容量 SMR 盘型号在网上都能查到买之前花两分钟搜一下型号加SMR就知道了。看后台任务控制面板 → 计划任务、套件中心 → 正在运行的套件、Docker 容器、下载任务全部暂停试试。看硬盘温度超过 55 摄氏度硬盘会主动降速。检查风扇转速和机箱通风。看是不是同时在做数据清理存储管理器 → 存储池 → 数据清理如果它在跑暂停掉。5.3 换完之后容量比预期少这种情况通常有四个原因SHR-1 的冗余占用如前面所说冗余等于最大盘容量这是正常的。文件系统保留空间Btrfs 会预留一部分空间用于元数据和快照通常 4% 左右。存储空间没扩充池容量涨了但卷没点扩充。部分盘未更换阵列还按最小盘计算。这些都可以在存储管理器里看到存储池显示总容量和已用容量存储空间显示的是卷的大小。两边对比一下就知道卡在哪一步。5.4 换盘后套件打不开、共享文件夹不见了这种情况一般发生在 Basic 或 JBOD 重建之后因为套件的安装路径绑定在存储空间上。新存储空间建好之后需要重新安装套件并从备份里恢复配置。共享文件夹如果不见了去控制面板 → 共享文件夹里检查是否真的没有还是只是权限映射丢了。DSM 有一个共享文件夹同步功能如果之前开过可以直接同步回来。5.5 常见问题速查表现象可能原因处理办法修复按钮灰色阵列未降级、新盘小于旧盘、残留分区确认降级状态换大容量盘清空分区表重建速度极慢SMR 盘、后台任务抢占、高温换 CMR 盘暂停任务检查散热扩充按钮不出现未全部换盘、修复未完成、卷未选中完成换盘与修复逐个扩充存储空间容量没有增加SHR 冗余规则、未点扩充对照容量表核算执行扩充操作存储池显示已损毁重建中断电、多块盘同时故障立即停止写入从备份恢复新盘识别不到托架未固定、接口接触不良、供电不足重新插拔检查螺丝确认电源余量换盘后服务异常套件路径变化、权限丢失重装套件恢复配置检查共享文件夹权限6. 换盘前后的数据安全与收尾检查换盘这件事最怕的不是操作复杂而是操作完了才发现有问题。所以收尾环节我从来不省。6.1 三重备份思路我给自己的标准是至少两份不同介质的备份其中一份离线。具体来说第一份另一台设备上的 Hyper Backup 目标可以是另一台群晖也可以是一台旧电脑。这份是热备份日常自动跑。第二份外接硬盘的冷备份用 USB Copy 定期同步做完就拔下来收好。这份防的是勒索软件和误删。第三份关键数据上云比如照片和文档。这份防的是物理灾害。换盘之前至少要确认第一份和第二份都是最新的。我见过太多人只做了备份任务却没检查真要用的时候发现备份文件是坏的。6.2 散热、供电和机械固定这三个细节被低估得厉害。我的经验是散热硬盘长期超过 50 摄氏度寿命会明显缩短。机箱前面板别贴着墙留出至少 10 厘米进出风空间。四盘位机型塞满大容量盘时中间盘位温度通常最高可以适当错开安装。供电硬盘启动瞬间电流是运行时的两三倍。如果机器经常在开机时硬盘掉线多半是电源余量不够。原装适配器的标称功率最好留 30% 以上余量。固定3.5 寸盘一定要上全四颗螺丝托架导轨要卡到位。机械盘怕振动机箱放在稳固的平面上别放在经常被碰到的位置。6.3 扩容完成后的收尾清单扩容完成之后我一般会做这几件事养成习惯之后基本没再出过问题手动触发一次 RAID 一致性检查确认阵列数据一致。跑一次完整的 SMART 扩展检测看新盘有没有早期缺陷。检查所有共享文件夹的权限特别是那些给外部用户或套件使用的。验证快照任务是否正常Btrfs 的快照要确认新容量下还能正常创建。更新一次存储池和硬盘的备注信息把更换日期和盘型号记下来下次换盘时能省不少事。观察一周看温度和 SMART 有没有异常变化。我自己在实际操作中的体会是换盘最花时间的从来不是拧螺丝那几分钟而是修复那几个小时甚至几十个小时的等待。这段时间里耐心比技术更重要忍住不要乱点、不要重启、不要急着插第二块盘基本就稳了。另外买盘之前一定先查型号是不是 CMR这个动作花两分钟能省掉你后面几十个小时的折磨和不必要的返工。