主頁 / RAID重建需要多長時間及有何風險? RAID重建需要多長時間及有何風險? RAID 陣列中的硬碟故障後,系統會自動進入重建程序,把剩餘硬碟中的資料重新計算並寫入替換碟。重建並非可以即時完成的背景操作,其時間以小時以至天數計算,期間整列處於降級狀態,任何額外故障都可能造成資料損失。本文說明重建時間的計算方法、主要風險與應對策略。
RAID 重建在做甚麼 RAID(Redundant Array of Independent Disks,獨立磁碟冗餘陣列)透過把資料分散寫入多顆硬碟並加入冗餘資訊,讓陣列在單顆硬碟故障時仍然可供存取。重建(Rebuild)正是運用這套冗餘機制:替換故障硬碟後,控制器或軟體從其餘硬碟讀取資料與同位檢查資訊,重新計算出故障硬碟上的完整內容,寫入新硬碟,直至陣列回復完整狀態。
全程線上進行 多數企業級 RAID 支援熱交換替換,重建期間陣列繼續提供讀寫服務,使用者不會察覺停機,但整體效能會顯著下降。
讀取壓力極大 重建需要讀取陣列中每一顆剩餘硬碟的全部容量,是長時間、全速率的密集讀取操作,會令其餘硬碟承受比平日高得多的負載與溫度。
以容量為基準 重建的工作量取決於硬碟容量,與已使用的資料量無關。一顆 18TB 硬碟即使只寫入了 1TB 資料,重建仍須掃描全碟 18TB 容量。
理解這三點,就能明白為甚麼重建時間以小時甚至天數計算,以及為甚麼業界一直強調重建期間「陣列未完成前都不算安全」。
重建時間如何計算 重建時間沒有固定數值,主要由三個因素決定:硬碟容量、讀寫速率與系統負載。粗略估算公式是:
因素 影響方式 實務例子
硬碟容量 重建須掃描全碟容量,容量越大時間越長 8TB 硬碟比 4TB 多一倍掃描量
硬碟讀寫速率 消費級硬碟持續讀取約 150–250MB/s,企業級或近線級相近 8TB 於約 200MB/s 下理論需 11 小時以上
系統同時負載 線上重建與日常讀寫共用控制器與磁碟頻寬,負載越高重建越慢 辦公時間使用高峰可令重建時間延長一倍
控制器與介面 舊款控制器或磁碟重組中的陣列會拖慢整列速度 介面或通道受限時無法跑滿硬碟速率
以實例計算:一顆 8TB 硬碟容量約為 8,000 億位元組,假設持續讀取速率為 200MB/s,理論最短時間約為 800,000,000,000 ÷ 200,000,000 = 4,000 秒,約 11 小時。這只是「理論下界」:實際重建因線上讀寫爭用、巡讀(媒體掃描)與其他負載並行,往往需時 24 小時以至數天。RAID 5 與 RAID 6 的重建計算亦不盡相同,RAID 6 需讀取並驗算兩套同位資料,整體時間通常更長。
因此規劃 RAID 陣列時,不能假設「換碟後幾小時內完成」。應把重建時間與系統的可用性要求一併考慮,並在故障發生前便備妥替換硬碟。
需要協助? 重建期間的監察與重建後的驗證涉及硬件與備份核對,交由工程人員處理可避免二次故障造成資料損失。提供陣列型號與硬碟容量即可。 WhatsApp →
不同 RAID 等級的重建特性 不同 RAID 等級的重建方式、讀取範圍與風險不同,選型時應了解各自的特性。
RAID 等級 容錯能力 重建特性
RAID 1 可容忍一顆故障 把餘下鏡像硬碟的資料整碟複製至替換碟,讀取壓力集中在剩餘一顆硬碟
RAID 5 可容忍一顆故障 需讀取其餘全部硬碟並以 XOR 運算重算同位資料,每顆硬碟都在重建中參與讀取
RAID 6 可容忍兩顆故障 讀取範圍與運算量最大,重建時間最長,但容許重建期間再故障一顆而不失資料
RAID 10 每組鏡像可容忍一顆 以鏡像組為單位複製,重建速度較快,但只能容忍每組內一顆故障
選型的取捨在於容錯數與重建代價:RAID 5 空間效率高但重建時間長;RAID 6 以兩套同位換取重建期間多一層保障,適合大容量硬碟與不可中斷的服務;RAID 10 重建快但可用容量只有一半。沒有「最好」的等級,只有「最適合當前風險承受能力」的選擇。
重建期間的資料風險 重建最大的風險並非重建本身,而是重建期間發生的二次故障。陣列在降級狀態下只剩下一層冗餘,若在重建完成前再有另一顆硬碟故障,對 RAID 5 而言即代表陣列失效,資料需要從備份還原。
不可修復讀取錯誤(URE) 硬碟在讀取過程中如遇到無法以 ECC 修正的區塊,會回報不可修復讀取錯誤。硬碟廠商以不可修復位元錯誤率(UBER)標示,企業級硬碟典型為每 10 的 15 次方位元讀取出現一個錯誤。大容量硬碟重建須讀取全碟,遇見 URE 的機會相應提高,而重建中的 URE 對 RAID 5 是致命問題。
第二顆硬碟故障 故障硬碟周邊的硬碟往往曾承受相近的溫度、震動與工作量,重建成為全陣列最密集的讀取操作,可能令本身已老化的硬碟在此時出現故障,即所謂的「重建期間崩盤」。
快照與備份失效 若陣列長期處於健康狀態而備份排程未有驗證,重建失敗時才發現備份不可用,損失便無法挽回。資料安全性最終取決於備份,而非 RAID 本身。
對策方面:採用 RAID 6 可在一次故障後仍有餘裕;選用企業級硬碟可降低 URE 機率;定期執行陣列完整性檢查可及早發現隱性壞區;最重要是維持「3-2-1 備份」原則,即至少三份資料、兩種儲存媒體、一份異地備份,讓 RAID 故障永遠不是最後防線。
香港企業的實際處境與應對 香港不少中小企的伺服器、NAS 或錄影主機放在自置的小型機房或辦公室角落,環境通風與供電條件有限,硬碟長期在高溫下運作會加速老化,令重建期間二次故障的機率上升。市電偶爾跳動、冷氣於假期關閉等因素,都會在硬碟最脆弱的重建階段添上額外風險。此外,本地公司常把備份與陣列放在同一台機器,一旦陣列失效便同時失去備份,這是規劃上最常見的死角。
因此實際應對應包括:機房保持適當溫度與通風,為陣列配置 UPS 確保重建期間不會因電力中斷而中止;平日以磁碟健康狀態監察(S.M.A.R.T. 屬性、溫度和重新分配扇區數目)及早發現隱性問題;備妥同容量或更大的替換硬碟,避免故障後才四出採購;並把「重建完成」設為機房管理的檢查點,而非故障後置之不理。
更進取的做法是主動「演練重建」:在維護時段更換指定硬碟並執行一次完整的重建與資料驗證,確認流程與備份在真實故障前已經可用。對依賴檔案伺服器或錄影資料的公司,這項演練的成本遠低於一次未經演練的真實災難。
重建期間的管理重點 當陣列進入重建狀態,管理員可按以下清單逐項跟進,確保過程順利並保留完整記錄。
確認替換碟規格 ——新硬碟容量須等於或大於原故障碟,建議使用同型號或同世代企業級硬碟,避免不同轉速與緩衝容量混用。記錄啟動時間 ——記下重建開始時間與預期完成時間,作為進度監察與後續審計的基準。監察陣列狀態 ——定期查看重建進度百分比、硬碟溫度與 S.M.A.R.T. 屬性,尤其注意其餘硬碟有否出現重新分配扇區。控制高峰期負載 ——如屬辦公系統,可考慮把重資料操作(大量備份、索引重建)順延,讓重建優先完成。避免不必要的關機 ——除非必要,不要在重建期間重啟或關閉伺服器;如系統支援,優先使用熱交換替換。完成後驗證 ——重建完成後執行陣列完整性檢查,並從陣列讀取關鍵檔案核對內容,確認資料正確才恢復日常操作。更新備份 ——重建完成後執行一次完整備份,確保備份包含最新資料,並核對備份可還原。
完成以上步驟後,陣列回復完整冗餘狀態,但這次事件應成為改善的契機:檢視備份是否仍然有效、替換硬碟存量是否足夠,以及是否需要把 RAID 5 升級至 RAID 6 或調整備份策略,減少下次故障的影響。