RAID重建需要多長時間及有何風險?

RAID 陣列中的硬碟故障後,系統會自動進入重建程序,把剩餘硬碟中的資料重新計算並寫入替換碟。重建並非可以即時完成的背景操作,其時間以小時以至天數計算,期間整列處於降級狀態,任何額外故障都可能造成資料損失。本文說明重建時間的計算方法、主要風險與應對策略。

WhatsApp 說明情況 即日或翌日上門 · 09:00-23:59

RAID 重建在做甚麼

RAID(Redundant Array of Independent Disks,獨立磁碟冗餘陣列)透過把資料分散寫入多顆硬碟並加入冗餘資訊,讓陣列在單顆硬碟故障時仍然可供存取。重建(Rebuild)正是運用這套冗餘機制:替換故障硬碟後,控制器或軟體從其餘硬碟讀取資料與同位檢查資訊,重新計算出故障硬碟上的完整內容,寫入新硬碟,直至陣列回復完整狀態。

全程線上進行

多數企業級 RAID 支援熱交換替換,重建期間陣列繼續提供讀寫服務,使用者不會察覺停機,但整體效能會顯著下降。

讀取壓力極大

重建需要讀取陣列中每一顆剩餘硬碟的全部容量,是長時間、全速率的密集讀取操作,會令其餘硬碟承受比平日高得多的負載與溫度。

以容量為基準

重建的工作量取決於硬碟容量,與已使用的資料量無關。一顆 18TB 硬碟即使只寫入了 1TB 資料,重建仍須掃描全碟 18TB 容量。

理解這三點,就能明白為甚麼重建時間以小時甚至天數計算,以及為甚麼業界一直強調重建期間「陣列未完成前都不算安全」。

重建時間如何計算

重建時間沒有固定數值,主要由三個因素決定:硬碟容量、讀寫速率與系統負載。粗略估算公式是:

因素影響方式實務例子
硬碟容量重建須掃描全碟容量,容量越大時間越長8TB 硬碟比 4TB 多一倍掃描量
硬碟讀寫速率消費級硬碟持續讀取約 150–250MB/s,企業級或近線級相近8TB 於約 200MB/s 下理論需 11 小時以上
系統同時負載線上重建與日常讀寫共用控制器與磁碟頻寬,負載越高重建越慢辦公時間使用高峰可令重建時間延長一倍
控制器與介面舊款控制器或磁碟重組中的陣列會拖慢整列速度介面或通道受限時無法跑滿硬碟速率

以實例計算:一顆 8TB 硬碟容量約為 8,000 億位元組,假設持續讀取速率為 200MB/s,理論最短時間約為 800,000,000,000 ÷ 200,000,000 = 4,000 秒,約 11 小時。這只是「理論下界」:實際重建因線上讀寫爭用、巡讀(媒體掃描)與其他負載並行,往往需時 24 小時以至數天。RAID 5 與 RAID 6 的重建計算亦不盡相同,RAID 6 需讀取並驗算兩套同位資料,整體時間通常更長。

因此規劃 RAID 陣列時,不能假設「換碟後幾小時內完成」。應把重建時間與系統的可用性要求一併考慮,並在故障發生前便備妥替換硬碟。

需要協助?重建期間的監察與重建後的驗證涉及硬件與備份核對,交由工程人員處理可避免二次故障造成資料損失。提供陣列型號與硬碟容量即可。WhatsApp

不同 RAID 等級的重建特性

不同 RAID 等級的重建方式、讀取範圍與風險不同,選型時應了解各自的特性。

RAID 等級容錯能力重建特性
RAID 1可容忍一顆故障把餘下鏡像硬碟的資料整碟複製至替換碟,讀取壓力集中在剩餘一顆硬碟
RAID 5可容忍一顆故障需讀取其餘全部硬碟並以 XOR 運算重算同位資料,每顆硬碟都在重建中參與讀取
RAID 6可容忍兩顆故障讀取範圍與運算量最大,重建時間最長,但容許重建期間再故障一顆而不失資料
RAID 10每組鏡像可容忍一顆以鏡像組為單位複製,重建速度較快,但只能容忍每組內一顆故障

選型的取捨在於容錯數與重建代價:RAID 5 空間效率高但重建時間長;RAID 6 以兩套同位換取重建期間多一層保障,適合大容量硬碟與不可中斷的服務;RAID 10 重建快但可用容量只有一半。沒有「最好」的等級,只有「最適合當前風險承受能力」的選擇。

重建期間的資料風險

重建最大的風險並非重建本身,而是重建期間發生的二次故障。陣列在降級狀態下只剩下一層冗餘,若在重建完成前再有另一顆硬碟故障,對 RAID 5 而言即代表陣列失效,資料需要從備份還原。

不可修復讀取錯誤(URE)

硬碟在讀取過程中如遇到無法以 ECC 修正的區塊,會回報不可修復讀取錯誤。硬碟廠商以不可修復位元錯誤率(UBER)標示,企業級硬碟典型為每 10 的 15 次方位元讀取出現一個錯誤。大容量硬碟重建須讀取全碟,遇見 URE 的機會相應提高,而重建中的 URE 對 RAID 5 是致命問題。

第二顆硬碟故障

故障硬碟周邊的硬碟往往曾承受相近的溫度、震動與工作量,重建成為全陣列最密集的讀取操作,可能令本身已老化的硬碟在此時出現故障,即所謂的「重建期間崩盤」。

快照與備份失效

若陣列長期處於健康狀態而備份排程未有驗證,重建失敗時才發現備份不可用,損失便無法挽回。資料安全性最終取決於備份,而非 RAID 本身。

對策方面:採用 RAID 6 可在一次故障後仍有餘裕;選用企業級硬碟可降低 URE 機率;定期執行陣列完整性檢查可及早發現隱性壞區;最重要是維持「3-2-1 備份」原則,即至少三份資料、兩種儲存媒體、一份異地備份,讓 RAID 故障永遠不是最後防線。

香港企業的實際處境與應對

香港不少中小企的伺服器、NAS 或錄影主機放在自置的小型機房或辦公室角落,環境通風與供電條件有限,硬碟長期在高溫下運作會加速老化,令重建期間二次故障的機率上升。市電偶爾跳動、冷氣於假期關閉等因素,都會在硬碟最脆弱的重建階段添上額外風險。此外,本地公司常把備份與陣列放在同一台機器,一旦陣列失效便同時失去備份,這是規劃上最常見的死角。

因此實際應對應包括:機房保持適當溫度與通風,為陣列配置 UPS 確保重建期間不會因電力中斷而中止;平日以磁碟健康狀態監察(S.M.A.R.T. 屬性、溫度和重新分配扇區數目)及早發現隱性問題;備妥同容量或更大的替換硬碟,避免故障後才四出採購;並把「重建完成」設為機房管理的檢查點,而非故障後置之不理。

更進取的做法是主動「演練重建」:在維護時段更換指定硬碟並執行一次完整的重建與資料驗證,確認流程與備份在真實故障前已經可用。對依賴檔案伺服器或錄影資料的公司,這項演練的成本遠低於一次未經演練的真實災難。

重建期間的管理重點

當陣列進入重建狀態,管理員可按以下清單逐項跟進,確保過程順利並保留完整記錄。

  1. 確認替換碟規格——新硬碟容量須等於或大於原故障碟,建議使用同型號或同世代企業級硬碟,避免不同轉速與緩衝容量混用。
  2. 記錄啟動時間——記下重建開始時間與預期完成時間,作為進度監察與後續審計的基準。
  3. 監察陣列狀態——定期查看重建進度百分比、硬碟溫度與 S.M.A.R.T. 屬性,尤其注意其餘硬碟有否出現重新分配扇區。
  4. 控制高峰期負載——如屬辦公系統,可考慮把重資料操作(大量備份、索引重建)順延,讓重建優先完成。
  5. 避免不必要的關機——除非必要,不要在重建期間重啟或關閉伺服器;如系統支援,優先使用熱交換替換。
  6. 完成後驗證——重建完成後執行陣列完整性檢查,並從陣列讀取關鍵檔案核對內容,確認資料正確才恢復日常操作。
  7. 更新備份——重建完成後執行一次完整備份,確保備份包含最新資料,並核對備份可還原。

完成以上步驟後,陣列回復完整冗餘狀態,但這次事件應成為改善的契機:檢視備份是否仍然有效、替換硬碟存量是否足夠,以及是否需要把 RAID 5 升級至 RAID 6 或調整備份策略,減少下次故障的影響。

常見問題

RAID 重建一般需要多長時間?
沒有固定答案,視乎硬碟容量、讀寫速率與系統負載。以一顆 8TB 硬碟、持續讀取約 200MB/s 計算,理論最快約 11 小時,但實際因線上讀寫爭用與巡讀並行,往往需時 24 小時以至數天。容量越大、負載越高,時間越長。
重建期間系統可以使用嗎?
多數企業級 RAID 支援線上重建,陣列在重建期間繼續提供讀寫服務,使用者不會察覺停機,但整體效能會下降。小型或入門級裝置則可能不支援熱交換,需先關機更換硬碟。應查閱裝置說明確認是否支援熱插拔與線上重建。
重建期間再有一顆硬碟故障會怎樣?
對 RAID 5 而言,重建期間第二顆硬碟故障代表陣列失效,資料無法再以冗餘機制回復,只能從備份還原。因此 RAID 6 容許重建期間再故障一顆而不失資料,適合大容量硬碟或不可中斷的服務;無論何種等級,可靠的備份都是最後防線。
為甚麼重建要掃描整顆硬碟,而不是只掃已使用的部分?
RAID 的冗餘資訊按整個陣列容量分布,重建必須讀取剩餘硬碟的全部區塊才能重算故障硬碟的內容。即使資料只佔用一小部分,硬碟容量就是重建的工作量,這正是大容量硬碟重建時間特別長的原因。
RAID 6 是否比 RAID 5 安全?
就容錯能力而言是:RAID 6 可容忍兩顆硬碟同時故障,或重建期間再故障一顆而不失資料,而 RAID 5 只能容忍一顆。代價是需額外一顆硬碟的容量存放第二套同位資料,寫入效能與重建時間亦較長。是否採用取決於資料價值與風險承受能力。
重建前後應該檢查甚麼?
重建前:確認替換碟容量與規格、記錄陣列現況、核對備份可還原。重建期間:監察進度、硬碟溫度與 S.M.A.R.T. 屬性。重建後:執行陣列完整性檢查、讀取關鍵檔案核對內容,並執行一次完整備份。
如何縮短重建時間?
可以從三方面着手:使用讀寫較快的企業級硬碟與適當介面;在低負載時段進行重建;確保機房散熱正常,因為過熱會令硬碟自動降速。無法縮短的,是以容量計算的基礎工作量,因此選型時應把重建時間納入可用性規劃。
重建完成是否代表資料一定安全?
不是。重建完成代表陣列回復冗餘狀態,但過程中讀取的任何錯誤、替換碟本身有隱性問題,或備份在故障前已失效,都會令資料完整性存疑。完成後應執行完整性檢查與關鍵檔案驗證,並維持 3-2-1 備份原則,RAID 只是冗餘手段,不是備份。

RAID 陣列故障或需要重建?

我們可協助確認故障硬碟與替換規格、監察重建進度與硬碟健康狀態、執行重建後完整性驗證,並檢視備份策略是否足以應付下一次故障,適用於香港企業的伺服器、NAS 及錄影主機,歡迎聯絡工程師查詢。

WhatsApp 說明情況

權威參考來源

相關技術主題

若閣下正計劃相關工程或需要選購設備,歡迎瀏覽網絡工程服務了解方案詳情,或透過網上快速報價與我們的工程師聯絡。

產品規格以原廠最新文件為準;有需要請聯絡我們工程師。