所有部落格

例外管理,而非疲於奔命

Nick Loy and Sushant Sawant
Nick Loy, Intelligent Automation Practice Principal, and Sushant Sawant, Product Manager for VSP 360 Analytics

2026 年 8 月 12 日


詢問任何儲存團隊過去五年有什麼變化,您會聽到大同小異的答案:一切都在同時成長並變得更加複雜。更多應用程式、更多資料、更多平台,更多問題可能隱藏的地方。複雜度已經超出負責管理團隊所能負荷的範圍。

人力配置的失衡更讓情況雪上加霜。目前有高達三分之二的資料中心營運商,正面臨難以聘僱,或留住合格員工的困境。單一規模縮減、負擔過重、往往經驗不足的團隊,指派去管理更大、更複雜的資料資產,同時還必須面對層出不窮的管理工具和警報訊息,這無疑讓值班人員背負沉重的壓力。

這就是為什麼 [異常偵測] 已從 [加分項目] 轉變為 [核心標配]。高達 80% 的營運團隊表示,他們最近一次的停機事件其實完全可以避免,只要透過更完善的流程或管理就能提前察覺。因此,您的資料儲存空間平台能發揮的最大價值,並非單純指出哪裡出錯,精準告訴您哪些雜訊,可以忽略。

這聽起來很反直覺,請容我解釋。任何監控工具都能在數值超標時發出警告、標示問題。然而,多年來面對數百個儀表板和數千個指標,卻幾乎沒有一項是真正緊急的,這早已讓營運團隊因「告警疲勞」而精疲力竭。在這排山倒海的警告中,往往隱藏著那個真正致命的問題。在暗中惡化數小時,最終演變成一場始料未及的 Sev-1 重大事件,這並非因為缺乏資料,只因根本沒有人有時間去發現。

因此,核心問題從來都不在於偵測,而是辨識能力。下一步並非捕捉更多異常,而是要釐清哪些告警可以暫且擱置。唯有如此,您才能真正落實例外管理,擺脫疲於奔命的困境。

智慧儲存空間的真正核心

智慧儲存空間絕非只是個智慧型警告器。這是一種能理解自身常態的平台,能針對執行每個工作負載學習基準行為,只會呈現真正偏離常態的項目。舊模式監控一切,並在數值超過預設門檻時,做出反應這需要隨人力增加,才能擴展規模,這正是無法有效擴展的原因。最新模式則會自我學習何謂常態,只有在實際狀況偏離常態時,才會發出警告。這樣的差異,徹底改變大家晨間的工作型態。

從 112 到 12

想像一下儲存空間管理員開始他們的每一天,咖啡還冒著熱氣,每天第一工作都一樣,找出真正需要關注的問題。在舊世界中,這必須逐一開啟橫跨 112 款應用程式的儀表板,希望能趕在終端使用者察覺之前,抓出那個即將出狀況的應用程式。

今天早上感覺不同,因為他們剛安裝具備 AIOps 異常偵測功能的 VSP 360。當他們開啟異常偵測檢視時,VSP 360 管理平台已經完成分類:在監控的 112 個應用程式中,偵測到 12 個異常並自動呈現。無需手動審查,也無需調整門檻值。VSP 360 在一夜之間學習每個工作負載的常態,只會標記出偏離常態的項目。

12 而非 112 這組數字表面上看似簡單,卻具有重大意義。這表示大腦需要處理的複雜度大幅降低、在出現問題時,能更快評估根本原因,能為團隊省下數小時的手動分析時間。對系統管理員而言,這代表能減少徒勞無功的死胡同調查,對沒有遺漏重要事項也更有信心,對企業而言,風險能更早被發現,平均修復時間 (MTTR) 隨之下降,團隊也不再因為只維持現狀而精疲力竭。

揪出吵鬧鄰居

當系統管理員點選嚴重度最高異常時,VSP 360 平台會將該應用程式的行為、底層儲存空間資源,包括磁碟區、連接埠、處理器和快取記憶體,可以建立相互關聯,完整呈現在同一共用時間軸上。

想像一下 IT 環境中常見的場景:Oracle 生產資料庫的使用者回報尖峰時段交易變慢,但首先檢查的處理器、連接埠等指標讀數卻都顯示正常,完全看不出問題痕跡。然而,VSP 360 異常偵測儀表板卻揭露隱藏在底層的真相:

偵測到嚴重異常:Oracle 生產資料庫

  • 延遲較正常基準增加 70%
  • 受影響資源:前端連接埠 CL1-A
  • 事發時間:15 分鐘前

看!完整的診斷結果,就在這短短四行裡。

任何負責營運共用資料基礎架構的人,對這種狀況一定都不陌生:吵鬧鄰居亦即其他工作負載佔滿快取記憶體和處理器的空間,導致周遭每款應用程式都得為此付出代價。在 VSP 360 異常偵測問世之前,為了證明這點,往往需要花上一整個下午調閱儀表板,在試算表中對齊時間戳記。只需單一畫面、一條時間軸,管理員在咖啡變涼之前,就能得到答案。

由於診斷結果已轉化為清晰、可共用的證據,過往常見的跨團隊摩擦也隨之消失。當應用程式團隊詢問服務為何變慢時,根本原因早已釐清,對話得以直接進入修復階段,不會卡在爭論這是誰的問題上。

這是個問題,還是只是週一常態?

在管理員結案之前,他們會再問問題:這究竟是新出現的異常,還是某種規律模式?一週歷史資料,就能給出解答。

變慢時間點、夜間備份排程完全吻合。這從來都不是謎團,只是過去沒人將其和異常症狀連結的批次作業。資料型態會告訴您該採取哪種解決方案:每週一出現的尖峰是批次作業,那就重新調整排程,持續上升的趨勢是工作負載成長,那就規劃擴充,伴隨快取記憶體尖峰的單一事件則是設定錯誤,那就直接修正。同樣的異常檢視,能得出三種不同結論,讓證據直接指向正確答案,無需任何猜測。

這就是關鍵的轉變:從過去盲目對告警做出反應,提升至做出有憑有據的決策。值得注意的是,診斷結果本身就具備充分的解釋力,您完全不需要盲目信任黑箱;您可以清楚看到平台標記該項目的原因,其背後代表的含意。

值得您信賴的異常智慧分析

在我們身處的市場中,幾乎所有事物都被貼上 AI 支援的標籤,許多營運團隊對此感到疲乏也是理所當然。異常偵測的目標從來都不是成為簡報中最炫目的技術,而是成為單一值得信賴、可據以行動的解決方案:包含能夠展示運作過程的偵測功能、能讓您親眼驗證的關聯性,而是由證據而非直覺支援的團隊決策。當團隊必須為採取的行動負責時,可解釋性永遠勝過外表酷炫。

雖然業界已讓客戶習慣將智慧功能視為額外收費項目(例如:進階分析層級、訂閱升級、獨立的附加 SKU),但企業在接受這種常態之前應三思。關於您自身儲存空間執行狀況的洞察力,不應被二次銷售。應該隨平台直接附帶,只因這正是確保平台妥善運作的核心意義所在。


單一功能,更宏大的願景

異常偵測並非故事的全部。這是更廣泛理念的初步體現:VSP 360,或任何資料儲存空間解決方案,應將智慧化基礎架構營運,可納為內建的預設功能,而非單一需要您另外配置人力、資金的專案。

隨著企業在異常偵測方面的運用日趨成熟,營運重點將從識別單一偏差轉向建構基於模式的營運智慧。最終,這些功能將為進階 AIOps 奠定基石,包括事件關聯、預測性洞察力,還有能加速解決問題,提升營運韌性的精準引導行動。

VSP 360 異常偵測是整體 IT 可觀測性策略中的核心功能。該策略涵蓋從應用程式工作負載、伺服器、網路到共用儲存空間資源的完整 IT 基礎架構堆疊。透過快速識別儲存空間效能異常,企業能獲得具體可行的智慧分析,實現自動化儲存空間營運,提高整體能見度,全面強化端到端的基礎架構監控。

有了異常偵測,貴組織的未來將更加清晰:不僅能簡化儲存空間複雜性,讓系統管理員更高效地管理龐大資產,更能透過在問題演變成停機事故前提前攔截,大幅降低企業風險。

深入了解 VSP 360 AIOps,這是一套能提供營運智慧、異常偵測、預測分析,以改善您資料營運解決方案。


Nick Loy

Nick Loy

Nick Loy joined Hitachi Vantara in 2021. He currently manages go-to-market strategy for the Intelligent Automation practice, concentrating on hyperautomation, business process and IT automation. Nick is a frequent speaker at conferences and events on topics including AI, hybrid cloud and business process automation.


Sushant Sawant

Sushant Sawant

Sushant Sawant is the Product Manager for VSP 360 Analytics.