Fragen Sie ein beliebiges Storage-Team, was sich in den letzten fünf Jahren geändert hat, und Sie erhalten fast immer dieselbe Antwort: Alles ist gewachsen und gleichzeitig komplexer geworden. Mehr Anwendungen, mehr Daten, mehr Plattformen, mehr Orte, an denen sich Probleme verstecken können. Die Komplexität ist schneller gewachsen als die Teams, die sie verwalten sollen.
Die Personalsituation verschärft das Problem noch. Zwei Drittel aller Rechenzentrumsbetreiber haben mittlerweile Schwierigkeiten, qualifiziertes Personal zu finden oder zu halten. Ein kleineres, überlastetes und oft weniger erfahrenes Team soll eine größere, komplexere Datenlandschaft betreuen – mit zu vielen Tools, zu vielen Warnmeldungen und zu viel Verantwortung auf den Schultern des jeweiligen Bereitschaftsdienstes.
Aus diesem Grund hat sich die Anomalieerkennung von einem netten Zusatzfeature zu einer Notwendigkeit entwickelt. 80 % der Betriebsteams geben an, dass ihr letzter Ausfall hätte vermieden werden können und dass bessere Prozesse oder ein besseres Management ihn verhindert hätten. Das Nützlichste, was Ihre Datenspeicherplattform tun kann, ist daher nicht, Ihnen zu zeigen, was schiefgelaufen ist. Das Nützlichste, was sie tun kann, ist Ihnen zu sagen, was Sie ignorieren können.
Das klingt im ersten Moment paradox, aber lassen Sie mich das erklären. Jedes Überwachungstool kann ein Problem melden, indem es einen Alarm auslöst, sobald ein Schwellenwert überschritten wird. Doch jahrelange Erfahrung mit Hunderte von Dashboards und Tausenden von Messwerten, von denen fast keiner dringlich ist, hat bei Betriebsteams zu einer extremen Alarmmüdigkeit geführt. Und irgendwo in diesem Berg an Meldungen versteckt sich genau die eine, die wirklich zählt – die sich seit Stunden unbemerkt verschlechtert und darauf wartet, zu einem unvorhergesehenen Sev-1-Vorfall zu werden. Nicht, weil die Daten nicht da gewesen wären, sondern weil kein Mensch die Zeit hatte, sie zu finden.
Das Problem war also nie die Erkennung. Es war das Unterscheidungsvermögen. Der nächste Schritt besteht nicht darin, mehr Anomalien abzufangen, sondern zu wissen, was man beiseite lässt, damit man nach dem Ausnahmeprinzip und nicht aus Erschöpfung handeln kann.
Was intelligente Speicherung tatsächlich bedeutet
Intelligenter Speicher ist kein ausgeklügelter Alarm. Er ist eine Plattform, die ihren eigenen Normalzustand versteht, das Basisverhalten jeder ausgeführten Workload erlernt und nur das anzeigt, was wirklich davon abweicht. Das alte Modell hat alles überwacht und reagiert, wenn ein Wert einen im Voraus festgelegten Schwellenwert überschritten hat; das skaliert mit der Mitarbeiterzahl, was genau das ist, was nicht skaliert. Das neue Modell lernt, was normal ist, und meldet sich nur dann zu Wort, wenn die Realität davon abweicht. Dieser Unterschied verändert, wie der Morgen eines Administrators aussieht.
Von 112 auf 12
Stellen Sie sich vor, der Speicheradministrator beginnt seinen Morgen, der Kaffee ist noch heiß, und die erste Aufgabe ist dieselbe wie jeden Tag: herauszufinden, was tatsächlich Aufmerksamkeit erfordert. In der alten Welt bedeutete das, ein Dashboard nach dem anderen für 112 Anwendungen zu öffnen, in der Hoffnung, die eine Anwendung zu erwischen, die auf Probleme zusteuert, bevor der Endbenutzer dies bemerkt.
Dieser Morgen fühlt sich anders an, weil er gerade VSP 360 mit AIOps-Anomalieerkennung installiert hat. Wenn er die Ansicht zur Anomalieerkennung öffnen, hat die VSP 360-Verwaltungsplattform die Triage bereits durchgeführt: 112 überwachte Anwendungen, 12 mit erkannten Anomalien, die automatisch angezeigt werden. Keine manuelle Überprüfung. Keine Schwellenwertanpassung. Über Nacht hat VSP 360 gelernt, wie der Normalzustand für die jeweiligen Workloads aussieht, und nur die Workloads markiert, die davon abgewichen sind.
12, nicht 112, ist eine Zahl, die man leicht übersehen kann – aber sie hat eine große Bedeutung. Sie bedeutet weniger Komplexität, die man im Kopf behalten muss, eine schnellere Ursachenanalyse bei Problemen und stundenlange manuelle Analysen, die an das Team zurückgegeben werden. Für den Administrator bedeutet das weniger Sackgassen bei Untersuchungen und mehr Vertrauen darauf, dass nichts Wichtiges durchrutscht. Für das Unternehmen bedeutet dies, dass Risiken früher erkannt werden, die mittlere Reparaturzeit (MTTR) sinkt und ein Team, das nicht ausbrennt, nur um auf der Stelle zu treten.
Den „Noisy Neighbor“ benennen
Wenn ein Administrator auf die am höchsten eingestufte Anomalie klickt, korreliert die VSP 360-Plattform das Verhalten dieser Anwendung mit den darunter liegenden Speicherressourcen, einschließlich Volumes, Ports, Prozessoren und Cache, und das alles auf einer einzigen gemeinsamen Zeitachse.
Stellen Sie sich ein häufiges Szenario in Ihrer Umgebung vor: Die Benutzer einer Oracle-Produktionsdatenbank melden langsame Transaktionen zu Spitzenzeiten, und die Messwerte, die jeder zuerst überprüft, wie Prozessor und Port, zeigen normale Werte an. Nichts Offensichtliches, worauf man zeigen könnte. Aber das Dashboard zur Anomalieerkennung von VSP 360 zeigt, was sich im Hintergrund verbirgt:
Kritische Anomalie erkannt: Oracle Production DB
- Latenz um 70 % über dem normalen Basiswert gestiegen
- Betroffene Ressource: Frontend-Port CL1-A
- Erkannt: Vor 15 Minuten
Ta-dah! Die gesamte Diagnose in vier Zeilen.
Jeder, der eine gemeinsam genutzte Dateninfrastruktur betreibt, kennt dieses Phänomen: einen „Noisy Neighbor“, einen anderen Workload, der den Cache und die Prozessorkapazität auslastet, während jede Anwendung in der Umgebung den Preis dafür zahlt. Vor der Anomalieerkennung durch VSP 360 erforderte der Nachweis einen Nachmittag lang das Abrufen von Dashboards und das Abgleichen von Zeitstempeln in einer Tabellenkalkulation. Jetzt ist es ein Bildschirm und eine Zeitachse, und der Administrator hat die Antwort, bevor der Kaffee kalt ist.
Da die Diagnose als klare, weiterleitbare Beweise erfasst wird, verflüchtigt sich die übliche Reibung zwischen den Teams. Wenn das Anwendungs-Team fragt, warum sein Dienst langsam ist, steht die Grundursache bereits fest, sodass das Gespräch direkt zur Behebung übergeht, anstatt sich darüber den Kopf zu zerbrechen, wessen Problem es ist.
Ist es ein Problem oder einfach nur ein Montag?
Bevor unser Administrator dieses Ticket schließt, stellt er noch eine Frage: Ist das neu oder ein Muster? Eine Woche Historie liefert die Antwort.
Die Verlangsamung deckt sich genau mit dem Backup-Fenster über Nacht. Es war nie ein Rätsel, sondern nur ein Batch-Job, den niemand mit den Symptomen in Verbindung gebracht hatte. Und die Form der Daten verrät Ihnen, welche Abhilfe erforderlich ist: Ein Spike an jedem Montag ist ein Batch-Job, also planen Sie ihn neu. Ein anhaltender Aufwärtstrend ist ein Workload-Wachstum, also planen Sie eine Erweiterung. Ein isoliertes Ereignis mit einem korrelierten Cache-Spike ist eine Fehlkonfiguration, also beheben Sie diese. Dieselbe Anomalieansicht, drei verschiedene Schlussfolgerungen, und die Beweise zeigen ohne Vermutungen auf die richtige.
Das ist der Wandel: von der Reaktion auf Alarme hin zu evidenzbasierten Entscheidungen. Und beachten Sie, dass die Diagnose die Erklärung ist. Sie werden nie aufgefordert, einer Blackbox zu vertrauen. Sie können genau sehen, warum die Plattform das markiert hat, was sie markiert hat, und was das bedeutet.
Anomalie-Intelligenz, auf die Sie sich verlassen können
Wir befinden uns alle auf einem Markt, der auf alles, was sich bewegt, das Etikett „KI-gestützt“ geklebt hat, und viele Betriebsteams sind zu Recht davon ermüdet. Das Ziel der Anomalieerkennung war nie die auffälligste Technologie auf einer Folie, sondern eine Lösung, der man vertrauen und nach der man handeln kann: eine Erkennung, die ihre Arbeit offenlegt, eine Korrelation, die Sie mit eigenen Augen überprüfen können, und Teamentscheidungen, die durch Beweise statt durch Instinkt gestützt werden. Wenn Ihr Team für das verantwortlich ist, wonach es handelt, schlägt Erklärbarkeit jedes Mal das Beeindruckende.
Und während die Branche Kunden darauf trainiert hat, Intelligenz als Aufpreis zu erwarten – eine Premium-Analysestufe, ein Abonnement-Upgrade, eine Add-on-SKU mit einem eigenen Posten –, sollten Unternehmen zweimal überlegen, bevor sie diesem Standard zustimmen. Einblick in das Verhalten Ihres eigenen Speichers sollte Ihnen nicht zurückverkauft werden. Er sollte Teil der Plattform sein, denn er ist ein Teil dessen, was die gute Führung der Plattform tatsächlich ausmacht.
Eine Funktion, eine größere Vision
Die Anomalieerkennung ist nicht die ganze Geschichte. Sie ist der erste Ausdruck einer umfassenderen Idee, dass VSP 360 – oder jede andere Datenspeicherlösung – intelligente Infrastrukturoperation zum Standard machen sollte, und nicht zu einem Projekt, das Sie separat mit Personal und Finanzmitteln ausstatten.
Wenn Unternehmen über die Anomalieerkennung hinauswachsen, verlagert sich der Schwerpunkt von der Identifizierung isolierter Abweichungen hin zur Generierung musterbasierter Betriebsinformationen. Letztendlich legen diese Funktionen den Grundstein für fortgeschrittene AIOps, einschließlich Ereigniskorrelation, prädiktiver Erkenntnisse und gezielter präskriptiver Maßnahmen, die die Behebung beschleunigen und die betriebliche Widerstandsfähigkeit verbessern.
Die Anomalieerkennung von VSP 360 ist eine grundlegende Funktion innerhalb einer umfassenderen IT-Observability-Strategie, die den gesamten IT-Infrastruktur-Stack umfasst, von Anwendungs-Workloads über Server und Netzwerke bis hin zu gemeinsam genutzten Speicherressourcen. Durch die schnelle Identifizierung von Speicherleistungsanomalien können Unternehmen verwertbare Erkenntnisse gewinnen, die dazu beitragen, den Speicherbetrieb zu automatisieren, die Sichtbarkeit zu verbessern und die Ende-zu-Ende-Infrastrukturüberwachung zu optimieren.
Mit der Anomalieerkennung ist die Zukunft für Ihr Unternehmen klar: Vereinfachen Sie die Komplexität des Speichers, machen Sie Administratoren bei der Verwaltung eines größeren Bestands effektiver und reduzieren Sie das Unternehmensrisiko, indem Sie Probleme abfangen, bevor sie zu Ausfällen führen.
Erfahren Sie mehr über VSP 360 AIOps, eine Lösung, die betriebliche Intelligenz, Anomalieerkennung und prädiktive Analysen liefern kann, um Ihre Datenoperationen zu verbessern.
Nick Loy
Nick Loy joined Hitachi Vantara in 2021. He currently manages go-to-market strategy for the Intelligent Automation practice, concentrating on hyperautomation, business process and IT automation. Nick is a frequent speaker at conferences and events on topics including AI, hybrid cloud and business process automation.
Sushant Sawant
Sushant Sawant is the Product Manager for VSP 360 Analytics.