Alle Blogs

Ein speicherzentrierter Ansatz für die Systemstrategie: 6 Erkenntnisse von der Supercomputing 2025

David A. Chapa David A. Chapa
AI Strategist, Hitachi Vantara

6. Februar 2026


Workloads im Bereich der künstlichen Intelligenz verändern grundlegend, wie Speicher produziert, bepreist und priorisiert wird. Nicht, weil die Lieferkette grundlegend zusammengebrochen wäre, sondern weil Hersteller bewusste Entscheidungen darüber treffen, wo Kapazitäten und Kapital eingesetzt werden. Wafer-Linien werden auf margenstarke, langfristige KI-Nachfrage ausgerichtet und nicht auf eine breite, undifferenzierte Expansion.

HBM, fortschrittlicher DRAM und anderer KI-optimierter Speicher nehmen mittlerweile den Großteil der Investitionen und der zukunftsgerichteten Planung ein. Ältere NAND- und Commodity-DRAM-Fabs werden hingegen – wenn überhaupt – nur sehr vorsichtig erweitert. Was der Markt an Preisvolatilität und Allokationsdruck erlebt, ist kein klassischer Produktionsengpass, sondern ein struktureller Wandel in der Wirtschaftlichkeit von Speichersystemen.

Vor diesem Hintergrund werden KI-Systeme zunehmend durch Speicherbandbreite und Datenflusseffizienz definiert. Je mehr Arbeit über GPUs und Beschleuniger abgewickelt wird, desto größer wird der Druck, der nicht bei der HBM-Kapazität endet. Er erstreckt sich über den gesamten Datenpfad, einschließlich der Bereitstellung von Daten, der Verwaltung von Metadaten, deren Abruf und deren Steuerung im großen Maßstab. Dies wiederum erhöht die Nachfrage nach Objektspeichern, metadatenreichen Dateisystemen, Versionsverwaltung und Governance.

Indem GPUs voll ausgelastet und der Datenpfad effizient gehalten werden, können moderne KI-Systeme deutlich mehr produktive Arbeit aus derselben zugrunde liegenden Infrastruktur herausholen, doch diese Effizienz geht mit Kompromissen einher. In Anbetracht der Höhe der in GPUs getätigten Investitionen wird der Return on Insight zum einzig wirklich wichtigen Maßstab. Produktivere GPUs erzeugen mehr Ergebnisse, mehr Zwischenartefakte, häufigere Checkpoints und mehr abgeleitete Daten, die alle im Laufe der Zeit gespeichert, nachverfolgt, versioniert und verwaltet werden müssen. In diesem Sinne schmälert ein speicherzentriertes Design die Rolle des Speichers keineswegs. Es stärkt sie vielmehr, indem es sowohl das Volumen als auch die Bedeutung der erzeugten Daten erhöht. Speicher, Verbindungsstrukturen und Datenfluss sind zu den entscheidenden Faktoren für die Systemleistung geworden – eine wesentliche Veränderung gegenüber den Prioritäten früherer Branchenveranstaltungen.

Die Branche denkt neu, wie sich HPC- und KI-Infrastrukturen in der Praxis voneinander unterscheiden und wie sie jeweils aufgebaut sein sollten. Dabei liegt der Fokus weniger auf dem Spitzendurchsatz als vielmehr darauf, wie Daten durchgängig zu den Beschleunigern fließen: Die Supercomputing 2025 hat diesen Wandel deutlich verdeutlicht. Speicher, Interconnects und Datenfluss sind zu den entscheidenden Faktoren für die Systemleistung geworden – ein bedeutender Wandel gegenüber den Prioritäten vergangener Branchenveranstaltungen.

Hier sind die wichtigsten Durchbrüche der Supercomputing 2025:

1. Die Konvergenz von HPC und KI wird zur operativen Realität

Rechenzentren für Höchstleistungsrechnen (HPC) betrachten wissenschaftliche Simulationen sowie das Training oder die Inferenz von KI nicht länger als getrennte Welten. Was auf der Supercomputing 2025 auffiel, war, wie viele Unternehmen inzwischen Umgebungen planen, in denen beide Bereiche nebeneinander auf einer gemeinsam genutzten Infrastruktur betrieben werden müssen. Dieser Wandel bringt neue Anforderungen mit sich, darunter eine vorhersehbare Speicherbandbreite, leistungsfähigere Interconnect-Architekturen, Container-Bereitschaft und einen einheitlichen Datenzugriff über verschiedene Workloads hinweg.

Infolgedessen verlieren maximale FLOPS und klassische Dateisystem-Benchmarks ihre Rolle als primäre Indikatoren für den Systemwert. Sie sind zwar nach wie vor wichtig, erklären aber nicht mehr, ob ein System für KI gute Leistungen erbringt. Viel wichtiger ist, ob die Infrastruktur in der Lage ist, GPUs konstant und ohne Unterbrechungen oder Leerläufe produktiv zu halten. Und das ist einer der größten Unterschiede zwischen diesen beiden Workloads.

Wichtigste Erkenntnis: Anbieter sind zunehmend in der Lage, sich an Gesprächen über KI-Infrastrukturen zu beteiligen, ohne ausschließlich an herkömmlichen HPC-Durchsatz- oder E/A-Benchmarks gemessen zu werden, solange sie eine kontinuierliche GPU-Auslastung und ein vorhersehbares Systemverhalten nachweisen können.

2. Speicherzentrierte Architektur hat sich als zentrales Branchenthema herauskristallisiert

Sowohl in der Ausstellungshalle als auch in technischen Sitzungen und informellen Gesprächen wurde Speicher durchweg als der primäre Engpass und zugleich als der primäre Beschleuniger für KI-Workloads genannt. Der Fokus lag dabei nicht nur auf der Kapazität, sondern darauf, wie sich Speicherbandbreite, Latenz, Speicherplatzierung und Speicherverwaltung auf das gesamte System auswirken.

HBM4, DRAM der nächsten Generation und erste Demos von CXL-verbundenen Speicherpools wurden als fundamentale Elemente zukünftiger Systemdesigns positioniert. Anbieter verbrachten deutlich mehr Zeit damit, über Tail-Latenzen, Speicherbandbreite und durchgängige Datenflüsse zu sprechen als über reine Komponentengeschwindigkeiten. Diese Betonung unterstreicht die Notwendigkeit, Speicher, Interconnects und Datenverschiebung als grundlegende Architekturfaktoren und nicht als nachgelagerte Tuning-Maßnahmen zu behandeln.

Wichtigste Erkenntnis: KI-Infrastrukturen müssen anhand der Workload-Eigenschaften von KI-Training und -Inferenz bewertet werden, nicht anhand von Durchschnittsmetriken, die für vorhersehbarere, stapelorientierte Umgebungen entwickelt wurden.

3. Speicheranbieter definieren ihre Rolle als Infrastruktur neu

Ein weiterer auffälliger Wandel auf der Supercomputing 2025 war die Sprache, die Speicheranbieter verwendeten, um ihre Rolle in KI-Umgebungen zu beschreiben. Anstatt sich als Leistungsmaschinen für das KI-Training zu positionieren, beschrieben sich viele als das „Sanitärnetz“ (die Infrastruktur), das Daten in die KI-Pipeline hinein, durch sie hindurch und um sie herum transportiert.

Dies spiegelt die wachsende Erkenntnis wider, dass Dateisysteme allein während des Trainings nicht über die GPU-Leistung entscheiden. Ihr Einfluss ist indirekt und wird dadurch geprägt, wie effizient Daten bereitgestellt, gefunden und aufbereitet werden, bevor sie überhaupt die Beschleuniger erreichen.

Wichtigste Erkenntnis:  Speicherplattformen, die sich bei der Metadatenverarbeitung, bei Abruf-Workloads und der vorgelagerten Datenaufbereitung auszeichnen, bleiben äußerst relevant, auch wenn sie nicht mehr als die Quelle der reinen Trainingsleistung dargestellt werden.

4. Rack-Scale- und High-Density-Designs werden zum Standard

Systemanbieter sind weitgehend davon abgerückt, über einzelne Server zu sprechen, und konzentrieren sich stattdessen auf Lösungen auf Rack-Ebene. Diese Designs sind darauf ausgelegt, sowohl HPC- als auch KI-Workloads zu unterstützen, mit hohen GPU-Dichten, großen HBM-Footprints, fortschrittlichen Kühlungsansätzen und sorgfältig optimierten Interconnect-Topologien.

Viele Ankündigungen konzentrierten sich auf Bausteine mit acht GPUs, die als Teil einer größeren modularen Rack-Architektur geliefert werden. Dieser Ansatz spiegelt einen Trend hin zu einem integrierten Systemdesign wider, bei dem Stromversorgung, Kühlung, Netzwerke und Management gemeinsam geplant und nicht unabhängig voneinander optimiert werden.

Wichtigste Erkenntnis: Systemweite Lösungen (wie Hitachi iQ) werden gegenüber der Montage auf Komponentenebene zunehmend bevorzugt, um der Komplexität moderner KI-Infrastrukturen Herr zu werden.

5. Datenladen, Abrufeffizienz und Metadaten sind vorrangige Einschränkungen

Mit der Skalierung von KI-Clustern verlagern sich die Leistungsengpässe von der reinen Rechenleistung hin zur unterstützenden Datenpipeline. Die Gespräche mit sowohl Anbietern als auch Endbenutzern unterstrichen die Bedeutung eines effizienten Ladens von Daten, der Vermeidung von GPU-Hunger (Starvation), der Verwaltung großer Metadatenkataloge und der Unterstützung häufiger Checkpoints, ohne den Trainingsfortschritt zu stören.

Wenn hochfrequente Checkpoints zu einer Designanforderung werden, verweist dies ganz natürlich auf speicherzentrierte Ansätze. Die Checkpoint-Leistung wird dadurch bestimmt, wie schnell Daten bereitgestellt, gepuffert und übertragen werden können, ohne die Trainingsschleife zu blockieren. RAG-Workflows, agentenbasierte Systeme und multimodale Anwendungen üben zusätzlichen Druck aus, da sie die Metadatenintensität und die Anfälligkeit für Tail-Latenzen erhöhen.

Wichtigste Erkenntnis: Für abrufintensive und inferenzgesteuerte KI-Workloads wird die Tail-Latenz immer wichtiger als der Spitzendurchsatz.

6. Ein Wandel vom Komponenten- zum Pipeline-Denken

Das vielleicht wichtigste Signal der Supercomputing 2025 war ein umfassenderer Wandel in der Art und Weise, wie die Branche über KI-Infrastruktur als Ganzes denkt. Anstatt Rechenleistung, Speicher, Netzwerke und Datenmanagement als getrennte Domänen zu betrachten, planen Unternehmen vollständige Pipelines, in denen Daten vorhersehbar von der Aufnahme über das Training bis hin zur Inferenz fließen müssen. Dieser Wandel begünstigt integrierte Architekturen, die sowohl Trainings- als auch Abrufpfade unterstützen können – wie Hitachi iQ in Kombination mit VSP One –, anstatt lose zusammengestellter Stacks einzelner Komponenten.

Der Wert dieser Systeme liegt in der durchgängigen Orchestrierung, dem einheitlichen Datenzugriff und dem konsistenten Verhalten bei der Skalierung von Umgebungen. Dies spiegelt das wachsende Verständnis wider, dass die Optimierung des Datenpfads ebenso wichtig ist wie die Optimierung des Rechenpfads und dass ein vorhersehbarer Datenfluss eine Grundvoraussetzung für die Aufrechterhaltung der GPU-Auslastung im großen Maßstab ist.

Wichtigste Erkenntnis: Die Annahme einer speicherzentrierten Designphilosophie trägt dazu bei, dass Daten so bereitgestellt, transformiert, ausgeliefert und abgerufen werden, dass Stillstände vermieden und die Pipeline in Bewegung gehalten wird.

Ein speicherzentrierter Ansatz mit Hitachi iQ

Die Branche beginnt, sich über die wahren Ursachen für GPU-Stillstände einig zu werden. Es liegt nicht einfach an einem Mangel an Rechenleistung, sondern an langsamem Laden der Daten, unvorhersehbaren Latenzen und praktischen Grenzen bei der Bereitstellung und dem Zugriff auf Speicher. Aus diesem Grund entstehen neue Ansätze, darunter Architekturen wie WEKAs Augmented Memory Grid, und deshalb gewinnt eine speicherzentrierte Strategie zunehmend an Relevanz.

Die Skalierung der Speicherkapazität durch den kontinuierlichen Kauf weiterer GPUs ist langfristig nicht nachhaltig. HBM ist teuer, die Kapazität ist begrenzt und die Wirtschaftlichkeit spricht dagegen, das Speicherwachstum direkt an das Rechenwachstum zu koppeln. An dieser Stelle werden Technologien wie CXL und andere Methoden zur Erweiterung oder Bündelung von Speicher unabhängig von der Rechenleistung wichtig. Die Bedeutung von CXL auf der Supercomputing 2025 hat unterstrichen, dass die Branche diese Wege aktiv erforscht.

Die Architektur von Hitachi Vantara spiegelt diesen umfassenderen Wandel wider. Hitachi iQ wurde entwickelt, um leistungsstarke Trainingspfade und Datenbeschleunigung zu unterstützen, während VSP One und Hammerspace die Abruf-, Vorbereitungs- und Orchestrierungspfade abdecken, die für RAG-Pipelines, agentenbasierte Systeme und multimodale KI erforderlich sind. Zusammen bilden sie einen einheitlichen Systemansatz, der zu der Art und Weise passt, wie moderne KI-Pipelines tatsächlich gebaut und betrieben werden.

Bereit für mehr? Erfahren Sie, warum Hitachi iQ als führend im Bereich für KI-Workloads optimierter Speicher ausgezeichnet wurde.


David A. Chapa

David A. Chapa

David A. Chapa serves as Chief AI Strategist at Hitachi Vantara. He works at the intersection of AI systems, enterprise infrastructure, and long-horizon risk, focusing on how early architectural decisions shape financial exposure, operational resilience, and strategic flexibility over time. His perspective emphasizes memory-centric systems design, data locality, and sovereign AI environments that help organizations transition from pilot-stage experimentation into durable production capability.