Alle Blogs

Wie KI-Inferenz die Unternehmensinfrastruktur neu gestaltet

Sunitha Rao and Nick Loy
Sunitha Rao, GM of Hybrid Cloud and SDS, Hitachi Vantara Nick Loy, Intelligent Automation Practice Principal

30. Juni 2026


Rechenzentrumsteams sind geübt darin, vertraute Probleme wie Speicherausfälle, verfehlte Prognosen und verspätete Erneuerungszyklen zu lösen. Das sind bekannte Größen. Dafür gibt es bewährte Vorgehensweisen.

Aber das Jahr 2026 hat eine andere Art von Druck mit sich gebracht. Nach Jahren von KI-Investitionen in Unternehmen, die sich fast ausschließlich auf das Modelltraining konzentrierten, hat die Branche eine Schwelle überschritten: Der Workload, die heute die KI-Infrastruktur definiert, ist nicht das Erstellen von Modellen. Es ist das Ausführen derselben. Kontinuierlich. Im großen Maßstab. Jeden Tag.

Der Wandel vom Training zur Inferenz ist keine Vorhersage mehr, sondern operative Realität. Und die Herausforderung besteht nicht darin, dass Inferenz schwieriger ist als Training. Sie besteht darin, dass die meisten Infrastrukturteams sie bisher noch nicht in der Produktion tragen mussten. Bis es so weit ist, hat sich die Basislinie bereits verschoben.

Das Training war intensiv. Die Inferenz ist permanent.

Inferenz-Workloads machten 2025 laut Deloitte etwa die Hälfte aller KI-Rechenleistungen aus und werden voraussichtlich bis 2026 zwei Drittel ausmachen, gegenüber nur einem Drittel im Jahr 2023. Unabhängige Analysen zeigen übereinstimmend, dass Inferenz 80–90 % der gesamten Lebenszykluskosten eines produktiven KI-Systems ausmachen kann – nicht weil einzelne Anfragen teuer sind, sondern weil das System niemals aufhört zu laufen.

Sobald ein Modell bereitgestellt ist, läuft es kontinuierlich. Trainingsspitzen belasten das Rechenzentrum. Inferenz gestaltet es permanent um. Jedes neue Feature, jede Workflow-Automatisierung oder jedes eingebettete Modell hebt die Basislinie an, und sie sinkt nie wieder. Dies ist eine grundlegend andere Kostenstruktur und erfordert ein grundlegend anderes Infrastrukturmodell.

Warum Inferenz KI zurück nach On-Premises zieht

Frühe Unternehmens-KI war in der Cloud beheimatet, und das machte Sinn. Aber während die Inferenz in die Produktion übergeht, verändern mehrere Kräfte die Rechnung gleichzeitig: Latenzanforderungen erfordern Nähe, Skalierungskosten summieren sich schnell und die Datengravitation meldet sich zurück – das Verschieben von Rechenleistung ist einfacher als das Verschieben großer, reglementierter oder regulierter Daten.

Die Cloud bleibt die richtige Antwort für Training, Experimente und Spitzenlastkapazitäten. Für die Produktionsinferenz ist Hybrid jedoch kein Übergangszustand, sondern eine bewusste architektonische Entscheidung. Führende Teams wählen nicht zwischen Cloud und On-Premises. Sie platzieren Workloads dort, wo Daten, Latenz, Governance und Wirtschaftlichkeit es erfordern. Und das ist zunehmend On-Premises.

Inferenz ist ebenso ein Datenproblem wie ein Rechenproblem

Sobald KI in die Produktion übergeht, ist die Rechenleistung nicht immer das Bottleneck. Der Datenzugriff ist es.

Inferenz-Workloads sind leselastig, latenzsensitiv und hängen von frischen, regulierten Daten ab. Modelle laufen nicht mit historischen Schnappschüssen. Sie laufen mit Live-Unternehmensdaten, die in On-Premises-Systemen, regulierten Repositorys und operativen Datenbanken liegen, die nie für KI-Pipelines entwickelt wurden. Hier liegt die echte Reibung: nicht im GPU-Cluster, sondern in der Kluft zwischen dem Ort, an dem die Daten liegen, und dem Ort, an dem das Modell sie benötigt.

Das Kopieren von Daten in separate Pipelines erhöht die Latenz, gefährdet die Governance und bringt Komplexität mit sich, die sich nur schlecht skalieren lässt. In regulierten Branchen ist jede Datenbewegung ein Compliance-Ereignis. Die richtige Antwort ist der direkte, regulierte Zugriff auf Daten dort, wo sie bereits leben – On-Premises, nahe an der Rechenleistung, die sie benötigt.

Die Steuerungsebene und Datendienste, die Inferenz erfordert

Moderne Inferenz scheitert nicht, weil Modelle nicht verfügbar sind. Sie scheitert, weil Unternehmensdaten nicht in der Weise offengelegt, reguliert oder observierbar sind, wie es Inferenz-Workflows erfordern. Da Inferenz kontinuierlich und zunehmend agentenbasiert wird, konsumieren Modelle keine statischen Datensätze mehr. Sie sind auf operative Live-Daten angewiesen, auf die wiederholt, richtlinienbasiert und im Infrastrukturmaßstab zugegriffen wird.

Hitachi Vantara geht das Problem konzeptionell an

Virtual Storage Platform (VSP) 360 dient als KI-fokussierte Steuerungsebene für die Unternehmensdateninfrastruktur und koordiniert, wie Speicher, Datensicherung und Plattformdienste bereitgestellt, betrieben und für höherwertige Systeme zugänglich gemacht werden. Sie stellt sicher, dass das Datenfundament die Konsistenz, Leistung und Verfügbarkeit bereitstellt, auf die sich die Produktionsinferenz Tag für Tag verlässt.

Zusätzlich zu diesem Fundament bietet Hitachi IQ Studio KI-gestützte Datenmanagement- und Orchestrierungsdienste, die von Inferenz-Workloads genutzt werden. Anstatt zu verlangen, dass Daten kopiert, bereitgestellt oder in separate Pipelines repliziert werden, ermöglicht Hitachi IQ Studio einen richtlinienbasierten Zugriff auf Unternehmensdaten an Ort und Stelle und wendet Governance, Lineage, Qualitätskontrollen und Observability an, während die Daten für Modelle bereitgestellt werden.

STaaS passt zudem zur Wirtschaftlichkeit der Inferenz-Ära. Inferenz funktioniert wie ein Dienstprogramm – tief eingebettet und schwer zu reduzieren, sobald sie Teil des Betriebs ist. Sie zwingt I&O-Teams dazu, von einer festen, projektbasierten Denkweise zu einem kontinuierlich optimierten Verbrauchsmodell überzugehen, bei dem die Verwaltung wiederkehrender Rechenkosten die Verwaltung von Investitionsausgaben ersetzt. Genau das ist die Umgebung, für die STaaS, bereitgestellt über Hitachi EverFlex, entwickelt wurde.

Das Rechenzentrum auf der anderen Seite dieses Wandels

Teams, die diesen Übergang anführen, weisen ein konsistentes Muster auf: der Wechsel von der Spitzenplanung zum Baseline-Management, vom Anlagenbesitz zum Dienstverbrauch, von episodischen Projekten zu Always-On-Plattformen, die jeden Tag Leistung erbringen müssen.

Die erste Welle der Unternehmens-KI drehte sich um das schnelle Trainieren von Modellen. Die nächste Welle dreht sich darum, Inferenz gut auszuführen – jeden Tag, im großen Maßstab, mit Daten, die reguliert, zugänglich und nah an der Rechenleistung sind, die sie benötigt.

Sie ist bereits in Ihrer Umgebung vorhanden. Die Frage ist, ob Ihre Infrastruktur bereit ist, sie zu tragen.

Erfahren Sie mehr über Hitachi Vantaras VSP One, der Datenspeicherplattform, die das Fundament für eine KI-fähige Infrastruktur bildet.


Sunitha Rao

Sunitha Rao

Sunitha Rao is General Manager, Hybrid Cloud & SDS Storage, at Hitachi Vantara, responsible for shaping future strategy, bridging on-premises and cloud infrastructure to enhance agility, cost efficiency and enterprise innovation.


Nick Loy

Nick Loy

Nick Loy joined Hitachi Vantara in 2021. He currently manages go-to-market strategy for the Intelligent Automation practice, concentrating on hyperautomation, business process and IT automation. Nick is a frequent speaker at conferences and events on topics including AI, hybrid cloud and business process automation.