KI-Skalierung stößt an Grenzen
Die rasche Einführung von KI und die besonderen Eigenschaften und Funktionsweisen von KI-Workloads definieren den Umfang und die Struktur der Aufgaben von Site Reliability Engineering (SRE) und Platform Engineering neu. Dieser Wandel zwingt Unternehmen dazu, ihre Ansätze für Skalierung, Automatisierung und Kontrolle neu zu überdenken. Eine neue Studie von Dynatrace zeigt, dass SRE- und Platform-Engineering-Teams an vorderster Front stehen, wenn es darum geht, neue Benchmarks, Tools und Funktionen für KI-Workloads in ihre Umgebungen für Zuverlässigkeit und Softwareentwicklung zu integrieren.
Gartner® prognostiziert, dass bis 2028 80 Prozent der Unternehmen SRE-Praktiken in ihren Organisationen einführen werden, gegenüber lediglich 30 Prozent im Jahr 2024. Mit Unterstützung der Führungsebene und in gemeinsamer Verantwortung spielen diese Teams eine zunehmend wichtige Rolle für den Erfolg oder Misserfolg von KI-Initiativen. Unternehmen sind darauf angewiesen, dass diese Teams Plattformen, Tools und Standards für KI-Workloads weiterentwickeln.
67 Prozent der SREs nennen inzwischen das Monitoring von KI-Modellen als ihren wichtigsten Anwendungsfall. Die Überwachung von Modellleistung und -genauigkeit ist mit 58 Prozent bereits die am häufigsten genannte KI-gestützte Funktion unter SREs. Damit wächst der Bedarf an KI-Evaluierung schneller als die Zahl der dafür verfügbaren Tools.
Gleichzeitig bleibt die Wirkung von KI bei der Kostensenkung und der Reduzierung der Mean Time to Resolution (MTTR) hinter den Erwartungen zurück. Mehr als ein Drittel der Platform Engineers nennt die Integration von Tools als größte Hürde. Durch die Integration einer KI-nativen Evaluierung in die Observability-Plattform arbeiten Teams, die KI-Modelle entwickeln, und Teams, die diese in der Produktion betreiben, mit denselben Daten, anstatt separate Systeme miteinander verbinden zu müssen.
Die Studie zeigt, dass SRE und Platform Engineering in großen Unternehmen inzwischen fest etabliert sind:
Zusammengenommen zeigen diese Ergebnisse, dass Unternehmen umfassend in Zuverlässigkeit, Automatisierung und Entwicklerproduktivität investiert haben. Von SRE- und Platform-Engineering- Teams wird nun erwartet, diese Grundlage auf die nächste Phase der digitalen Transformation zu übertragen. KI-Workloads sind zunehmend Teil der Produktionsinfrastruktur. Gleichzeitig stellen die wachsende Komplexität, neue Telemetrie und neuartige Fehlerbilder höhere Anforderungen an Observability.
Der Studie zufolge führt agentische KI zu neuen Prioritäten und Herausforderungen:
Während KI-Technologien die Erwartungen an eine höhere Zuverlässigkeit und Entwicklerproduktivität im Allgemeinen erfüllen, bleibt ihre Wirkung bei der Kostensenkung und der Reduzierung der Mean Time to Resolution (MTTR) hinter den Erwartungen zurück. Diese Lücke zeigt, dass mehr systemweite Intelligenz und Workflow-Orchestrierung erforderlich sind, als lediglich KI-Tools in bestehende Umgebungen zu integrieren. Fast die Hälfte der befragten SREs gab an, dass eine zu große Zahl von Datenquellen und Metriken ihre Fähigkeit beeinträchtigt, wirksame SLOs zu definieren und zu verwalten.
Bemerkenswert ist, dass Teams zunächst bewusst auf Transparenz und menschliche Kontrolle setzen, bevor sie die Automatisierung ausweiten. Die Überwachung der Modellleistung und -genauigkeit von KI-Systemen ist mit 58 Prozent die am häufigsten genannte KI-gestützte Funktion unter SREs.
Während Unternehmen auf mehr Automatisierung und KI-gestützte Abläufe hinarbeiten, wird Observability zur Grundlage für KI-Governance, Zuverlässigkeit und Optimierung in SRE und Platform Engineering. Integration, Komplexität und fragmentierte Daten sind jedoch wesentliche Hindernisse für weitere Fortschritte:
Die Hälfte der SREs nutzt inzwischen KI-gestützte Funktionen für die automatisierte Reaktion auf Vorfälle. Dies signalisiert einen Wandel hin zu agentischen Abläufen, bei denen Observability als Steuerungsebene steuert, wann und wie autonome Aktionen ausgeführt werden.
„SRE und Platform Engineering haben die Grundlage für moderne digitale Zuverlässigkeit geschaffen", sagte Steve Tack, Chief Product Officer bei Dynatrace. "KI schreibt nun jedoch die Regeln neu. Unternehmen müssen sich vom Management einzelner Systeme hin zur Orchestrierung komplexer Umgebungen entwickeln. Dafür müssen sie Observability, Automatisierung und agentische KI miteinander verbinden, um mit der Geschwindigkeit zu agieren, die diese Initiativen erfordern, und Erkenntnisse skalierbar in konkrete Maßnahmen zu überführen“.
Laden Sie hier den Bericht „The State of SRE and Platform Engineering 2026: How enterprises are orchestrating observability, automation and AI to scale reliability“ herunter.
Bild: DC Studio / Magnific