Ein Data Lake speichert als zentrales Auffangbecken sämtliche Daten, welche aus den verschiedenen Quellen anfallen.
Das Internet of Things (IoT) wächst kontinuierlich und führt gerade in modernen, vernetzten Fabriken (Smart Factories) zu einem exponentiellen Anstieg der erhobenen Daten. Um die anfallenden Daten sinnvoll zu analysieren und anschließend zu nutzen, ist eine leistungsfähige Big-Data-Infrastruktur ein essenzieller Faktor. Als zentrales Sammelbecken für die anfallenden Daten sowie für die Analyse haben sich zwei Methoden manifestiert, welche in den Grundzügen sehr unterschiedliche Ansätze verfolgen: das Data Warehouse und der Data Lake.
In einem klassischen Data Warehouse werden alle anfallenden Daten strukturiert in Datenbanken organisiert. Der Nachteil dieser Variante liegt in der meist sehr aufwendigen Integration der Daten in das vorab definierte Datenmodell. Darüber hinaus gerät das Modell schnell an sein Grenzen, wenn sehr große oder sich oft ändernde Datenmengen ins Spiel kommen.
Aus diesem Grund setzen moderne, vernetzte Fabriken meist auf Data Lakes. Ein Data Lake speichert als zentrales Auffangbecken sämtliche Daten, welche aus den verschiedenen Quellen anfallen. Die Speicherung erfolgt dabei in ihrem ursprünglichen Rohformat und bietet im Vergleich zum Data Warehouse einige Vorteile. Zunächst einmal arbeiten Data Lakes in der Regel mit Kopien und lassen die ursprünglichen Rohdaten unberührt, was die Anfälligkeit für einen potenziellen Datenverlust deutlich verringert. Ergänzend können Rohdaten beliebig mit zusätzlichen Informationen aus anderen Datenquellen angereichert werden. Auch ist die Flexibilität hinsichtlich der Verarbeitung der Daten ein weiterer entscheidender Vorteil gegenüber Data Warehouses. Rohdaten werden in Data Lakes erst bei Bedarf analysiert und gefiltert, welches zu einer effizienteren Verarbeitung der IoT-Datenströme führt.
Dies ist ein Artikel aus unserer Print-Ausgabe 7-8/2021. Bestellen Sie ein kostenfreies Probe-Abo.
Die schnell anwachsenden Datenmengen von Data Lakes stellen Smart Factories vor die Herausforderung, bereits in kürzester Zeit mehrere Terabyte bis Petabyte an Speicherplatz für die anfallenden Daten zur Verfügung zu stellen. Daher bringt es erhebliche Vorteile mit sich, einen Data Lake in einer Cloud-Umgebung zu betreiben. Die flexible Skalierbarkeit hinsichtlich der Speicherkapazitäten und die Nutzung nach Bedarf vermeiden klassische Kapazitätsprobleme lokaler Lösungen. In einem Multi-Cloud-Szenario werden die bereits genannten Vorteile durch weitere Flexibilität hinsichtlich verschiedener Storage-Lösungen ergänzt. Dies ermöglicht Unternehmen nicht nur, einen Vendor Lock-in zu vermeiden, sondern kann auch die Verfügbarkeit und Sicherheit von Daten erhöhen, indem diese an mehreren Orten verteilt liegen. So können Unternehmen z. B. mit einem Tarif von Plusserver eine Multi-Cloud-Umgebung mit freier Wahl der jeweils besten Cloud-Plattform und Cloud-Komponenten nutzen, um flexibel auf die Anforderungen reagieren zu können.
Beide Methoden können sich in der Kombination auch ergänzen, da sie unterschiedliche Use Cases bedienen. Während ein Data Warehouse sich vor allem für BI-Analysen und KPI-Reports eignet, sind es beim Data Lake eher komplexere Analytics-Anwendungen mit Machine Learning. So können Data Lakes auch als zentrales Speichermedium und als Quelle für Data Warehouses genutzt werden.
Bildquelle: Getty Images / iStock / Getty Images Plus