Einführung in das Data Warehouse
Ein tiefer Einblick in einige grundlegende Konzepte des Data Warehousing,
Datenlager
Zunächst einmal, was ist ein Data Warehouse?
Eine zentrale Informationsquelle.
Data Warehouse führt Daten aus mehreren heterogenen Quellen zusammen und aggregiert sie in einem zentralen Datenspeicher, um anspruchsvolle Analysen und Berichte zu unterstützen.
Daten und Analysen bilden den Kern jedes Unternehmens. Unternehmen verlassen sich auf Analysetools, Dashboards und Berichte, um Erkenntnisse aus ihren Daten zu gewinnen, die Geschäftsleistung zu überwachen und vorherzusagen und die Entscheidungsfindung zu unterstützen. Data Warehouse ermöglicht es ihnen, diese leistungsstarken Analysen für riesige ( ich wiederhole, MASSIVE ) Datenmengen effizient auszuführen.
Data-Warehouse-Architektur
Ein typisches Data Warehouse besteht normalerweise aus drei Schichten.
Unterste Ebene: Data Warehouse-Server , der für das Sammeln, Bereinigen und Transformieren der aus verschiedenen Quellen gesammelten Daten verantwortlich ist. Dies erfolgt durch einen Prozess namens ETL (Extract, Transform & Load) oder über einen ELT- Prozess (Extract, Load & Transform).
Mittlere Ebene: OLAP-Server , der schnelle Abfragegeschwindigkeiten ermöglicht, indem er eine abstrahierte Ansicht der Datenbank bereitstellt.
Oberste Ebene: Front-End-Benutzeroberfläche oder ein Berichtstool , mit dem Benutzer Analysen zu den Daten durchführen können.
Schemata im Data Warehouse
Ein Schema ist im Wesentlichen ein Format, in dem die Daten innerhalb einer Datenbank oder eines Data Warehouse organisiert sind.
Bevor wir uns mit den Schemas im Data Warehouse befassen, müssen wir zunächst eines verstehen:
Fakten- und Dimensionstabellen
Faktentabellen sind Tabellen, die die Primärschlüssel der referenzierten Dimensionstabellen zusammen mit einigen quantitativen Metriken (Kennzahlen) enthalten, für die irgendeine Form von Berechnungen durchgeführt werden kann. Einige Beispiele für Faktentabellen sind Auftragsprotokolle, Zeitreihen-Finanzdaten usw.
Dimensionstabellen enthalten beschreibende Informationen für die zugehörigen Felder, die in den Faktentabellendatensätzen vorhanden sind. Das gebräuchlichste Beispiel für Dimensionstabellen sind die typischen Kunden- und Produkttabellen .
Betrachten wir ein Beispiel eines Kunden, der Produkte in physischen Geschäften kauft.
Die Dimensionstabellen (in Blau) enthalten Informationen zu Produkten , Daten , Kunden und Geschäften .
Die Faktentabelle (in Gelb) enthält alle Primärschlüssel von Dimensionstabellen, die Fremdschlüssel für die Faktentabelle sind – customer_id, product_id, store_id und date_id . Es enthält auch quantitative Maße – Menge und Menge .
Zurück zu den Data-Warehouse-Schemata:
Es gibt zwei Arten von DW-Schemata:
Sternschema
Der häufigste Schematyp, das Sternschema, besteht aus einer Faktentabelle, die mit mehreren denormalisierten Dimensionstabellen verbunden ist. Dies ist das einfachste Schema und Benutzer profitieren von schnelleren Abfragegeschwindigkeiten.
Betrachten wir unten ein Beispiel.
Hier ist die Faktentabelle, auch bekannt als Auftragstabelle , weiter mit fünf Dimensionstabellen verbunden, nämlich Kunde, Mitarbeiter, Artikel, Lager und Datum .
Snowflake-Schema
Der zweite Schematyp, das Schneeflockenschema, besteht aus einer Faktentabelle, die mit mehreren normalisierten Dimensionstabellen verbunden ist, wobei die Dimensionstabellen ferner untergeordnete Tabellen haben . Das Snowflake-Schema ist zwar nicht so weit verbreitet, aber für geringe Redundanz sehr vorteilhaft, allerdings auf Kosten der Abfrageleistung.
Betrachten wir das gleiche Beispiel wie oben, aber für das Schneeflockenschema würde es ungefähr so aussehen:
Hier ist die Faktentabelle, auch bekannt als Auftragstabelle , weiter mit fünf Dimensionstabellen verbunden, nämlich Kunde, Mitarbeiter, Artikel, Lager und Datum . Einige Dimensionstabellen sind weiter normalisiert und haben untergeordnete Tabellen – die Employee-Tabelle hat zwei untergeordnete Tabellen – Gender und Office , Items hat eine untergeordnete Tabelle Color usw.
Vorteile von Data Warehouse
Die wichtigsten Vorteile des Data Warehouse sind:
- Ermöglicht intelligente Entscheidungsfindung : Data Warehouses unterstützen umfangreiche BI-Funktionen wie Data Mining (Auffinden unsichtbarer Muster oder Beziehungen in Daten), maschinelles Lernen (Prognose von Verkäufen für das nächste Quartal usw.) und andere Datenanalysen – Tools, die Unternehmensleitern und Profis sammeln harte Beweise, um ihre Entscheidungsfindung in allen Aspekten des Geschäfts zu unterstützen, von Finanzprognosen und Geschäftsabwicklung bis hin zur Bestandsverwaltung.
- Bessere Datenqualität: Daten aus mehreren heterogenen Quellen wie Transaktionssystemen, relationalen Datenbanken und Flatfiles werden gesammelt, bereinigt und standardisiert, um Redundanzen zu beseitigen und eine Single Source of Truth zu bilden.
- Trennung der Analyseverarbeitung von Transaktionsdatenbanken: Transaktionssysteme ermöglichen die schnelle Abwicklung von alltäglichen Transaktionen in großem Umfang, während Data Warehouse bei der Ausführung leistungsstarker Analysen für riesige Datenmengen hilft. Die beiden haben unterschiedliche Zwecke und daher hilft ihre Trennung, die Leistung beider zu verbessern. Um es besser zu verstehen, überprüfen Sie dies .
Prachi Singh
Technology Associate bei Morgan Stanley
LinkedIn | Twitter

![Was ist überhaupt eine verknüpfte Liste? [Teil 1]](https://post.nghiatu.com/assets/images/m/max/724/1*Xokk6XOjWyIGCBujkJsCzQ.jpeg)



































