Neu: PultOS — Ihr Unternehmen auf einem Bildschirm • 71 fertige Integrationen • Server in Deutschland

Was ist ein Data Warehouse?

Data Warehouse einfach erklärt: zentrale Datenbank für Auswertungen aus ERP, CRM und Buchhaltung. Aufbau, Unterschied zu Data Lake und wann es sich lohnt.

· Aktualisiert:

UnternehmenssoftwareEin System für alle Abteilungen
ERPEinkaufLagerProduktionVertriebFinanzenPersonal
Einordnung: Data Warehouse betrifft das ganze Zusammenspiel. Schema zur Einordnung, keine Messwerte.
Inhaltsverzeichnis

Ein Data Warehouse ist eine zentrale Datenbank, in der ein Unternehmen Daten aus verschiedenen Systemen wie ERP, CRM, Shop und Buchhaltung regelmäßig zusammenführt, bereinigt und dauerhaft für Auswertungen speichert. Es ist nicht für das Tagesgeschäft gebaut, sondern dafür, Fragen über Zeiträume, Bereiche und Systeme hinweg schnell und einheitlich zu beantworten.

Man kann es sich wie ein zentrales Lager vorstellen – daher der Name: Die Waren kommen von vielen Lieferanten, werden geprüft, einheitlich etikettiert und so eingeräumt, dass man sie schnell wiederfindet.

Was ein Data Warehouse auszeichnet

Der Informatiker Bill Inmon, der das Konzept maßgeblich geprägt hat, beschrieb ein Data Warehouse mit vier Eigenschaften:

  • Themenorientiert: Die Daten sind nach Geschäftsthemen wie Kunde, Produkt oder Umsatz geordnet, nicht nach Programmen.
  • Integriert: Unterschiedliche Schreibweisen, Schlüssel und Einheiten aus den Quellsystemen werden vereinheitlicht – das ist Datenintegration im Wortsinn.
  • Zeitbezogen: Es hält die Historie fest. Wie hoch war der Lagerbestand am 31. März vor zwei Jahren? Das operative System weiß es oft nicht mehr, das Data Warehouse schon.
  • Beständig: Einmal geladene Daten werden nicht überschrieben, sondern ergänzt.

Der wichtigste Unterschied zur Datenbank eines ERP: Dort wird ständig geschrieben, gebucht und geändert. Im Data Warehouse wird vor allem gelesen – große Mengen auf einmal, über lange Zeiträume.

Aufbau in drei Schichten

  1. Anlieferung (Staging): Daten kommen möglichst unverändert aus den Quellsystemen an, über Schnittstellen, Exporte oder direkte Datenbankzugriffe.
  2. Kern: Hier werden sie bereinigt, verknüpft und historisiert. Aus „Müller GmbH“ im CRM und Kundennummer 10452 in der Buchhaltung wird ein Kunde.
  3. Bereitstellung (Data Marts): Zugeschnittene Ausschnitte für einzelne Bereiche, etwa Vertrieb oder Controlling, auf die Werkzeuge der Business Intelligence und Dashboards zugreifen.

Die Wege dazwischen sind klassische ETL-Prozesse. In Cloud-Umgebungen hat sich die Variante ELT verbreitet: Rohdaten werden zuerst geladen und erst im Data Warehouse umgewandelt, weil dort genug Rechenleistung zur Verfügung steht.

Fakten und Dimensionen

Für Auswertungen hat sich die Modellierung nach Ralph Kimball durchgesetzt, das sogenannte Sternschema. In der Mitte steht eine Faktentabelle mit messbaren Vorgängen, etwa jeder einzelnen Rechnungsposition mit Menge und Betrag. Darum herum liegen Dimensionen, die beschreiben, wie man auswerten möchte: nach Kunde, Artikel, Filiale, Datum, Vertriebsmitarbeiter. Mit dieser Struktur beantworten BI-Werkzeuge Fragen wie „Umsatz je Produktgruppe und Quartal in Süddeutschland“ in Sekunden.

Data Warehouse, Data Lake und Lakehouse

AnsatzDatenStärkeSchwäche
Data WarehouseStrukturiert, bereinigtVerlässliche, einheitliche KennzahlenNeue Quellen brauchen Modellierungsaufwand
Data LakeRoh, auch Texte, Bilder, ProtokolleGünstig, flexibel, gut für Data ScienceOhne Ordnung schnell unübersichtlich
LakehouseBeides auf gemeinsamer PlattformFlexibilität mit Struktur verbindenFür kleine Vorhaben oft überdimensioniert

Für die meisten mittelständischen Fragestellungen – Umsatz, Deckungsbeitrag, Liquidität, Vertrieb – ist ein klassisches, strukturiertes Data Warehouse die passende Grundlage. Ein Data Lake wird interessant, wenn große Mengen unstrukturierter Daten wie Maschinendaten oder Dokumente für Machine Learning gebraucht werden.

Beispiele aus dem Mittelstand

  • Handelsgruppe mit mehreren Gesellschaften: Jede Gesellschaft nutzt eine eigene Warenwirtschaft. Das Data Warehouse vereinheitlicht Artikel und Kunden und liefert eine konsolidierte Sicht für die Holding.
  • Hersteller mit Serviceabteilung: Maschinenverkäufe aus dem ERP, Servicefälle aus dem Ticketsystem und Ersatzteilbestellungen aus dem Shop werden verknüpft. So wird sichtbar, welche Baureihe im Service am meisten kostet.
  • Dienstleister nach Systemwechsel: Das alte System wird abgeschaltet, seine Historie bleibt im Data Warehouse auswertbar und kann mit den Daten des neuen Systems verglichen werden.

Wann sich ein Data Warehouse lohnt – und wann nicht

Ein Data Warehouse lohnt sich, wenn mehrere Systeme dieselben Geschäftsobjekte unterschiedlich abbilden, wenn Auswertungen über Jahre gebraucht werden oder wenn umfangreiche Abfragen die laufenden Systeme bremsen würden. Es lohnt sich weniger, wenn nur zwei, drei Kennzahlen aus einem einzigen System gebraucht werden – dann genügt oft ein KPI-Dashboard mit direkter Anbindung.

Unterschätzt wird meist der laufende Aufwand: Jede Änderung in einem Quellsystem kann Ladeprozesse brechen, und Definitionen wie „aktiver Kunde“ müssen gepflegt werden. Ein Data Warehouse ist kein einmaliges Projekt, sondern ein System im Betrieb.

In der Praxis: erst verbinden, dann sammeln

Ein Data Warehouse ist nur so gut wie seine Zuflüsse. Bei der Systemintegration sorgen wir dafür, dass Daten aus CRM, Buchhaltung, Shop und Bank zuverlässig, vollständig und überwacht fließen – ob in ein Data Warehouse, in eine Auswertungsdatenbank oder direkt in ein Management-Dashboard wie PultOS. Alles läuft zu 100 % auf Servern in Deutschland. Welche Kennzahlen zuerst gebraucht werden, klären wir gern in einer IT-Beratung, bevor Sie in eine große Plattform investieren.

Häufige Fragen

Ist ein Data Warehouse dasselbe wie eine Datenbank?

Technisch ist es eine Datenbank, aber mit anderem Zweck und Aufbau. Operative Datenbanken sind auf viele kleine Änderungen optimiert, ein Data Warehouse auf umfangreiche Lesezugriffe und Historie.

Wie aktuell sind die Daten in einem Data Warehouse?

Das hängt von den Ladeprozessen ab. Klassisch wird nachts geladen, die Daten sind dann vom Vortag. Moderne Architekturen laden häufiger oder nahezu in Echtzeit, was aber mehr Aufwand bedeutet.

Cloud oder eigener Server?

Beides ist möglich. Cloud-Dienste sind schnell verfügbar und skalieren gut; ein eigener oder in Deutschland gehosteter Server gibt mehr Kontrolle über Datenstandort und Kosten. Bei personenbezogenen Daten sind Datenstandort und Auftragsverarbeitung in jedem Fall zu klären.

Brauchen Sie Unterstützung?

Unsere Experten helfen Ihnen, die richtigen SEO- und Digitalstrategien für Ihr Unternehmen umzusetzen.

Erstgespräch vereinbaren
Schreiben Sie uns per WhatsApp