Datenqualität messen
Datenqualitätsmetriken quantifizieren die Leistung definierter Datensätze, Datenelemente, Prozesse oder Anwendungsfälle.
Ausgangspunkt sind die Anforderungen des jeweiligen Anwendungsfalls. Ein B2B-E-Commerce-Unternehmen wickelt beispielsweise Bestellungen über seinen Onlineshop ab. Für jede Kundenbestellung wird eine primäre E-Mail-Adresse benötigt.
Im nächsten Schritt ordnet das Unternehmen diese Anforderung einer Datenqualitätsdimension zu. Zu den gängigen Dimensionen zählen Genauigkeit, Vollständigkeit, Konsistenz, Aktualität, Validität, Eindeutigkeit und Relevanz. Im Beispiel lautet die entscheidende Frage: Enthält jede Bestellung eine primäre E-Mail-Adresse? Damit geht es um Vollständigkeit.
Messen lässt sich diese Vollständigkeit mit einem einfachen Verhältnis: Die Anzahl der Bestellungen mit primärer E-Mail-Adresse wird durch die Gesamtzahl aller Bestellungen geteilt. Das Ergebnis liegt zwischen 0 % und 100 %.

Wenn Data Engineers die Anforderungen einer Fachdomäne analysieren, definieren sie zahlreiche Metriken. Einige sind wichtiger als andere. Manche machen übergreifende Entwicklungen sichtbar. Im Beispiel könnte der Gesamtanteil ungültiger Bestelldatensätze einen breiteren Blick auf die Datenqualität eröffnen. Bildet eine Metrik ein solches wichtiges Managementziel ab, kann sie als Key Performance Indicator (KPI) dienen.
Die Messwerte selbst beruhen auf Regeln und Prüfungen. Eine Regel beschreibt eine überprüfbare Bedingung für definierte Daten. Zum Beispiel:
Das Feld für die primäre E-Mail-Adresse darf in keinem Bestelldatensatz leer sein.
Eine Prüfung testet, ob die Daten diese Bedingung erfüllen, etwa über eine SQL-Anweisung oder ein Python-Skript. In diesem Fall liefert sie für jeden Datensatz den Wert 0 oder 1. Die Metrik fasst diese Einzelergebnisse für alle relevanten Datensätze zusammen.
Was ist eine Datenqualitätsmetrik?
- Eine Datenqualitätsmetrik quantifiziert, wie gut ein definierter Datensatz, ein Datenelement, ein Prozess oder ein Anwendungsfall die gestellten Anforderungen erfüllt.
- Ein KPI ist eine ausgewählte Metrik, die mit einem wichtigen Managementziel verbunden ist.
- Eine Regel formuliert eine überprüfbare Bedingung. Eine Prüfung wendet diese Regel auf die Daten an.
- Ein Zielwert beschreibt die gewünschte Leistung. Ein Schwellenwert markiert den Punkt, an dem Aufmerksamkeit oder Handeln erforderlich ist.
- Eine Scorecard stellt ausgewählte Messgrößen übersichtlich zusammen.
Was sind die zentralen Datenqualitätsdimensionen?
Datenqualitätsdimensionen helfen dabei, Anforderungen zu strukturieren und Probleme genauer einzuordnen:
- Genauigkeit: Ein Wert oder Datensatz gilt als korrekt, wenn er mit einer verlässlichen Referenz oder Ground Truth übereinstimmt.
- Vollständigkeit: Alle erforderlichen Attribute eines Datensatzes sind befüllt. Vollständigkeit kann sich auch darauf beziehen, ob eine Tabelle alle relevanten Datensätze enthält. Dabei ist zwischen Zeilen- und Spaltenvollständigkeit zu unterscheiden.
- Konsistenz: Daten sind konsistent, wenn sie sich nicht widersprechen. Konsistenz ist immer kontextabhängig. Sie kann zwischen Attributen eines Datensatzes, zwischen mehreren Datensätzen, zwischen Tabellen oder systemübergreifend geprüft werden.
- Aktualität: Ein Datensatz ist für seinen vorgesehenen Zweck aktuell genug. Da viele Systeme Daten stapelweise und nicht in Echtzeit verarbeiten, braucht Aktualität einen sinnvoll definierten Schwellenwert.
- Validität: Daten entsprechen festgelegten Einschränkungen, Regeln und technischen Anforderungen. Das Spektrum reicht von einfachen Formatprüfungen, etwa einer gültigen E-Mail-Adresse, bis zu Geschäftsregeln wie der Vorgabe, dass das Lieferdatum nach dem Bestelldatum liegen muss.
- Eindeutigkeit: Ein Datensatz existiert nur einmal. Es gibt kein Duplikat, das unerwünschte Folgen auslösen könnte, etwa die doppelte Ausführung einer Bestellung.
- Relevanz: Die Daten sind für die konkrete Aufgabe des Nutzers von Bedeutung.
So eindeutig diese Dimensionen zunächst erscheinen, sie sind nicht in jedem Kontext gleich wichtig.
In der BARC Studie Managing Unstructured Data (2026, n=195) stellten die BARC Analysten Kevin Petrie und Merv Adrian die Frage: „Wie messen Sie die KI-Bereitschaft unstrukturierter Daten?“ 54 % der Befragten nannten Genauigkeit, 31 % Aktualität. Die übrigen oben aufgeführten Dimensionen lagen zwischen diesen Werten. Wie KI die Anforderungen an Datenqualität verändert, erläutert auch unser Beitrag über Datenqualität für KI.
Entscheidend ist: Dieselben Daten können für einen Zweck ausreichen und für einen anderen ungeeignet sein. Isoliert betrachtet sind Datenqualitätsdimensionen jedoch wenig aussagekräftig. Sie liefern deshalb keine allgemeingültige Definition hochwertiger Daten. Sie dienen vielmehr als Denkmodell, um Anforderungen und Probleme zu analysieren und daraus passende Prozesse, Metriken, Regeln und Prüfungen abzuleiten.
So wählen Sie Metriken für geschäftskritische Daten aus
- Benennen Sie die Geschäftsentscheidung, den Prozess, den Bericht oder den KI-Anwendungsfall, den die Daten unterstützen sollen.
- Identifizieren Sie die kritischen Datenelemente, deren Fehler oder Ausfall das Ergebnis verändern könnte.
- Beschreiben Sie die möglichen Folgen und definieren Sie, was „für den Zweck geeignet“ in diesem Kontext konkret bedeutet.
- Wählen Sie nur die Dimensionen aus, die relevante Fehlermöglichkeiten sichtbar machen.
- Formulieren Sie die Regel und legen Sie fest, mit welchen Prüfungen sie getestet wird.
- Definieren Sie die Metrik einschließlich Berechnung und Berichterstattung sowie die Reaktion auf einen überschrittenen Schwellenwert.
- Benennen Sie den Verantwortlichen, der das Ergebnis prüft, sowie die Entscheidung, in die es einfließt.
- Stellen Sie sicher, dass die Metrik verständlich, reproduzierbar, empfindlich gegenüber wesentlichen Veränderungen und wirtschaftlich zu pflegen ist.
Ausgangswerte, Zielwerte und Schwellenwerte festlegen
Eine Metrik allein ist zunächst nur eine Zahl. Erst der passende Kontext macht sie entscheidungsrelevant.
Wichtige Bezugspunkte sind:
- Zielwert: Der gewünschte Wert oder Wertebereich.
- Ausgangswert: Das anfängliche oder typische Leistungsniveau.
- Schwellenwert: Eine Grenze zwischen Leistungsbereichen, die erkennen lässt, wie kritisch ein Ergebnis ist.
- Warnmeldung: Eine Benachrichtigung oder automatisierte Aktion, die beim Überschreiten eines Schwellenwerts ausgelöst wird.
Setzen Sie Warnmeldungen mit Bedacht ein. Zu viele irrelevante Meldungen führen zu Alarmmüdigkeit und erschweren es, wesentliche Probleme zu erkennen. Wer morgens neben dem ersten Kaffee bereits 20 irrelevante Datenqualitätswarnungen erhält, verliert Zeit und ist schnell frustriert.
Selbst bei einer einfachen Metrik ist es aufwendig, diese Bezugspunkte sauber festzulegen. Der Aufwand lohnt sich: Teams können dadurch normale Schwankungen von Entwicklungen unterscheiden, die konkretes Handeln erfordern.
Betrachten Sie nicht nur den aktuellen Messwert, sondern verfolgen Sie auch seine Entwicklung über die Zeit. So lassen sich Verschlechterungen erkennen, bevor ein Schwellenwert erreicht ist. Auch Anomalien und wiederkehrende Muster werden sichtbar.
In der Praxis kommen inzwischen kontinuierliche Messungen und Anomalieerkennung in gesamten Datenlandschaften zum Einsatz. Dieser Ansatz ähnelt der technischen Überwachung von Maschinen und den Observability-Praktiken anderer IT-Systeme. Mehr über Datenbeobachtbarkeit erfahren Sie im umfragegestützten BARC Bericht Observability for AI Innovation – Adoption Trends, Requirements and Best Practices.
Von der Messung zur Verbesserung
Metriken, Schwellenwerte und Benachrichtigungen zu definieren, erfordert Zeit. Noch anspruchsvoller ist es, sie zur Verbesserung von Geschäftsergebnissen einzusetzen. Der Lebenszyklus des Datenqualitätsmanagements verknüpft Messergebnisse mit ihren geschäftlichen Auswirkungen und strukturiert die Aufgaben, mit denen Unternehmen ihre Datenqualität verbessern können. Der Artikel „Datenqualitätsmanagement: Definition, Lebenszyklus und Verantwortung“ zeigt, wie sich dieser Lebenszyklus in der Praxis umsetzen lässt.
Datenqualitätsmanagement im Wandel
Datenqualitätsmanagement gehört im BARC Data, BI, and Analytics Trend Monitor seit mehreren Jahren zu den führenden Themen. Die anhaltend hohe Platzierung macht deutlich, wie schwer es vielen Unternehmen weiterhin fällt, die Verlässlichkeit datenbasierter Entscheidungen abzusichern.
Gleichzeitig entwickelt sich die Disziplin weiter. Einen aktuellen Überblick bietet der BARC Compass Data Quality Management. Er beschreibt acht Prozesse und Technologien, die das Datenqualitätsmanagement derzeit prägen, ordnet sie in die BARC Primärforschung ein, gibt einen Überblick über relevante Softwareanbieter und unterstützt so die Softwareauswahl. Unternehmen, die dafür geeignete Werkzeuge evaluieren, können außerdem in den BARC Reviews zu Datenqualität und Observability Datenqualitätslösungen vergleichen.
FAQ
Was sind Datenqualitätsmetriken?
Eine Datenqualitätsmetrik zeigt, wie gut ein definierter Datensatz, ein Datenelement oder ein Prozess die Anforderungen seines vorgesehenen Verwendungszwecks erfüllt. Jede Metrik gehört zu einer Dimension wie Genauigkeit oder Vollständigkeit. Regeln und Prüfungen bilden die Grundlage für ihre Berechnung. Der Anteil der Kundenbestellungen mit einer primären E-Mail-Adresse misst beispielsweise die Vollständigkeit dieses Attributs.
Was sind die wichtigsten Datenqualitätsdimensionen?
Zu den häufigsten Dimensionen zählen Genauigkeit, Vollständigkeit, Konsistenz, Aktualität, Validität, Eindeutigkeit und Relevanz. Jede beantwortet eine andere Frage. Keine einzelne Dimension bildet Datenqualität vollständig ab. In der BARC Studie über unstrukturierte Daten aus dem Jahr 2026 (n=195) kombinierten die Befragten mehrere Dimensionen, um die KI-Bereitschaft zu bewerten. 54 % nannten Genauigkeit, 31 % Aktualität. Welche Dimensionen entscheidend sind, bestimmt der jeweilige Anwendungsfall.
Wie lässt sich Datenqualität messen?
Beginnen Sie mit der Geschäftsentscheidung, dem Prozess, dem Bericht oder dem KI-Anwendungsfall, den die Daten unterstützen sollen. Identifizieren Sie anschließend die kritischen Datenelemente, deren Fehler oder Ausfall das Ergebnis verändern könnte. Wählen Sie die Dimensionen aus, die diese Risiken sichtbar machen. Definieren Sie dann eine Regel, geeignete Prüfungen und eine Metrik, die die Ergebnisse anhand einer dokumentierten Berechnung zusammenfasst. Legen Sie abschließend einen Ausgangswert, einen Zielwert und Eskalationsschwellen fest. Bestimmen Sie außerdem, wer die Ergebnisse prüft und verantwortet.
Was unterscheidet Datenqualitätsmetrik, KPI, Regel und Schwellenwert?
Eine Regel formuliert eine überprüfbare Bedingung, zum Beispiel: Die primäre E-Mail-Adresse darf nicht leer sein. Eine Prüfung wendet diese Regel auf jeden Datensatz an. Eine Metrik fasst die Ergebnisse zu einem Wert zusammen, etwa zum Anteil der Bestellungen mit E-Mail-Adresse. Ein KPI ist eine Metrik, die mit einem wichtigen Managementziel verbunden ist. Ein Schwellenwert markiert den Punkt, an dem eine Warnmeldung oder eine festgelegte Reaktion ausgelöst wird.
Wie sollte ein Unternehmen Schwellenwerte für die Datenqualität festlegen?
Schwellenwerte sollten sich an den Folgen eines Fehlers orientieren. Dazu zählen betroffene Nutzer, Umsatz, Betriebsrisiken und regulatorische Risiken. Ein Warnschwellenwert sollte eine Prüfung anstoßen. Ein Eskalationsschwellenwert sollte eine festgelegte Reaktion auslösen. Testen Sie jeden Schwellenwert auf Fehlalarme und übersehene Fehler. Zu empfindlich gesetzte Schwellenwerte erzeugen unnötiges Rauschen und können die wirklich wichtigen Probleme verdecken.