Data Engineering Guide

Was ist Data Lineage?

Ein praxisnaher Ueberblick: Was Data Lineage ist, warum es 2025 unverzichtbar ist, welche Typen es gibt und wie du es in wenigen Wochen in Produktion bringst.

16 Min. LesezeitFuer Data & Analytics Teams12 kompakte Abschnitte
1

Was ist Data Lineage?

Kurzdefinition

Data Lineage ist das abfragbare Protokoll, wie Daten von der Quelle ueber Transformationen zum Konsumenten fliessen. Es zeigt Herkunft, Aenderungen, Bewegungen und Ownership.

Woher kommt diese Zahl?

Upstream-Quellen und Joins nachvollziehen.

Wie wurde es transformiert?

SQL-Schritte, Jobs und Modelle sehen.

Was passiert bei Aenderung?

Impact-Analyse fuer abhängige Assets.

Wem gehoert es?

Owner und Konsumenten pro Asset.

2

Warum es 2026 zaehlt

Schneller debuggen

30-50% weniger Zeit bei Incident-Response, weil Abhaengigkeiten sofort sichtbar sind.

Compliance und PII

Finde alle Kopien sensibler Felder fuer DSGVO/CCPA und Right-to-be-forgotten.

Sichere Aenderungen

Vor Deploys den Blast-Radius sehen und Stakeholder frueh informieren.

3

Lineage-Typen

Table-Level vs. Column-Level

Table-Level zeigt Datensaetze, Column-Level macht Feld-Abhaengigkeiten sichtbar und ermoeglicht genaue Impact-Analysen.

Design-Time vs. Run-Time

Design-Time aus Code und DAGs, Run-Time aus tatsaechlichen Query-Logs und Task-Runs. Kombiniere beides fuer Vollstaendigkeit.

Automatisch vs. Kuratiert

Parser liefern Breite, manuelle Kuratierung liefert Kontext (Owner, Business-Definition, SLA). Hybrid gewinnt.

4

Kernbausteine

Assets (Nodes)

Quellen, Tabellen, Views, Dashboards, ML-Modelle.

Flows (Edges)

SQL, ETL/ELT, DAGs, API-Aufrufe.

Metadaten

Owner, SLA, Sensitivitaet, Tests, Docs.

5

Wichtige Use Cases

Impact-Analyse

Vor Deploys sehen, welche Dashboards, Jobs und Tabellen betroffen sind.

Root-Cause-Debugging

Fehlerhafte KPIs backtracen und die exakte Transformation finden.

Compliance

PII-Felder nachverfolgen und Downstream-Kopien erkennen.

Migrationen

Warehouse-Wechsel oder Spalten-Deprecation mit klarer Checkliste durchfuehren.

6

Lineage vs. Provenance

Lineage beantwortet das Was/Wo: welche Assets sich beruehren und wie Daten fliessen. Provenance deckt das Wer/Wann/Warum ab: Herkunft, Eigentum, Qualitaetshistorie.

Fuer Engineering-Workflows reicht oft Lineage, fuer Audits brauchst du beides. Plane auditierbare Logs und Zugriffshistorie ein.

7

Erfassungswege

Warehouse-Query-Logs

Snowflake, BigQuery, Databricks History fuer echte Laufzeit-Beziehungen.

dbt Manifeste

Design-Time-Graf aus Models, Tests und Sources.

OpenLineage Events

Airflow/Dagster senden standardisierte Lineage-Ereignisse.

Manuelle Kuratierung

Kritische Flows dokumentieren: Owner, SLA, Zweck, Business-Definitionen.

8

Tools 2026

Enterprise & Katalog

Collibra, Informatica, IBM, Alation fuer grosse Data Estates.

Moderne Kataloge

Atlan, Select Star, Metaphor mit UX-First Lineage.

Open Source

OpenLineage, Marquez, Apache Atlas fuer kontrollierte Pipelines.

Spezialisiert

dbt fuer Transformation, Datadef fuer visuelle Architektur und Docs.

9

Implementierung in 5 Schritten

1

Scope festlegen: Gold-Dashboards, regulatorische Reports, Top-Tabellen.

2

Automatische Signale aktivieren: Query-Logs, dbt, OpenLineage.

3

Kontext anreichern: Owner, SLA, PII-Tags, Business-Definitionen.

4

Workflows verbinden: Impact-Checks in PRs, Incident-Playbooks, Onboarding.

5

Freshness sichern: taegliche Updates, monatliche Checks, Alerting bei Luecken.

10

KI-gestuetzte Lineage

SQL-Verstehen

LLMs parsen komplexe CTEs, dynamische SQL und finden implizite Joins.

PII-Erkennung

Automatische Klassifikation von sensiblen Feldern ueber Tabellen hinweg.

Impact-Vorhersage

Aenderungen simulieren und betroffene Konsumenten listen.

Auto-Dokumentation

Beschreibungen, Runbooks und Diagramme generieren.

11

Huerden und Loesungen

Abdeckung

Starte mit 20% der wichtigsten Assets, ergaenze monatlich.

Freshness

Automatisierte Jobs + Alerts, die fehlende Kanten melden.

Adoption

Lineage in Reviews, Onboarding und Incident-Response einbauen.

12

FAQ

Brauche ich Column-Level-Lineage fuer alles?

Nein. Beginne mit Table-Level fuer Breite. Nutze Column-Level fuer Gold-Assets, regulatorische Felder und kritische KPIs.

Wie halte ich Lineage aktuell?

Automatischer Refresh (taeglich/woechentlich), Monitoring fuer fehlende Events und vierteljaehrliche Reviews mit Ownern.

Was kostet der Start?

Proof-of-Concept in 2-3 Wochen mit Query-Logs + dbt. Danach sukzessive Teams anbinden.

Wie messe ich Erfolg?

Zeit bis Root-Cause, weniger Incident-Severity, kuerzere Deploy-Zyklen, geringere Support-Tickets.

Lineage sichtbar machen

Erstelle in Minuten ein visuelles Diagramm und Dokumentation fuer dein Team.