Guida data platform

Come creare un diagramma Databricks

La tua piattaforma Databricks è potente—ma è comprensibile? Questa guida spiega come rendere chiara un\'architettura lakehouse, mantenerla e usarla quando la produzione fa cilecca di notte.

18 min di letturaPer data e platform engineerEsempi e template inclusi

1. Perché fare un diagramma della tua piattaforma Databricks?

Databricks è potente ma complesso: layer Delta, namespace Unity Catalog, workflow, notebook, cluster. Senza diagramma, i nuovi impiegano settimane. Un buon schema riduce la curva di apprendimento da settimane a ore.

Il costo nascosto di poca documentazione

Quando la prod salta alle 2 di notte nessuno vuole scavare nei notebook. Senza diagrammi chiari, l\'incident response dura 3-5x e l\'onboarding passa da settimane a mesi.

Tre problemi che i diagrammi Databricks risolvono:

Onboarding più veloce

I nuovi capiscono il flusso in giorni e non in mesi. Nessuna archeologia di codice.

Debug più rapido

Se una pipeline si rompe, il diagramma mostra subito le dipendenze. Le cause a monte si trovano in pochi minuti.

Migliore collaborazione

Data engineer, analytics e business condividono un linguaggio visivo. Meno incomprensioni.

Dal campo

Ho visto team ridurre l\'onboarding del 60% con un unico diagramma mantenuto. Trattalo come documento vivo e aggiornalo appena cambi la piattaforma.

2. Componenti core da includere

Un diagramma Databricks completo mostra l\'intero ciclo dati. Questi elementi non possono mancare.

Sorgenti dati

Da dove arrivano i dati prima di Databricks.

  • • DB esterni (PostgreSQL, MySQL, SQL Server)
  • • Storage cloud (S3, Azure Blob, GCS)
  • • Streaming (Kafka, Event Hubs, Kinesis)
  • • API e SaaS

Layer Delta Lake

Medallion: Bronze → Silver → Gold.

  • Bronze: Dati grezzi
  • Silver: Puliti, validati, deduplicati
  • Gold: Aggregati business
  • • Mostra le trasformazioni tra layer

Unity Catalog

Governance e organizzazione.

  • • Cataloghi (dev, staging, prod)
  • • Schemi (domini: sales, marketing)
  • • Tabelle e viste
  • • Permessi e accessi

Workflows e job

Orchestrazione e scheduling.

  • • Databricks Workflows (job cluster)
  • • Notebook e task
  • • Dipendenze tra job
  • • Trigger (orario, giornaliero, evento)

Compute

Cluster e serverless.

  • • All-purpose cluster (interattivi)
  • • Job cluster (produzione)
  • • SQL warehouse (BI)
  • • Policy dei cluster

Consumatori a valle

Dove vanno i dati dopo il processing.

  • • BI (Tableau, Power BI, Looker)
  • • Data app e API
  • • Modelli ML e feature store
  • • Export verso altri sistemi

Suggerimento

Parti semplice, poi aggiungi

Non cercare di disegnare tutto subito. Fai prima la vista high-level, poi diagrammi mirati per singoli flussi (es. "Customer 360").

3. Visualizzare l\'architettura medaglia

Bronze → Silver → Gold è il pattern chiave Databricks. Il diagramma deve renderlo immediato.

Layer Bronze: ingestion grezza

Dati come arrivano, senza trasformazioni.

Rappresentazione:

  • • Toni bronzo/rame
  • • Tabelle etichettate con la sorgente
  • • Metodo di ingestion (batch, streaming, CDC)
  • • Frequenza di carico

Layer Silver: pulito e validato

Dati puliti, deduplicati, tipizzati. Regole business applicate.

Rappresentazione:

  • • Toni argento/grigio
  • • Trasformazioni da bronze annotate
  • • Controlli qualità indicati
  • • Nota SCD se usato

Layer Gold: aggregati business

Dati pronti per analisi, denormalizzati e ottimizzati.

Rappresentazione:

  • • Toni oro/giallo
  • • Etichette per dominio (Sales, Marketing, Finance)
  • • Strumenti BI o app che consumano
  • • Frequenza di refresh e SLA

Esempio: flusso medaglia

Sources → Bronze Layer → Silver Layer → Gold Layer → Consumers
         (Raw)         (Cleaned)        (Aggregated)

kafka.orders  →  bronze.orders  →  silver.orders_clean  →  gold.daily_sales  →  Tableau
                  (append-only)     (deduped, validated)   (daily rollup)       Power BI

s3.customers  →  bronze.customers  →  silver.customers_scd  →  gold.customer_360  →  ML models
                  (raw JSON)           (Type 2 SCD)             (joined, enriched)    Data apps

4. Mostrare Unity Catalog

Unity Catalog usa un namespace a tre livelli: Catalog → Schema → Table. Mostra chiaramente questa gerarchia, soprattutto la separazione degli ambienti.

1

Livello Catalog: ambienti

Di solito per environment o business unit.

dev_catalog, staging_catalog, prod_catalog
oppure: sales_catalog, marketing_catalog, finance_catalog
2

Livello Schema: domini

Raggruppamenti logici, spesso medaglia o dominio business.

bronze, silver, gold
oppure: sales, customers, products
3

Livello Tabella

Tabelle Delta e viste che contengono i dati.

prod_catalog.gold.daily_sales
prod_catalog.silver.customers_clean
prod_catalog.bronze.raw_orders
ElementoCome mostrarloPerché conta
CatalogContainer top-level, etichetta ambienteMostra isolamento (dev vs prod)
SchemaRaggruppa visivamente le tabelle correlateEvidenzia l\'organizzazione logica
AccessoAnnotazioni o icone per chi può accedereDocumenta governance e sicurezza
LineageFrecce per le dipendenze tra tabelleCruciale per l\'analisi d\'impatto

Suggerimento

Box annidati per la gerarchia

Annida gli schemi nei cataloghi con container o sfondi colorati. È subito chiaro: prod_catalog contiene bronze/silver/gold con le rispettive tabelle.

5. Workflows e job

I Databricks Workflows orchestrano le pipeline. Mostra come i job si legano tra loro e ai dati prodotti.

Cosa includere

  • Nome job: chiaro e descrittivo
  • Scheduling: orario, giornaliero, evento
  • Dipendenze: cosa deve girare prima
  • Tabelle lette/scritte: input e output
  • Tipo di cluster: job o all-purpose

Convenzioni visive

  • Rettangoli arrotondati per i job
  • Frecce per l\'ordine di esecuzione
  • Colori per dominio o layer
  • Inserisci SLA se critici
  • Mostra parallelismo vs sequenziale

Esempio: orchestrazione

┌─────────────────────┐
│ Ingest Raw Orders   │ (Daily @ 6 AM)
│ kafka → bronze      │
└──────────┬──────────┘
           │
           ▼
┌─────────────────────┐
│ Clean Orders        │ (After ingestion)
│ bronze → silver     │
└──────────┬──────────┘
           │
           ├─────────────────────┐
           ▼                     ▼
┌──────────────────┐  ┌──────────────────┐
│ Daily Sales      │  │ Customer 360     │
│ silver → gold    │  │ silver → gold    │
└──────────────────┘  └──────────────────┘
           │                     │
           └──────────┬──────────┘
                      ▼
           ┌──────────────────┐
           │ Refresh BI Views │ (SLA: 8 AM)
           └──────────────────┘

Non dimenticare le dipendenze

L\'informazione più preziosa: quali job dipendono da altri. Quando qualcosa rompe in prod, sai subito cosa fallirà a valle e in che ordine intervenire.

6. Convenzioni visive che funzionano

La coerenza rende leggibile il diagramma. Usa queste convenzioni per far capire tutto al volo.

Forme

Rettangolo

Tabelle Delta, database

Rettangolo arrotondato

Job, workflow, processi

Cerchio/Ovale

Sorgenti esterne, consumatori

Rombo

Decisioni, logica condizionale

Colori

Bronzo/Rame

Dati grezzi, layer Bronze

Argento/Grigio

Dati puliti, layer Silver

Oro/Giallo

Aggregati business, layer Gold

Blu

Job, workflow, compute

Flusso sinistra → destra

Sorgenti a sinistra, consumatori a destra. Segue la lettura.

Raggruppa ciò che è correlato

Container o sfondi per schema, dominio o ambiente. La gerarchia visiva conta.

Etichetta tutto

Ogni tabella, job e freccia ha un label. Abbreviazioni ok con legenda.

Mostra la cardinalità

Annotazioni 1:1, 1:N, N:M sulle frecce. Fondamentale per capire la moltiplicazione dei dati.

Indica frequenza di refresh

Annota "Realtime", "Orario", "Giornaliero", "On-demand".

Legenda sempre visibile

Spiega forme, colori, simboli. Non far indovinare.

Dal campo

I migliori diagrammi seguono la "regola dei 5 secondi": una persona nuova capisce il flusso in 5 secondi. Se servono 30 secondi per capire inizio/fine, semplifica.

7. Checklist best practice

Parti dall'architettura high-level

Vista a 10.000 piedi con i blocchi principali. È il diagramma di onboarding.

Diagrammi di pipeline mirati

Scomponi la piattaforma in flussi specifici (es. "Pipeline Analytics Clienti").

Rendi chiaro il percorso medaglia

Colori distinti per Bronze → Silver → Gold. Il progresso di qualità deve essere ovvio.

Documenta Unity Catalog

Mostra gerarchia catalog/schema/tabella con container annidati.

Includi dipendenze tra job

Mostra chi dipende da chi. Critico per debug e impatto.

Etichetta con contesto

Non solo "orders_table". Meglio: "orders_table (daily, 2M righe, alimenta daily_sales)".

Versiona i diagrammi

Conserva in Git vicino al codice. Aggiorna nei PR.

Revisione trimestrale

La piattaforma evolve. Rivedi i diagrammi ogni trimestre per evitare debito.

Suggerimento

Il "test del nuovo assunto"

Mostra il diagramma a un nuovo collega e chiedi: "Se manca dato in customer_360, da dove parti?" Se non riesce a seguire la lineage in 30 secondi, serve più chiarezza.

8. Domande frequenti

Cosa deve includere un diagramma Databricks?

Sorgenti e ingestion, tabelle Delta per layer, Unity Catalog, workflow/job, cluster, notebook, consumatori e governance (accesso, lineage).

Come mostrare l\'architettura medaglia?

Tre layer separati: Bronze (grezzo), Silver (pulito), Gold (aggregato). Flusso sinistra→destra, colori bronzo/grigio/oro.

Quali strumenti usare?

Datadef, Lucidchart, draw.io, Miro o Mermaid nei notebook. Scegli in base a collaborazione e versioning.

Quanto dettaglio inserire?

Più viste: high-level, flusso bronze/silver/gold per ingegneri, pipeline dettagliate. Parti semplice, affina per l\'audience.

Serve dettaglio sul compute?

Solo high-level: job vs all-purpose cluster, SQL warehouse per BI. Niente tipi di istanza salvo discussione costi. Focus sul ruolo del compute.

Come mantenere i diagrammi aggiornati?

Salvali in Git vicino al codice. Aggiorna nel PR quando cambi la piattaforma. Pianifica review trimestrali. Usa strumenti con versioning e collaborazione.

Genera il tuo diagramma Databricks in pochi minuti

Basta con gli strumenti generici. Crea diagrammi Databricks professionali con l\'aiuto dell\'AI e componenti dedicati.