AWS Architektur Guide

So erstellst du ein AWS Data Platform Diagramm

Ein gutes Diagramm trennt skalierende Plattformen von Wartungs-Albtraeumen. Dieser Guide zeigt, wie du AWS-Datenplattformen so dokumentierst, dass Teams sie verstehen und betreiben.

18 Min. LesezeitFuer Data Engineers & Architekten100% AWS-Beispiele

1. Warum AWS-Diagramme zaehlen

Deine AWS-Datenplattform ist unsichtbar. Services laufen in der Cloud, Daten fließen via APIs, Ausfaelle passieren leise. Ein gutes Diagramm macht das Unsichtbare sichtbar—zeigt Fluesse, Speicherorte und Zugriff.

Die Kosten schlechter Dokumentation

Ohne klare Diagramme verbringen Teams 40% der Zeit mit CloudFormation-YAML, S3-Policies und Glue-Jobsuche. Das sind 16 Stunden pro Woche Seniorzeit fuer Archäologie.

Ein gutes AWS-Diagramm liefert drei Effekte:

Schnelleres Debugging

Wenn Daten fehlen, zeigt das Diagramm genau Bucket, Glue-Job und Redshift-Tabelle. Kein Raten.

Onboarding

Neue verstehen die Plattform in 30 Minuten statt 3 Monaten. Zeig das Diagramm, nicht nur die Konsole.

Security Review

Auditoren sehen IAM-Grenzen, Verschluesselung und Netzwerk-Isolation auf einen Blick.

Aus der Praxis

Ich kam in Teams mit Doku "schau in die Konsole". Wochen bis zum Verstehen. Teams mit klaren Diagrammen? Produktiv am ersten Tag. Doku ist keine Last—sie ist Speed.

2. Zentrale AWS-Datenservices

AWS hat 200+ Services, aber moderne Plattformen nutzen einen Kern von 10-15. So funktionieren sie und so setzt du sie im Diagramm ein.

Amazon S3

Storage

Objektspeicher fuer den Data Lake. Haelt rohe, verarbeitete und kuratierte Daten in jeder Groesse.

Nutze wenn: du Daten jeder Menge speichern musst. Organisiere mit Prefixen: s3://bucket/raw/, processed/, curated/

AWS Glue

ETL + Katalog

Serverless ETL fuer Transformation. Glue Data Catalog liefert Tabellen-Metadaten.

Nutze wenn: Batch-Pipelines ohne Echtzeit. Glue Crawler entdecken Schemas in S3 automatisch.

Amazon Athena

Query

Serverlose SQL-Queries auf S3. Pay-per-Query, kein Cluster.

Nutze wenn: Ad-hoc-Analyse, Exploration, kostensensitiv. Arbeitet mit Glue Catalog.

Amazon Redshift

Warehouse

Spaltenorientiertes Warehouse fuer BI und Analytics. Optimiert fuer komplexe Queries und Dashboards.

Nutze wenn: High-Performance-Dashboards, vorhersehbare Workloads, komplexe Joins.

Amazon Kinesis

Streaming

Echtzeit-Streaming. Kinesis Data Streams fuer Custom-Apps, Firehose fuer direkte Lieferung nach S3/Redshift.

Nutze wenn: Real-time-Ingestion (Clickstream, IoT, Logs). Firehose fuer einfachen S3-Weg.

AWS Lambda

Compute

Serverlose Funktionen getriggert von Events (S3 Uploads, Kinesis Streams, Schedules).

Nutze wenn: leichte Transformationen, File-Processing, API-Calls. Guenstiger als Glue fuer kleine Lasten.

ServiceKategoriePreismodellWann nutzen
S3StoragePro GBImmer (Basis des Data Lake)
GlueETLPro DPU-StundeBatch >5 Min
LambdaComputePro InvocationEvent-driven, <15 Min
AthenaQueryPro TB ScanAd-hoc, Exploration
RedshiftWarehousePro Node-StundeHigh-Perf Dashboards
KinesisStreamingPro Shard-StundeReal-time Ingestion

3. Haeufige AWS-Architektur-Patterns

Starte nicht bei Null. Diese bewaehrten Muster decken 90% der Faelle. Waehle eins, passe es an, dann diagrammiere.

Pattern 1: Medaillon Data Lake

Das haeufigste Muster. Daten gehen durch drei Qualitaetszonen: Bronze (roh), Silver (bereinigt), Gold (aggregiert).

Architekturfluss:

Bronze: S3 Raw-Bucket → Glue Crawler → Athena Queries
Silver: Glue ETL → S3 Processed → Parquet partitioniert
Gold: Aggregationen → Redshift Spectrum oder Athena → BI

Ideal fuer: Teams, die klare Qualitaetsgrenzen und flexible Nutzung (Athena + Redshift lesen Gold) wollen.

Pattern 2: Streaming + Batch Hybrid

Echtzeit-Ingestion plus Batch-Verarbeitung. Kombiniert Geschwindigkeit und Robustheit.

Architekturfluss:

Streaming: Kinesis Data Streams → Lambda/Kinesis Analytics → S3
Batch: geplante Glue Jobs → Transform + Aggregation → Redshift
Serving: Redshift fuer Dashboards + Athena fuer Exploration

Ideal fuer: Echtzeit-Dashboards (Streaming) + historische Analyse (Batch). Typisch in E-Commerce und SaaS.

Pattern 3: Serverless Analytics

Voll serverlos ohne Cluster-Management. Kosteneffizient bei unvorhersehbaren oder niedrigen Lasten.

Architekturfluss:

Ingestion: API Gateway + Lambda → S3 Raw
Transformation: S3 Event → Lambda → Parquet in S3
Query: Athena + QuickSight (kein Redshift-Cluster)

Ideal fuer: Startups, Kostenbewusste, unregelmaessige Workloads.

Pro Tipp

Starte mit Medaillon, erweitere spaeter

Das Medaillon-Muster gibt klare Zonen fuer Debug und Qualitaet. Streaming kannst du spaeter addieren. Wer komplex startet, bereut es im Debug.

4. Design-Prozess Schritt fuer Schritt

Befolge diese Schritte fuer ein praezises, lesbares Diagramm. Starte simpel, fuege dann Detail hinzu.

1

Quellen und Konsumenten mappen

Beginne an den Grenzen. Welche Daten kommen rein, wohin gehen sie? Liste: DBs, APIs, Files, SaaS. Liste Konsumenten: Dashboards, ML, Ops-Apps.

Aktion: Zeichne Boxen fuer Quellen (links) und Konsumenten (rechts).

2

Storage-Layer definieren

Lege S3-Bucket-Struktur fest. Ueblich: raw/, processed/, curated/ oder bronze/, silver/, gold/.

Aktion: Fuege S3-Buckets in der Mitte hinzu. Prefixe klar labeln.

3

Ingestion-Pfade einzeichnen

Wie kommen Daten nach S3? Optionen: DMS, Lambda, Glue, Kinesis Firehose, Airbyte/Fivetran.

Aktion: Pfeile von Quellen zu S3 raw. Mit Servicenamen beschriften.

4

Transformationsfluesse mappen

Wie wird roh zu sauber? Meist Glue-Jobs oder Lambda. Inkludiere Jobnamen, Trigger (Schedule/Event), Output (Parquet/CSV).

Aktion: Glue/Lambda zwischen S3-Layern, Progression zeigen.

5

Serving-Layer ergaenzen

Wie fragen Konsumenten ab? Athena fuer ad hoc, Redshift fuer Dashboards, Spectrum fuer Hybrid. Zeige exponierte Tabellen/Views.

Aktion: Athena/Redshift platzieren, Pfeile zu Konsumenten.

6

Governance und Security einbinden

Zeige IAM-Rollen, Verschluesselung (S3 SSE, Redshift), VPC-Grenzen, CloudTrail-Logs.

Aktion: KMS-Keys, IAM-Rollennamen, VPC-ID annotieren.

7

Metadaten und Monitoring ergaenzen

Dokumentiere: Glue Catalog Tabellen, CloudWatch Alarme, Step Functions Workflows, Data-Quality Checks.

Aktion: Tabellennamen, Alarm-Schwellen, SNS Topics notieren.

Aus der Praxis

Ich starte mit Whiteboard-Skizze im Team. Erst Einigkeit ueber den Flow, dann schoen machen. 30 Minuten Whiteboard sparen Stunden Rework.

5. Diagramm Best Practices

Ob ein Diagramm genutzt wird, entscheiden Details. Mach Diagramme, die Teams wirklich verwenden.

Das tun

  • Echte Resourcennamen: "s3://prod-raw-data" statt "Raw Bucket"
  • Formate zeigen: Parquet, JSON, CSV, Avro
  • IAM-Rollen angeben fuer Security-Review
  • Partition Keys labeln: year/month/day, user_id, region
  • Datenvolumen schaetzen: 10 GB/Tag, 1M Zeilen/Stunde
  • SLA/Plan nennen: stündlich, taeglich 3 AM UTC, event-driven
  • Repo-Links: GitHub-Links zu Glue-Jobs

Das vermeiden

  • • Generische Labels wie "Datenbank" oder "ETL"
  • • Jede Tabelle einzeln (gruppiere verwandte)
  • • Fehlende Pfeile (Richtung?)
  • • Veraltete Diagramme (abgleichen oder loeschen)
  • • Statische PDFs ohne Editierbarkeit
  • • Fehlende Security-Zonen (VPC, Verschluesselung, IAM)
  • • Kein Owner/Kontakt

Layering-Strategie fuer komplexe Diagramme

🌐

Layer 1: High-Level

10k-ft View: Quellen → Data Lake → Serving → Konsumenten. Fuer Execs und Neue.

🔧

Layer 2: Logisch

Service-Detail: konkrete S3-Buckets, Glue-Jobs, Redshift-Cluster. Fuer Data Engineers.

⚙️

Layer 3: Physisch

Ressourcen-IDs, IAM-ARNs, VPC-Details, CloudWatch-Alarmnamen. Fuer Debug/Ops.

Pro Tipp

Eine Quelle der Wahrheit

Speichere Diagramme dort, wo dein Code lebt (GitHub/GitLab) oder in Tools mit Versionierung (Lucidchart, Miro). Keine statischen PDFs in Confluence—sie sind sofort veraltet.

6. Tools fuer AWS-Diagramme

ToolAm besten fuerAWS-IconsKollaborationPreis
DatadefKI-generierte Diagramme✅ Vollstaendige BibliothekEchtzeitFree + Pro
LucidchartProfessionelle Diagramme✅ Offizielle IconsGut$8-30/Monat
draw.ioKostenlos & flexibel✅ Bibliothek importierbarBasicGratis
MiroBrainstorming⚠️ Manueller ImportExzellentFree + bezahlt
CloudCraftAWS-spezifisch 3D✅ NativeBasicFree + Pro
Terraform GraphIaC auto-generiert✅ Aus CodeGit-basiertGratis

Manuelles Diagramming

Du baust das Diagramm selbst mit Drag-and-Drop-Tools.

Ideal fuer: massgeschneiderte Diagramme, Praesentationen, praezise Layout-Kontrolle.

KI-generiert

Beschreibe deine Architektur in Text, die KI baut das Diagramm.

Ideal fuer: schnelle Entwuerfe, Onboarding, schnelles Iterieren.

7. AWS Diagramm-Checklist

Klare Flussrichtung

Pfeile links→rechts oder oben→unten. Keine Zyklen ausser gewollte Feedback-Loops.

Echte Resourcennamen

Nutze reale S3-Bucket-Namen, Glue-Job-Namen, Redshift-Cluster-IDs. Macht das Diagramm operativ.

Security-Grenzen markiert

Zeige VPC, IAM-Rollen, Verschluesselung (KMS), Netzwerk-Isolation. Kritisch fuer Audits.

Datenformate angegeben

Label Parquet, JSON, CSV, Kompression (Snappy, Gzip), Partition-Schemata.

Verarbeitungsplaene genannt

Event-driven, stuendlich, taeglich 3 AM UTC. Hilft bei Debug von Verzoegerung.

Volumen & Skalierung

Füge Datenvolumen (GB/Tag, Zeilen/sec) und Query-Konkurrenz hinzu. Hilft Kapazitaetsplanung.

Monitoring & Alerts

Zeige CloudWatch-Alarme, SNS Topics, Trigger (Job-Fail, Data Quality, Latenz).

Version & Owner

Datum des Diagramms, Kontakt, Runbook-Link. Verhindert "ist das aktuell?".

Pro Tipp

Teste mit neuen Kolleg:innen

Wenn neue Leute den Flow in 15 Minuten nicht verstehen, ist es zu komplex oder zu vage. Vereinfachen oder Layer hinzufuegen. Die besten Diagramme sind selbsterklaerend.

8. Haeufig gestellte Fragen

Welche Kern-Services braucht eine AWS-Datenplattform?

S3 (Data Lake), AWS Glue (ETL + Katalog), Athena (SQL serverless), Redshift (Warehouse), Kinesis (Streaming), Lambda (Compute), Step Functions (Orchestrierung).

Was ist die Medaillon-Architektur?

Drei S3-Layer: Bronze (roh), Silver (bereinigt), Gold (aggregiert). Klare Qualitaetsstufen und getrennte Verantwortlichkeiten.

Redshift oder Athena fuer Analytics?

Athena fuer Ad-hoc/Exploration (pay per query). Redshift fuer performante Dashboards, komplexe Joins, stabile Volumina. Viele nutzen beides.

Wie dokumentiere ich Datenfluesse?

Quellen → Ingestion (Kinesis/Lambda/Glue) → Storage (S3 nach Zone) → Transformation (Glue/EMR) → Serving (Redshift/Athena) → Konsumenten (Dashboards/ML). Bucket-Namen, IAM-Rollen, Glue-Jobs angeben.

Wie oft aktualisieren?

Bei neuen Quellen, Storage-Aenderungen, ETL-Anpassungen oder neuen Security-Controls. Behandle Diagramme als Living Doc—vierteljaehrlich pruefen, nach grossen Aenderungen sofort updaten.

Kostenabschaetzung aufnehmen?

Ja, fuer Budget-Gespraeche. Notiere: S3-Kosten, Glue DPU-Stunden, Redshift Node-Stunden, Athena Scan-Kosten. Hilft Kosten zu verstehen und Optimierung zu priorisieren.

Erstelle dein AWS Data Platform Diagramm

Beschreibe deine AWS-Architektur in Alltagssprache und erhalte in Sekunden ein professionelles Diagramm. Kein manuelles Zeichnen.