Guia de arquitetura GCP

Como criar um diagrama de data platform GCP

Um bom diagrama diferencia uma plataforma que escala de outra que vira um pesadelo de manutenção. Este guia mostra como documentar GCP de forma clara e acionável.

18 min de leituraPara data engineers e arquitetosExemplos 100% GCP

1. Por que diagramas GCP importam

Sua data platform GCP é invisível. Os serviços vivem na nuvem, os dados fluem por APIs, as falhas são silenciosas. Um bom diagrama torna visíveis fluxos, storage e acessos.

O custo da pouca documentação

Sem diagramas claros os times gastam 40% do tempo entre Console, IAM e jobs Dataflow/BigQuery. São 16 horas/semana de um sênior desperdiçadas em arqueologia.

Um bom diagrama GCP traz três benefícios:

Debug rápido

Se faltam dados, o diagrama indica buckets, jobs Dataflow e tabela BigQuery para checar.

Onboarding rápido

Novos membros entendem a plataforma em 30 minutos em vez de 3 meses. Mostre o diagrama, não só Terraform.

Security review

Auditoria e segurança enxergam limites IAM, VPC Service Controls e padrões de acesso de imediato.

Do campo

Já vi times onde a "doc" era abrir a console. Semanas perdidas. Com um diagrama claro fiquei produtivo no dia um. Documentação não é overhead: é velocidade.

2. Serviços de dados GCP chave

A GCP tem mais de 100 serviços, mas plataformas modernas usam um núcleo de 8-12. Veja o que fazem e quando colocá-los no diagrama.

Cloud Storage

Storage

Armazenamento de objetos para o data lake. Guarda dados brutos, processados e curados.

Use quando: precisa reter muito dado. Organize com prefixos: gs://bucket/raw/, processed/, curated/

BigQuery

Warehouse

Warehouse serverless, escala automática, SQL rápido, integração ML.

Use quando: analytics ativo, BI, treinamento de ML. Carregue dados para performance ou use tabelas externas no Cloud Storage.

Dataflow

Stream + Batch

Processamento unificado stream/batch com Apache Beam. Autoscaling, serverless.

Use quando: streaming, janelas, transformações complexas. Escreva Beam uma vez e rode em stream ou batch.

Pub/Sub

Messaging

Serviço de mensageria para arquiteturas event-driven. Desacopla produtores e consumidores com entrega garantida.

Use quando: ingestão em tempo real, eventos de app/IoT, microserviços. Combine com Dataflow para stream.

Cloud Composer

Orquestração

Airflow gerenciado para orquestrar pipelines. Agendamento, monitoramento, dependências.

Use quando: DAGs complexos, batch agendado, coordenação de múltiplos serviços.

Dataproc

Spark/Hadoop

Clusters Spark/Hadoop gerenciados. Provisionamento rápido, integração com Cloud Storage.

Use quando: jobs Spark existentes, ML pesado, necessidade de controle de cluster. Muitas vezes mais barato que Dataflow em batch longos.

ServiçoCategoriaCaso principalPreço
Cloud StorageStorageData lake, arquivosPor GB
BigQueryWarehouseAnalytics, BI, MLPor TB lido
DataflowProcessamentoETL, streamingPor vCPU hora
Pub/SubMensageriaEvent streamingPor GB
Cloud ComposerOrquestraçãoGestão de workflowsPor environment
DataprocProcessamentoSpark/HadoopPor vCPU hora

3. Padrões arquiteturais GCP

Muitas plataformas GCP seguem estes padrões testados. Escolha conforme latência, volume de dados e skills do time.

Padrão 1: BigQuery-cêntrico (recomendado)

Analytics simples, barato, serverless

Fontes → Cloud Functions → Cloud Storage (staging) → BigQuery → Looker/Data Studio

Ideal para:

  • • a maioria dos workloads de analytics
  • • times sem skill Spark
  • • budget contido
  • • time-to-value rápido

Serviços chave:

  • • Cloud Storage (raw)
  • • BigQuery (warehouse)
  • • Cloud Functions (ETL leve)
  • • Cloud Scheduler (orquestração)

Pró: Operação mínima. BigQuery cuida de scaling e otimização. Muito econômico abaixo de 1TB/dia.

Padrão 2: Streaming com Dataflow

Tempo real para arquiteturas event-driven

Fontes → Pub/Sub → Dataflow → BigQuery + Cloud Storage → Consumidores

Ideal para:

  • • dashboards em tempo real
  • • arquiteturas event-driven
  • • dados IoT/sensores
  • • lógicas de janela complexas

Serviços chave:

  • • Pub/Sub (ingestão)
  • • Dataflow (transformação)
  • • BigQuery (serving)
  • • Cloud Monitoring (observabilidade)

Pró: Baixa latência, mesmo código para batch e stream, escala automático.

Padrão 3: Data lake em medalhões

Multi-zona para grandes batches

Fontes → Cloud Storage Bronze → Dataproc → Silver → Gold → BigQuery

Ideal para:

  • • batch em larga escala
  • • pipelines Spark existentes
  • • feature engineering complexo
  • • otimização de custo em grandes volumes

Camadas:

  • • Bronze: dados brutos
  • • Silver: limpos/conformes
  • • Gold: agregados de negócio
  • • BigQuery: camada de consulta

Nota: Mais esforço operacional. Escolha Dataflow se não tem skill Spark ou se precisa de streaming.

Padrão 4: Modern data stack com dbt

ELT com transformação no warehouse

Fontes → Fivetran/Airbyte → BigQuery (raw) → dbt (transformação) → BigQuery (mart)

Ideal para:

  • • integração de dados SaaS
  • • times de analytics engineering
  • • transformações SQL-first
  • • modelos versionados

Ferramentas chave:

  • • Fivetran (EL)
  • • dbt (transformação)
  • • BigQuery (compute + storage)
  • • Looker (BI)

Pró: Setup rápido, ótimo para times de analytics. Zero infraestrutura para gerenciar. Transformações versionadas.

Escolha do padrão

Comece pelo padrão BigQuery-cêntrico se não tiver requisitos especiais. É o mais simples e econômico. Adicione Dataflow, Dataproc ou dbt apenas quando precisar de streaming, Spark ou lógica avançada.

4. Processo de design passo a passo

Como desenhar um diagrama GCP que realmente ajuda o time a operar.

1

Mapeie as fontes

Liste todas as fontes. Especifique se é API, réplica de DB, file drop ou stream de eventos.

Exemplos:

  • • PostgreSQL (Cloud SQL) - réplica com Datastream
  • • API Salesforce - polling a cada hora via Cloud Functions
  • • Eventos web - streaming via Pub/Sub
  • • CSV - drop em bucket Cloud Storage
2

Defina a ingestão

Como os dados entram na GCP? Combine método e tipo de fonte.

Árvore de decisão:

  • Eventos em tempo real? → Pub/Sub
  • Polling de API? → Cloud Functions + Scheduler
  • Réplica de DB? → Datastream
  • Conectores SaaS? → Fivetran/Airbyte
3

Desenhe o storage

Organize os buckets Cloud Storage por maturidade. Coloque os nomes no diagrama.

Estrutura de buckets:

  • • gs://company-data-raw/ - origem imutável
  • • gs://company-data-staging/ - transformações intermediárias
  • • gs://company-data-curated/ - pronto para analytics
  • • gs://company-data-archive/ - arquivo
4

Modele a transformação

Mostre como os dados são limpos, unidos, agregados. Inclua nomes de jobs e agendamentos.

Opções:

  • BigQuery scheduled queries - SQL simples
  • Jobs Dataflow - ETL complexo/stream
  • Modelos dbt - SQL versionado
  • Jobs Dataproc - Spark/PySpark
5

Defina a camada de serving

Onde os consumidores interagem? Nomeie datasets e padrões de tabelas.

Datasets BigQuery:

  • • project.raw_data - réplicas de origem
  • • project.staging - modelos intermediários
  • • project.analytics - tabelas de BI
  • • project.ml_features - dados de treinamento
6

Adicione orquestração e monitoramento

Mostre agendamento e monitoramento. Para onde vão os alertas?

Componentes chave:

  • • DAGs Cloud Composer para workflows complexos
  • • Cloud Scheduler para crons simples
  • • Cloud Monitoring para métricas/alertas
  • • Cloud Logging para debug de pipeline
7

Documente os padrões de acesso

Mostre quem consome e como. Inclua service accounts e papéis IAM quando relevante.

Tipos de consumidores:

  • • Dashboards Looker/Data Studio
  • • Modelos de ML (Vertex AI)
  • • Reverse ETL para sistemas operacionais
  • • APIs de dados para aplicações

5. Boas práticas de diagrama

Um diagrama só é útil se for usado. Siga estes princípios para mantê-lo vivo.

Use nomes reais

Não escreva "BigQuery Dataset". Escreva "analytics_prod" para achá-lo na console.

✅ gs://company-data-raw/
❌ Cloud Storage Bucket

Mostre a direção do fluxo

As setas importam. Indique claramente para onde os dados vão.

Source → Pub/Sub → Dataflow → BigQuery

Indique as janelas

Anote jobs batch: "todo dia às 2" ou "a cada 15 min" define a frescura.

Job Dataflow: sales_etl (a cada hora)

Agrupe por camada

Ingestão, storage, transformação, serving: agrupe para deixar o diagrama fácil de escanear.

Use camadas horizontais ou cores

Destaque percursos críticos

Realce pipelines que alimentam dashboards executivos. Quando quebram, todos olham.

Use linhas bold ou ⚠️ para SLA

Versione os diagramas

Coloque uma data. `Atualizado dez $2026` mostra frescor.

Salve no Git junto da infra

Erros comuns

  • • Rótulos genéricos em vez de nomes reais
  • • Mostrar todas as tabelas em vez dos fluxos chave
  • • Misturar vista lógica e física
  • • Esquecer de atualizar após mudanças de infra

Do campo

Os melhores diagramas abrem durante um incidente. Se o time consulta para debugar, você venceu. Se abre direto a console, falta detalhe.

6. Ferramentas para criar diagramas GCP

FerramentaUso idealÍcones GCPColaboraçãoPreço
DatadefDiagramas focados em dados✅ Built-in✅ Tempo realFree tier
LucidchartArquitetura geral✅ Biblioteca oficial✅ Excelente$7.95/mês
Draw.ioDiagramas simples✅ Importa biblioteca⚠️ BásicaGrátis
MiroWorkshops, brainstorming⚠️ Manual✅ Ótimo para time$8/mês
Google SlidesRascunhos rápidos❌ Nenhum✅ Compartilhamento fácilGrátis

Ícones oficiais GCP

A Google fornece conjuntos de ícones para diagramas. Ícones consistentes deixam o desenho imediato.

Baixar ícones GCP →

Diagram-as-code

Se prefere código, a biblioteca Diagrams (Python) gera esquemas a partir de código.

Veja a biblioteca Diagrams →

7. Checklist do diagrama GCP

Fontes rotuladas claramente

Nome do sistema, frequência, método (API, Pub/Sub, file drop).

Método de ingestão explícito

Pub/Sub para streaming, Cloud Functions para polling, Datastream para réplica.

Buckets com nomes reais

gs://company-data-raw, não "Cloud Storage Bucket".

Jobs de transformação com schedule

Dataflow por hora, dbt todo dia às 3—cadência visível.

Datasets BigQuery nomeados

project.raw_data, project.analytics—não só "BigQuery".

Direção do fluxo clara

Setas nítidas origem → transformação → destino.

Limites IAM visíveis

Service accounts e acessos destacados.

Monitoring e alertas inclusos

Para onde vão logs e alertas no Cloud Monitoring.

Percursos críticos destacados

Pipelines para dashboards executivos ou SLA.

Diagrama datado/versionado

Último update: dez 2026. No Git.

Pro Tip

O teste do "novo contratado"

Mostre o diagrama a alguém novo: "Onde você olharia se este dashboard parasse?" Se responder em 30 segundos, o diagrama está bom. Se pedir contexto, adicione detalhe.

8. FAQ

Quais serviços-chave preciso para uma data platform GCP?

Cloud Storage, BigQuery, Dataflow, Pub/Sub, Cloud Composer, Dataproc, Data Catalog.

O que é arquitetura de medalhões?

Bronze (bruto) → Silver (limpo) → Gold (agregado) no Cloud Storage, movido por Dataflow/Dataproc, consultas no BigQuery.

Cloud Storage ou BigQuery?

Cloud Storage para bruto/arquivo; BigQuery para analytics ativo. Ingest → transformar → carregar no BigQuery.

Como documento o fluxo de dados GCP?

Origem → ingestão (Pub/Sub/Cloud Functions/Dataflow) → storage (buckets por zona) → transformação (Dataflow/Dataproc) → serving (BigQuery) → consumidores (Looker/Data Studio/ML). Com nomes de buckets, IDs de dataset, jobs.

Melhor Dataflow ou Dataproc?

Dataflow para streaming, batch/stream unificado, menos operação. Dataproc para jobs Spark existentes, controle de cluster, ML pesado. Dataflow é mais simples; Dataproc costuma ser mais barato em batch longos.

Com que frequência atualizar o diagrama?

Sempre que adicionar/remover serviços ou mudar fluxos críticos. Faça uma revisão trimestral e mantenha no Git junto da infra.

Construa seu diagrama de dados GCP

Crie diagramas claros da sua plataforma GCP com BigQuery, Cloud Storage, Dataflow e todos os serviços chave. Em poucos minutos.