Capstone: pipeline analytics end-to-end
⏱ 20 min·⭐ 90 XP
Pré-requisitos (0/1)0%
- ⬜✅ Qualidade de dados: Great Expectations, dbt tests, Soda(Data Engineering Moderna)
Recomendamos completar os pré-requisitos antes de seguir, mas nada te impede de continuar.
Stack proposta
| Entregável | O que prova |
|---|---|
| Ingestão idempotente | Reprocessar não duplica — é o requisito que separa protótipo de produção |
| Camadas cru, limpo e modelado | Você preserva o original e pode reprocessar quando a regra mudar |
| Testes de qualidade bloqueando | Dado ruim não circula; ele para antes de virar painel |
| Orquestração com reprocessamento por período | A operação mais frequente em produção funciona |
| Linhagem documentada | Alguém consegue responder de onde veio um número do painel |
| Custo por execução medido | Você sabe o que a esteira custa por dia |
EntregávelIngestão idempotente
O que provaReprocessar não duplica — é o requisito que separa protótipo de produção
EntregávelCamadas cru, limpo e modelado
O que provaVocê preserva o original e pode reprocessar quando a regra mudar
EntregávelTestes de qualidade bloqueando
O que provaDado ruim não circula; ele para antes de virar painel
EntregávelOrquestração com reprocessamento por período
O que provaA operação mais frequente em produção funciona
EntregávelLinhagem documentada
O que provaAlguém consegue responder de onde veio um número do painel
EntregávelCusto por execução medido
O que provaVocê sabe o que a esteira custa por dia
┌─────────────┐ Debezium ┌──────────┐ dbt + Dagster ┌─────────┐
│ Postgres │ ─────────────▶ │ S3/ │ ──────────────────▶│ Iceberg │
│ OLTP (prod) │ CDC stream │ Kafka │ transform │ marts │
└─────────────┘ └──────────┘ └─────────┘
│
▼
┌──────────────┐
│ Metabase │
│ dashboards │
└──────────────┘
│
Alerts em Slack
(Great Expectations)Entregáveis
- Debezium connector Kafka Connect — config em terraform/helm
- dbt project com 3-5 staging + 2-3 marts models, tests em coluna-chave
- Dagster repo com assets, schedule diário, freshness policies
- Iceberg tables em S3, partitioned por date
- Great Expectations suite em pontos críticos (OLTP→lake)
- Metabase dashboard com 3-4 KPIs (DAU, revenue, conversão)
- Alertas: dbt test fail, freshness breach, anomalia volume → Slack
- README com arquitetura + diagrama + instruções rodar local (docker-compose)
✅
Capstone que vale portfolio real — monstra a camada inteira de data pipeline moderno. Excelente pra vagas data engineer/platform.
Quiz rápido
Qual etapa do capstone costuma revelar mais problemas escondidos?
Perguntas frequentes
❓ Por onde começar um pipeline analítico?
Pela pergunta de negócio que o pipeline precisa responder, e pelo teste de dado que garante a resposta. Começar pela ingestão produz muito dado e nenhuma resposta — é o pipeline que existe e ninguém consulta.
❓ Que erro mais aparece em pipeline de primeira vez?
Tarefa não idempotente: rodar de novo duplica dado. Reprocessamento é rotina — correção, chegada tardia, mudança de regra —, então idempotência não é refinamento, é requisito. O sintoma clássico é o número dobrar depois de uma reexecução.
❓ Como saber que o pipeline está saudável?
Por frescor, volume e teste — nessa ordem. Frescor diz se rodou, volume diz se veio tudo, teste diz se veio certo. Painel que mostra só execução com sucesso esconde o caso pior: rodou, terminou e trouxe metade do dado.
Fixando
Quiz rápido
Por que o capstone exige testes sobre os dados, e não só sobre o código?
Quiz rápido
Qual entregável demonstra maturidade além do pipeline funcionando?
Terminou de ler?
Marcar como concluído registra o XP, mantém sua sequência e coloca 3 cartas deste módulo na fila de revisão espaçada.
Próximos passos sugeridos
Temas deste módulo
Discussão
Carregando comentários…