Capstone: plataforma MLOps ponta a ponta
- ⬜🚦 CI/CD para modelos + monitoring drift(MLOps — ML em produção)
Recomendamos completar os pré-requisitos antes de seguir, mas nada te impede de continuar.
Projeto proposto
| Entregável | O que prova |
|---|---|
| Esteira de treino disparada por commit | O treino é reproduzível e automatizado |
| Avaliação bloqueando a promoção | Modelo pior não chega a produção |
| Publicação em sombra e depois em fatia | Você sabe que verificação de saúde não mede qualidade |
| Reversão automática por métrica | Não depende de alguém perceber |
| Monitor de desvio de entrada | Você sabe que o conjunto de teste envelhece |
| Linhagem completa de uma predição | Dado uma resposta, você chega ao modelo, ao conjunto e ao commit |
Escolha um caso de uso concreto (churn, fraude, recomendação, previsão de demanda ou propensão a compra) e construa a plataforma MLOps que serviria esse caso em produção real. Pense como engenheiro responsável por operar o sistema por 12 meses — não como estudante entregando tarefa.
Entregáveis
# capstone — entregaveis minimos
repo:
- infra/terraform: modulos para eks + s3 + rds mlflow + ecr
- feature_store/: feast feature definitions + feature_store.yaml
- pipelines/: kubeflow ou airflow (training + eval + register)
- serving/: triton model_repository OU bentoml service
- monitoring/: evidently jobs + grafana dashboards as code
- ci_cd/: .github/workflows/ (model-ci, serving-deploy, infra-plan)
- docs/
- README.md (visao geral + diagrama c4)
- ADRs/ (decisoes: feast vs tecton, triton vs bentoml, etc)
- runbook.md (on-call, rollback, drift response)
- cost_report.md (USD/mes por componente, projecao 10x)
evidencia:
- mlflow_live_url: http://...
- grafana_dashboard_url: http://...
- video_demo: 5 min mostrando deploy progressivo
- drift_event_screenshot: retraining disparado por drift realArquitetura de referência
# diagrama logico do stack capstone
sources:
- postgres_prod (CDC via debezium)
- events_kafka
offline_store: snowflake | bigquery
online_store: redis cluster
feature_store: feast (registry em s3)
orchestration: kubeflow pipelines em eks
tracking_registry: mlflow (rds postgres + s3 artifacts)
data_versioning: dvc (remote em s3)
serving: triton inference server (gpu nodegroup)
gateway: api gateway -> alb -> triton
monitoring:
data_drift: evidently jobs agendados
model_quality: metrics em prometheus
business_metrics: dashboard em grafana
tracing: opentelemetry -> tempo
ci_cd: github actions + argo rollouts
iac: terraform + helmQual entregável do capstone tem mais valor prático numa organização real?
Milestones sugeridos (4 semanas)
# plano de execucao
## Semana 1 — Fundacao
- Terraform: eks + s3 + rds mlflow
- Feast com 1 feature view real
- MLflow self-hosted acessivel
- CI basico (lint + test + dvc pull)
## Semana 2 — Pipeline + Registry
- Kubeflow pipeline: features -> train -> eval -> register
- Eval em golden set curado
- Gate estatistico vs baseline no CI
- Primeira ModelVersion em Staging
## Semana 3 — Serving + Monitoring
- Triton config.pbtxt com dynamic batching
- Deploy progressivo via argo rollouts
- Evidently agendado (data drift + target drift)
- Dashboard grafana com 5 paineis-chave
## Semana 4 — Hardening + writeup
- Runbook de on-call (rollback em 5 min)
- Teste de chaos: matar pod de serving, validar
- ADRs escritos (3 decisoes grandes)
- Cost report honesto em USD/mes
- Video demo 5 min + blog postRubrica de avaliação
# rubrica portfolio-grade
[ ] Feature store em uso real (nao mock), com point-in-time join demonstrado
[ ] MLflow com >= 10 runs reais e pelo menos 1 modelo em Production
[ ] Pipeline reproduzivel de ponta a ponta (comando unico)
[ ] Serving com dynamic batching e p99 medido sob carga
[ ] DVC versionando dataset e model em storage remoto
[ ] Drift detection disparando PR de retraining automaticamente
[ ] CI/CD falhando corretamente quando metrica regride
[ ] Terraform aplicando infra do zero em ambiente limpo
[ ] Cost report em USD/mes + projecao de 10x tráfego
[ ] ADRs explicando trade-offs (minimo 3 decisoes)
[ ] Runbook de on-call testado (rollback em < 5 min)
[ ] Writeup honesto: o que nao funciona, o que ficaria para v2Esse capstone é o portfolio que abre conversa sênior em MLE/ML Platform. Entrega mostra que o autor pensa em operação, custo e risco — não só em treinar modelo bonito. É o nível que vale entre R$ 25k e R$ 45k/mês em 2026 no mercado brasileiro, e 150-250k USD em remoto.
Perguntas frequentes
❓ O que uma plataforma de MLOps precisa entregar?
❓ Construir ou usar plataforma gerenciada?
❓ Como saber se a plataforma está sendo usada?
Fixando
Por que a plataforma precisa cobrir o caminho de volta, e não só o de ida?
Qual critério de avaliação separa uma entrega madura de uma demonstração?
Terminou de ler?
Marcar como concluído registra o XP, mantém sua sequência e coloca 3 cartas deste módulo na fila de revisão espaçada.
Próximos passos sugeridos
Temas deste módulo
Discussão
Carregando comentários…