Cost optimization avançado: rightsizing, purchasing, monitoring
- ⬜🔭 Observability enterprise: CloudWatch, X-Ray, OpenSearch(AWS Solutions Architect Professional (SAP-C03))
Recomendamos completar os pré-requisitos antes de seguir, mas nada te impede de continuar.
Os 3 alavancas principais
1. Rightsizing (corta desperdício):
Compute Optimizer recommendations (EC2, Lambda, EBS, RDS)
EBS gp2 → gp3 (mesma perf, 20% mais barato)
S3 Intelligent-Tiering (auto move entre tiers)
Idle resource cleanup (EIPs não-attached, snapshots órfãos)
2. Purchasing (comprar certo):
Reserved Instances (DB/cache onde standard faz sentido)
Savings Plans (Compute, EC2, SageMaker)
Spot (batch, stateless worker, ML training)
Enterprise Discount Program (EDP) com AWS direto
3. Architecture (consumir menos):
Graviton (ARM) ~40% melhor price/perf
Serverless quando tráfego variável
S3 Lifecycle policies (Standard → IA → Glacier)
CloudFront caching (menos origin hits)
Data transfer optimization (VPC endpoints, same-AZ)- → alimenta
- → onde está o gasto
- → só depois de otimizar
- → alerta
- Armazenamento
- Gestão e governança
- Segurança e identidade
- Compute
Cinco estágios em ordem rígida. A questão de SAP quase sempre testa a ORDEM: comprar compromisso antes de eliminar desperdício é a alternativa tentadora e errada.
- A ordem é obrigatória. Medir, atribuir, eliminar desperdício, e só então comprometer. Comprar Savings Plans antes de fazer rightsizing significa se comprometer com capacidade que você não deveria estar usando — erro caro e de longo prazo.
- Sem atribuição não há responsabilidade. Tag de alocação obrigatória por SCP ou Tag Policy, mais Cost Categories agrupando em centro de custo. Enquanto o custo é "da AWS" e não "do time X", ninguém otimiza.
- Desperdício antes de desconto. Compute Optimizer aponta instância superdimensionada com base em métrica real. Depois vêm os órfãos: EIP não associado, volume EBS sem instância, snapshot de anos atrás. E lifecycle no S3 para dado que ninguém lê.
- Comprometa o que já se conhece. Savings Plans de compute é o mais flexível — vale para EC2, Fargate e Lambda. RI para RDS, ElastiCache e Redshift. Spot para batch e processamento tolerante a interrupção. Cada um cobre uma parte diferente.
- Prevenir é mais barato que explicar. Budgets com alerta por conta e por tag, mais Cost Anomaly Detection para variação fora do padrão. Descobrir estouro na fatura do mês seguinte é tarde — o dinheiro já saiu.
Onde isso entra no exame
Otimizar aqui é sobre workload existente, e a restrição costuma ser "sem mudar a aplicação". Compute Optimizer para rightsizing com dado real, Savings Plans em vez de Reserved Instances quando a família de instância pode mudar, S3 Intelligent-Tiering quando o padrão de acesso é desconhecido.
Automação de cleanup
Cost leaks típicos: EBS snapshots antigos órfãos, EIPs não-associados (cobram quando idle), NAT Gateways desnecessários (um por VPC em vez de por AZ), volumes EBS unattached, Load Balancers sem target, RDS stopped 7+ dias (AWS reinicia e cobra). Automatize via Lambda + EventBridge scheduled + Tag-based rules.
# Pipeline automatizado de cleanup
EventBridge (cron weekly)
↓
Lambda cost-cleanup:
- Lista EBS snapshots idade > 90d sem tag "retain"
- Lista EIPs idle (não-associated)
- Lista RDS stopped 6 dias
- Gera report SNS + Slack
- Aguarda approval (Step Functions)
- Deleta após approval
# Trusted Advisor (Business/Enterprise Support)
# roda checks: Low Utilization EC2, Idle RDS, unused EIP
# integra com Security Hub + EventBridgeQual é a ordem correta das ações de otimização de custo em escala?
Portfolio de commitments
Mix saudável em org AWS madura: 60-70% cobertura por Savings Plans/RIs, 10-20% Spot (onde possível), 10-20% on-demand (pra spikes imprevistos). Revisão mensal olhando Cost Explorer Coverage + Utilization reports. Compra incremental (1yr no-upfront pra preservar cash flow, 3yr all-upfront só em baseline cristalizado).
Receita de 20-40% de redução em org típica: Compute Optimizer (rightsizing) + Compute SP 1yr (baseline estável) + Spot em workers batch + Graviton em stacks compatíveis + S3 Lifecycle + auto-cleanup de recursos órfãos + Reserved DB. Em 3-6 meses, economia compensa salário de FinOps engineer dedicado.
Perguntas frequentes
❓ Qual a ordem certa para otimizar custo?
❓ Como saber o que está superdimensionado?
❓ Como manter o custo controlado depois de otimizar?
Fixando
Qual ferramenta recomenda rightsizing com base em métricas reais de utilização?
Uma empresa quer ser avisada quando o gasto de um serviço fugir do padrão histórico, sem definir limite fixo. Qual recurso?
Terminou de ler?
Marcar como concluído registra o XP, mantém sua sequência e coloca 3 cartas deste módulo na fila de revisão espaçada.
Próximos passos sugeridos
Temas deste módulo
Discussão
Carregando comentários…