ML/IA para Arquiteto: SageMaker, Bedrock e Pipelines
- ⬜🎓 SAA-C03: Da Teoria à Arquitetura Real(AWS Solutions Architect Associate)
Recomendamos completar os pré-requisitos antes de seguir, mas nada te impede de continuar.
O Practitioner cobre o catálogo de serviços AI/ML. No SAA-C03 a pergunta muda: como arquitetar uma pipeline de inferência que entrega latência previsível com custo sob controle? Quando Real-time Endpoint, quando Serverless Inference, quando Async, quando Batch? Como Bedrock se encaixa em um data lake? Como deployar modelos em produção com blue/green ou canary? Aqui vamos ao nível de decisão arquitetural — o que o exame realmente cobra.
As 4 opções de deployment SageMaker
| Modo | Latência | Custo | Caso de uso |
|---|---|---|---|
| Real-time Endpoint | ms (10-100) | Pago por hora (instância provisionada 24/7) | App interativa, alta QPS sustentada |
| Serverless Inference | Varia com cold start | Pago por invocação + memória | Tráfego intermitente/imprevisível |
| Async Inference | Até 1 hora | Pago por instância quando ativa; escala a zero | Payloads grandes (até 1 GB) · processamento longo |
| Batch Transform | Offline | Pago por job | Inferência em lote sobre S3 (ex: scoring mensal) |
- → documento
- → linguagem aberta
- → modelo proprietário
- → texto extraído
- → ingestão
- → embedding
- → recupera contexto
- → filtra entrada e saída
- IA e machine learning
- Rede e entrega
- Compute
- Armazenamento
- Analytics
A regra é uma só: a resposta certa é a camada mais ALTA que resolve o problema. Tarefa fechada sobre mídia ou documento → API pronta. Linguagem aberta → Bedrock. Modelo como artefato seu → SageMaker.
- Comece pela camada mais alta que resolve. Extrair campo de nota fiscal é Textract, não foundation model. Detectar PII é Comprehend. A prova recompensa sistematicamente a opção de menor esforço operacional — e descer de camada sem necessidade é a alternativa errada mais tentadora.
- Foundation model quando a tarefa é linguagem aberta. Resumir, redigir, conversar, raciocinar sobre texto livre. Bedrock entrega isso serverless, com IAM e sem endpoint para gerenciar.
- O que falta ao FM é o SEU dado. Ele não conhece seus documentos, e isso é problema de recuperação, não de treinamento. Knowledge Bases lê do S3, gera embedding, guarda no índice vetorial e injeta o trecho no contexto. Documento muda? Reindexação, não retreino.
- Guardrails é independente do modelo. Aplica política de conteúdo e de tópico na entrada e na saída, e faz checagem de sustentação no contexto. Vale para qualquer modelo do catálogo — a resposta de "impedir que o assistente fale de assunto proibido".
- SageMaker só quando o modelo é seu. Treinar com dado proprietário, arquitetura custom, artefato sob seu controle: visão computacional de peça de fábrica, previsão tabular com histórico próprio. Custo e esforço operacional muito maiores — e a questão que pede "sem cientista de dados" nunca aponta para cá.
Serverless Inference é ideal para APIs internas com QPS baixo ou irregular — não paga instância parada. Mas tem cold start (~1-5s no primeiro request após idle), então não serve para latência de UI crítica.
Arquitetura de referência: inferência em produção
Production Variants permitem hospedar múltiplos modelos atrás do mesmo endpoint com tráfego dividido por percentual. É como o SageMaker implementa Blue/Green e Canary. Auto Scaling usa métrica SageMakerVariantInvocationsPerInstance.
Bedrock em arquiteturas corporativas
Bedrock é mais que um playground — ele tem primitivos para GenAI de produção:
| Feature | Para quê |
|---|---|
| InvokeModel API | Chamada síncrona para qualquer foundation model |
| InvokeModelWithResponseStream | Streaming de tokens (UX estilo ChatGPT) |
| Knowledge Bases | RAG gerenciado: S3 → vector store (OpenSearch, Aurora, Pinecone) → recupera contexto automaticamente |
| Agents | Tool calling gerenciado: conecta LLM a APIs externas com orquestração |
| Guardrails | Filtros de conteúdo (PII, tópicos proibidos, prompt injection detection) |
| Model Evaluation | Benchmark automático de modelos contra dataset custom |
| Provisioned Throughput | Capacidade reservada para SLA (em vez de pay-per-token) |
| Fine-tuning | Adapta modelo base ao domínio com dataset proprietário |
Bedrock não usa seus inputs/outputs para treinar modelos de terceiros por padrão — garantia contratual AWS. Use VPC Endpoints para manter tráfego dentro da sua VPC.
Arquitetura: chatbot corporativo com RAG
Knowledge Bases abstrai todo o pipeline RAG: upload docs → chunking → embeddings → vector DB → retrieval → augmentação de prompt. Você chama RetrieveAndGenerate e pronto.
MLOps com SageMaker Pipelines
SageMaker Pipelines é CI/CD para modelos — define DAG de steps (data prep → treino → avaliação → registro → aprovação → deploy). Integra com Model Registry (versionamento) e Model Monitor (drift detection).
| Componente | Papel |
|---|---|
| Processing Jobs | Preparação de dados (pandas, Spark) |
| Training Jobs | Treino em instância gerenciada (GPU opcional) |
| Model Registry | Versiona modelos, aprovação manual/automática |
| Model Monitor | Detecta drift de dados/modelo em endpoint de produção |
| Clarify | Bias + explainability |
| Feature Store | Armazena features online (baixa latência) e offline (para treino) |
Um chatbot corporativo precisa responder com base em 80 mil documentos internos, sem que o conteúdo trafegue pela internet pública. Qual arquitetura?
Data lake alimentando ML
Cenários arquiteturais
📋 App de e-commerce precisa de recomendação personalizada com QPS variável (100 → 10.000)
Personalize é serviço gerenciado (menor esforço) específico para recommendation. Se precisa modelo custom, Real-time Endpoint + Auto Scaling + Production Variants entrega latência previsível.
Alt: Serverless Inference — cold start prejudica UX no pico.
Alt: Batch Transform — atraso de minutos não serve.
📋 Scoring de risco de crédito processado 1x/dia sobre tabela com 10M linhas
Job offline sobre S3 — paga só pelo processamento. Não faz sentido manter endpoint ativo 24/7 para uso pontual.
Alt: Async Inference — mais indicado para payload grande pontual.
Alt: Real-time Endpoint — desperdício de custo.
📋 Chatbot interno consulta base de 500.000 documentos técnicos
Q Business já integra conectores (SharePoint, Confluence, S3) + search + GenAI. Alternativamente, Knowledge Bases + OpenSearch dá mais controle para pipeline RAG custom.
Alt: Kendra + Lex — mais legado, mais engenharia.
Alt: Self-hosted com OpenSearch + Llama — overhead operacional alto.
📋 Processar PDFs de contratos (50 páginas cada) com GenAI — 1-2 min por doc, 1000 docs/dia
Payload grande, latência longa, throughput moderado. Async coloca na fila SQS-like e devolve resultado em S3. Endpoint escala a zero quando ocioso.
Alt: Real-time — timeout em 60s — não serve.
Alt: Step Functions + Bedrock — válido para ≤ 29s por invocação.
Segurança ML/IA no SAA
| Ameaça | Defesa AWS |
|---|---|
| Vazamento de PII em prompts | Bedrock Guardrails · Comprehend PII Redaction |
| Prompt injection | Guardrails de input · validation na camada de app |
| Dados de treino expostos | SageMaker em VPC + KMS · S3 privado + Lake Formation |
| Modelo enviesado | SageMaker Clarify · Model Monitor bias drift |
| Tráfego de inferência pela internet | VPC Endpoint para Bedrock/SageMaker (PrivateLink) |
| Auditoria | CloudTrail + Bedrock Model Invocation Logging |
Perguntas típicas (Q&A)
❓ Quando SageMaker em vez de Bedrock?
❓ Real-time Endpoint cobra quando ocioso?
❓ Como garantir que Bedrock funcione dentro de VPC privada?
❓ SageMaker JumpStart vs Bedrock — qual escolher?
Perguntas frequentes
❓ Quais são as formas de servir inferência na AWS?
❓ Bedrock ou SageMaker na visão do arquiteto?
❓ Onde a segurança entra numa arquitetura de IA?
Fixando
Qual opção de deployment do SageMaker atende melhor "pontuar um dataset de 20 milhões de linhas toda madrugada, sem exigência de latência"?
O time de arquitetura precisa impedir que o assistente de IA responda sobre assuntos fora do escopo corporativo e que invente informação não presente no contexto recuperado. Qual recurso?
Take-aways: 4 tipos de endpoint = Real-time · Serverless · Async · Batch · Bedrock = foundation models gerenciados · Knowledge Bases = RAG gerenciado · Q Business = chatbot corporativo pronto · SageMaker Pipelines = MLOps · VPC Endpoint = tráfego privado · Guardrails + Clarify + Model Monitor = segurança e qualidade em produção.
Terminou de ler?
Marcar como concluído registra o XP, mantém sua sequência e coloca 3 cartas deste módulo na fila de revisão espaçada.
Próximos passos sugeridos
Temas deste módulo
Discussão
Carregando comentários…