MLOps & Monitoramento — SageMaker Pipelines, Model Monitor, observabilidade Bedrock
- ⬜🎯 Customization & Evaluation — fine-tune, CPT, model eval(AWS AI Practitioner (AIF-C01))
Recomendamos completar os pré-requisitos antes de seguir, mas nada te impede de continuar.
O ciclo de vida de ML é conteúdo de Domínio 1, e é onde o exame cobra que você saiba que o trabalho não termina no deploy. Modelo em produção degrada sem ninguém mexer nele, porque o mundo que ele aprendeu muda. Reconhecer o tipo de degradação e a ferramenta que a detecta é o que se pede.
O ciclo, com nome em cada etapa
A sequência que o exame usa como referência.
Por que existem três conjuntos
O conjunto de teste existe para ser usado uma vez. Ajustar hiperparâmetro olhando o resultado do teste transforma ele em validação, e a estimativa de desempenho fica otimista — você mediu quão bem o modelo vai naquele conjunto específico, não no mundo. É o erro conceitual mais cobrado sobre a etapa 3.
SageMaker Pipelines e Model Registry
A automação desse ciclo, na AWS, tem nomes que o exame usa.
- → atributos
- → se a métrica passar
- → aguarda decisão
- → aprovado
- → captura de dados
- → métrica de deriva
- → gatilho de retreino
- Armazenamento
- Conceito de arquitetura
- Gestão e governança
O ciclo se fecha: o monitoramento em produção alimenta o gatilho de retreino, e o pipeline roda de novo. A aprovação entre registro e endpoint é o que impede que "a métrica passou" signifique automaticamente "está em produção".
- O pipeline é o ciclo em código. Cada etapa é um step com entrada e saída declaradas. O ganho não é automação: é reprodutibilidade — dá para saber exatamente com que dado e que parâmetro aquele modelo nasceu.
- O registro guarda versão, métrica e linhagem. Modelo sem registro é arquivo em bucket. Quando o auditor perguntar qual versão decidiu aquele caso em março, a resposta está aqui — ou não existe.
- A aprovação é um portão explícito. O step de aprovação manual separa "passou na métrica" de "liberado para decidir sobre pessoas". Em domínio regulado, é esse portão que a conformidade exige ver.
- Endpoint ou lote é decisão de padrão de uso. Resposta necessária em milissegundos, por requisição, pede endpoint. Milhões de predições uma vez por noite pedem batch transform — e endpoint ligado 24/7 para uso esporádico é o desperdício mais comum.
- O monitoramento fecha o laço. Model Monitor compara o dado que chega com uma linha de base e aponta deriva. O alarme não retreina sozinho por mágica: alguém liga o alarme ao gatilho do pipeline.
Os tipos de deriva
A distinção decide questão. O sintoma é parecido, a causa e a correção não são.
| Tipo | O que mudou | Como se detecta |
|---|---|---|
| Deriva de dado (data drift) | A distribuição da entrada mudou — outro perfil de cliente, outra faixa de valor | Comparação estatística com a linha de base. Não precisa saber o resultado real |
| Deriva de conceito (concept drift) | A relação entre entrada e resposta mudou — o que indicava fraude ano passado não indica mais | Só aparece quando o resultado real chega. Exige rótulo posterior |
| Deriva de qualidade do modelo | A métrica caiu, medida contra o resultado real observado | Model Monitor com rótulo de retorno (ground truth) |
| Deriva de viés | O desempenho por grupo se desequilibrou ao longo do tempo | Clarify em modo de monitoramento contínuo |
Por que uma é rápida e a outra é lenta
Deriva de dado é detectável imediatamente — basta comparar a entrada de hoje com a linha de base. Deriva de conceito só é detectável quando o resultado real chega, e em muitos negócios isso demora semanas: um modelo de inadimplência só descobre que errou quando o prazo vence. Por isso deriva de dado serve como alerta antecipado — ela costuma preceder a queda de qualidade.
from sagemaker.model_monitor import DefaultModelMonitor
from sagemaker.model_monitor.dataset_format import DatasetFormat
monitor = DefaultModelMonitor(role=ROLE, instance_count=1, instance_type="ml.m5.xlarge")
# A linha de base sai do conjunto de TREINO — é a definição do que é normal.
# Sem ela não há do que divergir, e é o passo que mais se esquece de configurar.
monitor.suggest_baseline(
baseline_dataset="s3://lago/train/dados.csv",
dataset_format=DatasetFormat.csv(header=True),
output_s3_uri="s3://lago/baseline/",
)
monitor.create_monitoring_schedule(
endpoint_input=predictor.endpoint_name,
output_s3_uri="s3://lago/relatorios/",
schedule_cron_expression="cron(0 * ? * * *)",
enable_cloudwatch_metrics=True,
)
# O que este monitor pega: deriva de DADO — a distribuição da entrada mudou.
# O que ele NÃO pega: deriva de CONCEITO — a entrada está idêntica e a RELAÇÃO
# com a resposta mudou. Essa exige rótulo verdadeiro, que costuma chegar tarde;
# até lá, o sinal disponível é a mudança de importância dos atributos.Um modelo de previsão de demanda mantém a mesma exatidão medida no conjunto de teste, mas há três meses passou a errar em produção. O perfil dos pedidos mudou depois de a empresa entrar numa nova região. Que fenômeno é este, e o que detecta primeiro?
Observabilidade de aplicações com foundation model
Com Bedrock você não treina nem hospeda, então o que se monitora muda de natureza: em vez de deriva de atributo, o que importa é custo, latência, e qualidade da resposta.
| O que medir | Onde vem | Por que importa |
|---|---|---|
| Tokens de entrada e saída por chamada | Bloco `usage` da resposta, e métrica no CloudWatch | É a base de todo controle de custo e do rateio por equipe. Instrumentar depois é quase impossível |
| Latência por modelo | CloudWatch | Modelo maior responde melhor e mais devagar. Sem medir, a escolha é opinião |
| Taxa de intervenção do Guardrail | Métrica do Guardrail | Bloqueio excessivo em pergunta legítima é defeito. Sem medir, você só descobre por reclamação |
| Qualidade da resposta em amostra | Avaliação periódica com conjunto de referência | A qualidade pode cair sem nada mudar do seu lado — mudou o modelo, ou mudaram as perguntas |
| Quem invocou qual modelo | CloudTrail | Governança e investigação de incidente |
Perguntas frequentes
❓ O que um pipeline de ML precisa ter?
❓ Como detectar que o modelo degradou em produção?
❓ O que monitorar num sistema com modelo generativo?
Fixando
Uma equipe precisa poder responder, numa auditoria, qual versão do modelo tomou uma decisão em março e com que dado ela foi treinada. Qual prática sustenta essa resposta?
Uma aplicação usa Bedrock e o custo cresceu 4x em um mês sem aumento proporcional de usuários. Qual instrumentação permite achar a causa?
Próximo passo
Conteúdo coberto. Falta a estratégia de prova e o simulado: como atacar cada domínio, onde estão as pegadinhas e como administrar 90 minutos. É aif-simulado-final.
Terminou de ler?
Marcar como concluído registra o XP, mantém sua sequência e coloca 3 cartas deste módulo na fila de revisão espaçada.
Próximos passos sugeridos
Temas deste módulo
Discussão
Carregando comentários…