Responsible AI — bias, fairness, transparency, Guardrails
- ⬜✍️ Prompt engineering em produção (AWS edition)(AWS AI Practitioner (AIF-C01))
Recomendamos completar os pré-requisitos antes de seguir, mas nada te impede de continuar.
IA responsável, no exame, não é discurso: é um conjunto de conceitos com nome, serviços que os implementam, e a habilidade de dizer qual problema cada um resolve. O domínio vale 14%, mas é onde mais gente perde ponto — porque as alternativas soam todas razoáveis.
A frase que organiza o domínio: viés entra pelo dado e sai pela decisão. Todo controle é uma tentativa de interceptar esse caminho em algum ponto.
Os tipos de viés que o exame nomeia
Saber diferenciar importa porque cada um tem uma correção diferente — e a questão costuma dar o sintoma e pedir o tipo.
| Tipo | Como aparece | Exemplo concreto |
|---|---|---|
| Viés de seleção (sampling) | O dado de treino não representa a população que vai usar o sistema | Modelo de crédito treinado só com clientes de capitais, aplicado no país inteiro |
| Viés histórico | O dado reflete fielmente uma realidade que já era injusta | Currículos aprovados nos últimos 20 anos numa área que excluía mulheres — o dado está correto e o padrão é discriminatório |
| Viés de rótulo | Quem rotulou trouxe seu próprio julgamento | Rotular como "agressivo" um texto que só usa gíria de uma região |
| Viés algorítmico | A escolha de modelo ou de métrica favorece um grupo | Otimizar exatidão global num dado desbalanceado: o modelo acerta a maioria e erra sistematicamente a minoria |
| Viés de confirmação (do operador) | A pessoa aceita a saída que confirma o que já pensava | Analista revisa apenas as recomendações com que discorda |
Dado correto, resultado injusto
Viés histórico é o mais mal entendido, e o exame explora isso: o dado não tem erro nenhum. Limpar, deduplicar e balancear volume não resolve, porque o problema é que o passado que ele descreve era injusto. A correção passa por escolher variáveis, medir resultado por grupo e às vezes decidir não automatizar aquela decisão.
Métricas de fairness, sem matemática
O exame não pede fórmula. Pede que você reconheça que existem definições diferentes de "justo" e que elas conflitam entre si — não dá para satisfazer todas ao mesmo tempo, e escolher qual perseguir é decisão de negócio, não de engenharia.
| Noção | O que exige |
|---|---|
| Paridade demográfica | A taxa de aprovação é parecida entre grupos |
| Igualdade de oportunidade | Entre quem realmente merecia aprovação, a taxa de acerto é parecida entre grupos |
| Paridade preditiva | Quando o modelo aprova, a chance de estar certo é parecida entre grupos |
| Equidade individual | Duas pessoas parecidas nos aspectos relevantes recebem decisão parecida |
O serviço que aparece na prova
SageMaker Clarify é o serviço que mede isso. Ele roda antes do treino (viés no dado) e depois (viés na predição), e também produz explicabilidade por atributo — quais variáveis mais pesaram naquela decisão. Quando a questão fala em "detectar viés" ou "explicar a decisão do modelo", Clarify é a resposta.
Guardrails: o controle que roda em produção
Clarify mede antes de subir. Guardrails age em cada chamada. É um recurso do Bedrock, independente do modelo escolhido — o que significa que trocar de modelo não faz a política de segurança se perder.
- → antes de qualquer custo
- → aprovado
- → bloqueado: mensagem configurada
- → resposta bruta
- → confere fundamentação
- → entregue
- → registra intervenção
- Fora da AWS
- IA e machine learning
- Conceito de arquitetura
- Gestão e governança
Dois pontos de interceptação, com propósitos diferentes: na entrada economiza a chamada e barra a tentativa; na saída protege contra o que o modelo produziu. Guardrail configurado só na saída paga inferência de todo pedido abusivo.
- Bloquear na entrada é mais barato e mais seguro. A avaliação acontece antes de invocar o modelo. Além de não pagar pela inferência, você não dá ao modelo a chance de processar a tentativa.
- Tópico negado é definido por descrição, não por lista de palavras. Você descreve o assunto proibido — "aconselhamento de investimento", por exemplo — e o Guardrail reconhece variações. Filtro de palavra-chave é contornado trocando a palavra.
- PII pode ser bloqueada ou mascarada. Duas políticas distintas: rejeitar o pedido, ou deixar passar substituindo o dado por marcador. Registro médico geralmente pede mascaramento; log de suporte pede bloqueio.
- A checagem de fundamentação combate a alucinação em RAG. Ela compara a resposta com o contexto que foi fornecido e sinaliza afirmação sem apoio. É o controle que faz um assistente sobre documento dizer "não encontrei" em vez de inventar.
- O que foi bloqueado precisa ser observável. Sem métrica de intervenção você não sabe se o Guardrail está protegendo ou atrapalhando. Bloqueio excessivo em pergunta legítima é um defeito tão real quanto vazamento.
Guardrails não é autorização
Guardrails avalia conteúdo — categoria, tópico, PII, fundamentação. Ele não sabe quem é o usuário nem o que aquele usuário pode acessar. Autorização é IAM e é lógica da sua aplicação. Confundir os dois é o erro de desenho que o exame cobra no Domínio 5.
import boto3
bedrock = boto3.client("bedrock")
# A distinção que a prova cobra: pedir ao modelo "não fale sobre X" é INSTRUÇÃO,
# e ela vive no mesmo contexto que um texto malicioso pode contradizer.
# Guardrail é CONTROLE — roda fora do modelo, na entrada e na saída.
bedrock.create_guardrail(
name="atendimento-financeiro",
topicPolicyConfig={"topicsConfig": [{
"name": "conselho-de-investimento",
"definition": "Recomendação sobre onde investir dinheiro",
"type": "DENY",
"examples": ["Em que ação devo investir?"],
}]},
contentPolicyConfig={"filtersConfig": [
{"type": "PROMPT_ATTACK", "inputStrength": "HIGH", "outputStrength": "NONE"},
{"type": "HATE", "inputStrength": "HIGH", "outputStrength": "HIGH"},
]},
# Dado sensível: `ANONYMIZE` mascara, `BLOCK` recusa. A escolha entre os dois
# é de negócio — mascarar deixa a conversa seguir; bloquear a interrompe.
sensitiveInformationPolicyConfig={"piiEntitiesConfig": [
{"type": "CREDIT_DEBIT_CARD_NUMBER", "action": "BLOCK"},
{"type": "EMAIL", "action": "ANONYMIZE"},
]},
# Verificação contextual: recusa resposta que não se sustenta na fonte
# recuperada. É o controle direto contra alucinação em RAG.
contextualGroundingPolicyConfig={"filtersConfig": [
{"type": "GROUNDING", "threshold": 0.75},
]},
blockedInputMessaging="Não posso ajudar com isso.",
blockedOutputsMessaging="Não posso responder isso.",
)Um modelo de triagem de currículos, treinado com 20 anos de contratações de uma engenharia historicamente masculina, passa a reprovar candidatas mais que candidatos. O dado foi auditado e está correto, sem erro de digitação nem duplicata. Que tipo de viés é este, e o que NÃO resolve?
Transparência: os artefatos com nome
O exame cita dois documentos e um serviço, e cobra qual serve para quê.
| Artefato | O que traz |
|---|---|
| AWS AI Service Card | Publicado pela AWS para seus serviços de IA: caso de uso pretendido, limitações conhecidas, escolhas de desenho responsável |
| Model card (seu) | Você documenta o seu modelo: dado de treino, métricas por grupo, uso pretendido e usos que devem ser evitados |
| SageMaker Model Cards | O serviço que hospeda esse documento junto do modelo registrado, com versionamento |
| Amazon A2I (Augmented AI) | Coloca revisão humana no fluxo quando a confiança da predição fica abaixo de um limite |
Humano no laço, com critério
A2I é a resposta para "decisão de alto impacto precisa de conferência humana". Note o desenho: não é revisar tudo, é revisar o que o modelo não decidiu com confiança. Revisão humana de 100% das saídas não é IA responsável — é não usar IA.
Perguntas frequentes
❓ Quais tipos de viés a prova cobra?
❓ Como medir se um modelo é justo?
❓ Guardrails resolve o problema de conteúdo inadequado?
Fixando
Uma corretora vai lançar um assistente de atendimento. O jurídico exige que ele nunca dê recomendação de investimento, e que dados de CPF não apareçam na resposta. Qual controle atende aos dois?
Num sistema de análise de sinistros, a empresa quer revisão humana nos casos em que o modelo tem baixa confiança, sem revisar todos. Qual serviço implementa isso?
Próximo passo
Fim do Domínio 4. O último domínio trata de segurança, conformidade e governança para IA — quem pode chamar o quê, por onde o dado trafega e como se prova. É aif-security-governance.
Terminou de ler?
Marcar como concluído registra o XP, mantém sua sequência e coloca 3 cartas deste módulo na fila de revisão espaçada.
Próximos passos sugeridos
Temas deste módulo
Discussão
Carregando comentários…