AI Safety: por que importa pra engenheiro
Ao terminar: Você distingue mau uso, desalinhamento e má generalização — e sabe qual desses riscos o seu sistema em produção corre de verdade.
Safety não é marketing de Anthropic
O engineer que opera IA em produção em 2026 não tem o luxo de tratar safety como tópico de pesquisa abstrata. Três forças convergiram: (1) modelos ficaram capazes o suficiente para dano real, (2) reguladores (EU AI Act, NIST AI RMF, executive orders nos EUA) criaram obrigações técnicas concretas, (3) casos públicos de falha (data leak via agent, prompt injection exfiltrando secrets, deepfake em fraude) tornaram o risco reputacional tangível.
O objetivo desta trilha é equipar você para operar com rigor de engenharia — não com ansiedade nem com desprezo.
Taxonomia operacional
| Categoria de risco | Exemplo concreto | Onde a defesa mora |
|---|---|---|
| Conteúdo prejudicial | Instrução para causar dano | Classificador na entrada e na saída |
| Instrução injetada | Texto lido pelo agente que vira comando | Permissão e conjunto de ferramentas — não o prompt |
| Vazamento de dado | Recuperação trazendo documento de outro usuário | Filtro de permissão ANTES da ordenação |
| Ação com efeito irreversível | Agente apagando ou publicando | Confirmação humana no caminho |
| Uso indevido em escala | Automação de fraude | Limite por conta e detecção de padrão |
| Erro confiante | Afirmação falsa bem escrita | Citação da fonte e recusa quando não há base |
A literatura consolidou três categorias que ajudam a separar problema e defesa:
misuse:
descricao: "Ator humano usa modelo capaz para causar dano"
exemplos:
- geração de malware ou phishing em escala
- deepfake de voz/imagem para fraude
- CSAM, armas químicas/biológicas
defesas_principais:
- policy & refusal training (RLHF, Constitutional AI)
- content filters pré e pós geração
- rate limiting e abuse detection
misalignment:
descricao: "Modelo persegue proxy ligeiramente diferente do objetivo intended"
exemplos:
- model otimiza engagement e vira sycophantic
- agent completa task de forma literal e quebra invariantes
- reward hacking (explorar brechas da função de recompensa)
defesas_principais:
- Constitutional AI / RLAIF
- evals comportamentais (honesty, helpfulness, harmlessness)
- scalable oversight, debate, amplification
misgeneralization:
descricao: "Modelo aplica comportamento aprendido em distribuição nova e falha"
exemplos:
- modelo treinado em inglês decide errado em PT-BR
- agent rag confia em chunk poisoned
- modelo confidently wrong em edge case não coberto
defesas_principais:
- evals fora-de-distribuição
- detecção de uncertainty
- fallback a modelo menor/regraEU AI Act 2025: o que muda na prática
O EU AI Act entrou em vigor em fases a partir de 2024, com obrigações técnicas plenas em 2025-2026. A lei classifica sistemas por risco: unacceptable (proibido, ex: social scoring), high-risk (RH, crédito, saúde, educação — obrigações pesadas), limited (chatbots, deepfakes — disclosure obrigatório), minimal (jogos).
Se seu produto vai para EU (ou tem usuários EU), cai na lei. Obrigações técnicas concretas para high-risk: technical documentation, logs de inferência preservados, human oversight mecanismo, conformance assessment antes de shipping. Ignorar é passivo de milhões em multa.
NIST AI RMF e outras molduras
Fora da UE, o NIST AI Risk Management Framework é o padrão mais maduro e adotado por empresas americanas (voluntário, mas contratos federais exigem). Quatro funções: Govern, Map, Measure, Manage. O engineer contribui principalmente em Map (threat modeling) e Measure (evals).
# Threat model leve (nível engineer) — template
## Sistema
Agent de suporte ao cliente com tools: buscar pedido, emitir reembolso, criar ticket.
## Assets a proteger
- PII de clientes (CPF, endereço, cartão)
- Integridade financeira (não emitir reembolso indevido)
- Reputação da marca
## Atores de ameaça
- Usuário malicioso via chat
- Prompt injection via email/doc anexado (indirect)
- Funcionário interno com acesso a logs
## Superfícies de ataque
- Input do usuário (texto livre)
- Conteúdo ingested por RAG (email, KB)
- Tool responses que viram contexto
## Controles
- Scope de tool emitir_reembolso limitado por valor e política
- PII scrub antes de log
- Confirmação humana acima de R$ X
- Rate limit por usuário
- Red team trimestral
## O que NÃO cobrimos
- Ataque ao modelo base (responsabilidade do provider)
- DDoS (responsabilidade da infra)Por que segurança em sistemas de IA deve ser tratada como funcionalidade com critério de aceite, e não como declaração de intenção?
Safety como feature com DoD
A prática que separa time maduro de time amador é tratar safety como feature funcional, com definition of done, não como "vamos ver". Exemplo de DoD para um novo agent em prod:
# DoD — Safety para shipping de agent novo
- [ ] Threat model escrito e revisado por 1 par
- [ ] Lista explícita de tool scopes (least privilege)
- [ ] Guardrail de input (regex + Llama Guard ou Claude classifier)
- [ ] Guardrail de output (PII scrub, policy check)
- [ ] Logs preservam: prompt, resposta, tool calls, trace id
- [ ] PII scrub antes de log de longo prazo
- [ ] Budget guard (custo por sessão capped)
- [ ] Rate limit por usuário e por IP
- [ ] Canal de report de abuse (email ou form)
- [ ] Playbook de incident response (quem paga on-call)
- [ ] Red team inicial rodado (mínimo 20 prompts de cada categoria)
- [ ] Runbook de desligamento de emergênciaO que esta trilha cobre
Próximos 6 módulos: (1) jailbreaks e prompt injection com defesas concretas, (2) data exfiltration em agents, (3) Constitutional AI e como aplicar fora da Anthropic, (4) guardrails práticos (NeMo, Llama Guard, Claude Guardrails), (5) red team playbook, (6) capstone red team do seu agent. Cada um traz código executável.
Postura operacional
Leve deste módulo: safety é disciplina de engenharia, não debate filosófico. Taxonomia (misuse / misalignment / misgen) define defesa certa. EU AI Act e NIST RMF impõem obrigações técnicas concretas. DoD de safety antes de shipping. E lembre: o primeiro incidente tem custo reputacional permanente — gaste 2 semanas agora ou 6 meses depois consertando confiança.
Perguntas frequentes
❓ Por que segurança de IA importa para quem programa?
❓ Qual a diferença entre mau uso, desalinhamento e má generalização?
❓ Regulação de IA muda o trabalho de engenharia?
Fixando
Qual é a utilidade prática de uma taxonomia operacional de danos?
Como os arcabouços regulatórios e de gestão de risco costumam classificar sistemas de IA?
Terminou de ler?
Marcar como concluído registra o XP, mantém sua sequência e coloca 3 cartas deste módulo na fila de revisão espaçada.
Próximos passos sugeridos
Temas deste módulo
Discussão
Carregando comentários…