Capstone: eval harness completo
⏱ 20 min·⭐ 90 XP
Pré-requisitos (0/1)0%
- ⬜🔁 Regression testing pra agents: evitar regredir por mudança(LLM Evals Profissional)
Recomendamos completar os pré-requisitos antes de seguir, mas nada te impede de continuar.
Projeto proposto
| Entregável | O que prova |
|---|---|
| Conjunto com origem declarada por caso | Você sabe a proporção entre real e sintético |
| Parte reservada intocada | A medição final não foi consumida pelas suas iterações |
| Verificação objetiva antes do juiz | Você não gasta julgamento caro onde há resposta única |
| Juiz calibrado contra humano | Os milhares de julgamentos automáticos têm base |
| Ordem invertida na comparação | Você conhece e cancela o viés de posição |
| Bloqueio na esteira | A avaliação muda comportamento, em vez de virar painel |
EntregávelConjunto com origem declarada por caso
O que provaVocê sabe a proporção entre real e sintético
EntregávelParte reservada intocada
O que provaA medição final não foi consumida pelas suas iterações
EntregávelVerificação objetiva antes do juiz
O que provaVocê não gasta julgamento caro onde há resposta única
EntregávelJuiz calibrado contra humano
O que provaOs milhares de julgamentos automáticos têm base
EntregávelOrdem invertida na comparação
O que provaVocê conhece e cancela o viés de posição
EntregávelBloqueio na esteira
O que provaA avaliação muda comportamento, em vez de virar painel
Escolha app LLM real (RAG, agent, or assistant) e construa eval harness end-to-end. Pense como research project: hypothesis → experimento → result → decision.
Entregáveis
# Eval Harness Capstone — Entregáveis
## 1. Dataset (golden set)
- 200+ exemplos curados, stratified (easy/medium/hard + task types)
- Metadata: difficulty, task, source
- Annotator agreement measure (Cohen kappa)
- Contamination check contra training data
## 2. Métricas & Framework
- Structured metrics (F1, accuracy) pra estruturado
- LLM-as-judge pairwise com cross-family (GPT judges Claude, vice-versa)
- Human calibration sample 50+ com agreement > 70%
- Cost + latency tracking per request
## 3. Hypothesis testing
- Hipótese clara (ex: "reranker Cohere+ improves accuracy 5%+")
- Experimental setup documentado
- Results com confidence intervals
- Decision: promote or reject
## 4. Regression suite em CI
- 50+ test cases capturados de prod failures
- GitHub Actions workflow passando em cada PR
- Guard rails: cost/latency caps
## 5. Production observability
- Langfuse instrumentado (or similar)
- Dashboard live: qualidade over time, cost, user feedback
- Alert rules (thumbs down spike, cost explosion)
## 6. Writeup
- Blog post or README estruturado
- Charts (matplotlib/Plotly)
- Limitations e next steps honestos
- Link pra repo + dashboard + deploy✅
Capstone que define engineer ML moderno. Recruiter/hiring manager lê writeup, vê rigor científico + engineering pragmatism + decisions justificadas por data. Esse é o nível que vale $150-300k+ em 2026.
Quiz rápido
Qual entregável distingue um sistema de avaliação real de um script de teste?
Perguntas frequentes
❓ O que um arcabouço de avaliação completo precisa ter?
Conjunto de referência versionado, critério objetivo por caso, execução reprodutível, comparação contra linha de base e relatório que aponta o caso que regrediu — não só a média. Média esconde: dez casos melhorando e três quebrando dá nota melhor e produto pior.
❓ Como conter o custo de rodar avaliação com frequência?
Com dois níveis — conjunto pequeno em cada mudança, completo antes de publicar —, cache da parte estável do prompt e modelo menor onde o critério é objetivo. Avaliação que custa caro e roda em tudo é desligada na primeira semana apertada, e aí não protege nada.
❓ Como saber que o arcabouço está funcionando?
Quando ele pega uma regressão antes do usuário, ao menos uma vez. Até isso acontecer, ele é hipótese. O jeito de forçar a prova é introduzir de propósito uma mudança que você sabe ruim e verificar se o portão a barra — teste do teste.
Fixando
Fonte
Conjunto de referênciacasos reais + os que já quebraram
Critérioobjetivo e binário quando possível
Execução
Conjunto rápidoa cada commit
Conjunto completoantes de publicar
Julgamento
Verificação por códigoformato, fonte, faixa
Modelo como juizsó onde não há critério programático
Decisão
Linha de basea versão em produção
Portãofalha por REGRESSÃO, não por nota
- → compara contra
- Conceito de arquitetura
- Segurança e identidade
Média esconde: dez casos melhorando e três quebrando dá nota melhor e produto pior. O relatório precisa apontar o caso que regrediu, não só o número.
- O conjunto começa pelos casos que já quebraram. Eles são os mais valiosos. Conjunto montado só com exemplos fáceis passa sempre, dá conforto e não informa nada.
- Dois níveis, porque avaliação custa. Rápido em cada commit para pegar regressão; completo antes de publicar. Avaliação caro que roda em tudo é desligada na primeira semana apertada.
- Código antes de juiz. Formato válido, fonte existente e faixa numérica são verificáveis por código — mais barato e mais confiável. O juiz entra só no que é textual.
- O juiz tem vieses conhecidos. Prefere resposta longa e a primeira apresentada. Mitiga-se com critério explícito, alternando a ordem e ancorando em casos corrigidos à mão.
- O portão compara com a versão em produção. Limiar sobre nota absoluta é desligado na primeira oscilação. Sobre regressão em relação à linha de base, ele sobrevive.
Quiz rápido
Por que o capstone exige incluir casos que já falharam em produção?
Quiz rápido
O que precisa acompanhar cada resultado para a avaliação ser acionável?
Terminou de ler?
Marcar como concluído registra o XP, mantém sua sequência e coloca 3 cartas deste módulo na fila de revisão espaçada.
Próximos passos sugeridos
Temas deste módulo
Discussão
Carregando comentários…