Golden sets: curadoria + manutenção + growth
- ⬜🎓 Evals como disciplina: por que LLM testing é diferente(LLM Evals Profissional)
Recomendamos completar os pré-requisitos antes de seguir, mas nada te impede de continuar.
O que é, e por que a curadoria decide tudo
Conjunto de referência é uma lista de entradas com a resposta que você considera correta. Simples de descrever e difícil de fazer bem — porque ele define o que "bom" significa no seu produto. Toda decisão posterior de modelo, prompt e arquitetura vai ser tomada em função dele.
Um conjunto mal curado é pior que nenhum: ele produz números, os números geram confiança, e a confiança está apoiada em nada. É a forma mais eficiente de tomar decisão errada com convicção.
{
"id": "rescisao-prazo-01",
"input": "Qual o prazo de rescisão previsto no contrato padrão?",
"expected_output": "30 dias corridos, contados da notificação por escrito.",
"fonte_esperada": "contrato-padrao-v4.pdf#clausula-12",
"tags": ["juridico", "fato-verificavel", "caso-comum"],
"dificuldade": "facil",
"origem": "producao-2026-07-14"
}Os dois campos que quase sempre faltam
`origem` diz de onde o caso veio — pergunta real de usuário vale mais que exemplo inventado, e você precisa saber a proporção. `dificuldade` permite ler o resultado por faixa: 90% de acerto com 80% de casos fáceis é bem diferente de 90% distribuído.
Como montar sem enganar a si mesmo
A contaminação que invalida tudo em silêncio
Usar casos do conjunto como exemplos no prompt. Funciona espetacularmente na medição — o modelo viu a resposta — e não generaliza nada. O número sobe, a satisfação do usuário não muda, e a causa é invisível.
Por que a concordância entre anotadores precisa ser medida?
Tamanho, manutenção e o erro de deixá-lo parado
| Aspecto | Regra prática | Por quê |
|---|---|---|
| Tamanho inicial | 50 a 100 casos bem escolhidos | Suficiente para detectar diferença grande. Mil casos medíocres valem menos que cinquenta representativos |
| Quando crescer | Toda falha em produção vira caso novo | É o que faz o conjunto convergir para o problema real em vez do imaginado |
| Quando revisar respostas | Sempre que a política ou o produto mudar | Resposta esperada envelhece. Conjunto com gabarito velho reprova o modelo por acertar |
| Reservado | De 20% a 30%, e não se toca | É a única parte cuja medição não foi influenciada pelas suas iterações |
O sintoma de conjunto envelhecido
A pontuação sobe com o tempo mas as reclamações não caem. Quase sempre significa que você vem otimizando para casos que já não representam o uso — e a correção é olhar a origem dos casos, não o modelo.
Perguntas frequentes
❓ Como montar um conjunto de referência?
❓ Como manter o conjunto vivo?
❓ O conjunto de referência pode envelhecer mal?
Fixando
O que é contaminação num conjunto de avaliação, e por que é grave?
Qual característica um bom exemplo de conjunto de referência precisa ter, além da resposta esperada?
Terminou de ler?
Marcar como concluído registra o XP, mantém sua sequência e coloca 3 cartas deste módulo na fila de revisão espaçada.
Próximos passos sugeridos
Temas deste módulo
Discussão
Carregando comentários…