LLM-as-judge: armadilhas e mitigações
- ⬜🏆 Golden sets: curadoria + manutenção + growth(LLM Evals Profissional)
Recomendamos completar os pré-requisitos antes de seguir, mas nada te impede de continuar.
Biases conhecidos
| Bias | Sintoma | Mitigação |
|---|---|---|
| Position | Primeira resposta preferida | Order swap, consistent-only counting |
| Verbosity | Longa preferida | Rubric explícita, length cap |
| Self-enhancement | Mesma família preferida | Cross-family judge, ensemble |
| Style-over-substance | Formatação atraente ganha | Rubric focused em correctness |
| Confidence | Tone assertivo preferido | Score separado pra confidence vs accuracy |
Pairwise vs rating absoluto
Pairwise (A ou B melhor?) é mais confiável que rating absoluto (1-10). Humans têm difficulty consistent em rating absoluto; pairwise é reliable. Em pairwise: rubric estruturada, order swap, tie option explícito. Rating absoluto OK pra monitoring loose mas não pra decisions críticas.
Qual viés conhecido do modelo-juiz mais distorce comparações?
Human calibration obrigatório
Toda pipeline de LLM-judge precisa periodic calibration com human reviewers. Sample 30-50 exemplos por quarter, human rate, measure agreement com LLM judge. Se < 70% agreement, judge rubric precisa revisão. Sem calibration, judge vira echo chamber.
Perguntas frequentes
❓ Quais vieses o modelo juiz tem?
❓ Nota absoluta ou comparação entre pares?
❓ Quando o juiz automático não serve?
Fixando
Por que a comparação em pares costuma ser mais confiável que a nota absoluta?
Por que calibrar o juiz contra avaliação humana é obrigatório?
Terminou de ler?
Marcar como concluído registra o XP, mantém sua sequência e coloca 3 cartas deste módulo na fila de revisão espaçada.
Próximos passos sugeridos
Temas deste módulo
Discussão
Carregando comentários…