Avaliando fine-tune: golden set, regression, A/B
- ⬜📦 Datasets pra fine-tuning: curadoria, dedup, contaminação(Fine-tuning & Customização de LLMs)
Recomendamos completar os pré-requisitos antes de seguir, mas nada te impede de continuar.
A pergunta que o ajuste fino precisa responder
Não é "o modelo ajustado é bom?" — é o ajuste valeu a pena em relação ao que já existia? São perguntas diferentes, e só a segunda justifica o custo do treino, da manutenção e da infraestrutura de servir um modelo próprio.
Isso torna a comparação pareada obrigatória. Uma pontuação alta isolada pode significar apenas que a tarefa era fácil — e que o modelo base, com um bom prompt, resolveria igual por uma fração do custo.
O padrão de falha mais comum, descrito por quem já o viveu
O time ajusta o modelo, testa em alguns exemplos escolhidos por quem treinou, acha que "parece melhor" e publica. A produção descobre a regressão. Não é falta de rigor por preguiça: é que impressão sobre exemplos favoritos é exatamente o formato de evidência que confirma o que já se acreditava.
As cinco camadas, do barato ao caro
Por que a ordem é essa
Cada camada é mais cara e mais realista que a anterior. Subir sem passar pela de baixo desperdiça: expor usuário real a um candidato que falharia na métrica estruturada é gastar confiança para descobrir algo que custava centavos.
O módulo chama de falha comum "ajustar, achar que parece melhor e publicar". O que o rigor exige no lugar?
O rigor mínimo antes de publicar
- Comparação com o modelo base, não pontuação isolada. Sem base, não há como atribuir o resultado ao ajuste.
- Amostra acima de uma centena de casos. Abaixo disso, uma diferença de poucos pontos percentuais é ruído, e trocar de modelo com base nela é sorteio.
- Intervalo de confiança, não número seco. Duas centésimas de diferença podem inverter de sinal com outra semente.
- Suíte de regressão verde. Média melhor com um caso crítico quebrado é piora, não melhora — e a média esconde isso.
- Resultado por fatia, além do agregado. Ganho médio pode ocultar queda forte num tipo de caso que importa.
Uma conclusão legítima que quase ninguém escreve
"O ajuste fino melhorou 3 pontos, dentro do intervalo de confiança, e acrescenta custo de treino e de servir. Não vale — ficamos com o modelo base e um prompt melhor." Chegar a isso com número é resultado de engenharia, não fracasso: economizou meses de manutenção.
Perguntas frequentes
❓ Como saber se o ajuste fino melhorou?
❓ Qual o tamanho do conjunto de avaliação?
❓ Teste com usuário real substitui avaliação offline?
Fixando
Ao usar um modelo como juiz, por que rodar a comparação duas vezes invertendo a ordem das respostas?
Qual é o papel da avaliação humana quando já existe um juiz automatizado?
Terminou de ler?
Marcar como concluído registra o XP, mantém sua sequência e coloca 3 cartas deste módulo na fila de revisão espaçada.
Próximos passos sugeridos
Temas deste módulo
Discussão
Carregando comentários…