Eval frameworks: Braintrust, Langfuse, Inspect, Promptfoo
⏱ 13 min·⭐ 55 XP
Pré-requisitos (0/1)0%
- ⬜⚖️ LLM-as-judge: armadilhas e mitigações(LLM Evals Profissional)
Recomendamos completar os pré-requisitos antes de seguir, mas nada te impede de continuar.
Frameworks comparados
| Tool | Tipo | Quando usar |
|---|---|---|
| Promptfoo | Open, YAML, CLI | CI/dev evals, regression, open-first |
| Langfuse | Open-source + SaaS | Observability prod + evals combinados |
| Braintrust | SaaS pago (free tier) | Enterprise eval team, UI premium |
| Inspect AI | Open, research-grade | Safety evals, research, agentic complex |
| LangSmith | LangChain SaaS | Já em LangChain ecosystem |
| HoneyHive | SaaS | Prod-focused alternative |
ToolPromptfoo
TipoOpen, YAML, CLI
Quando usarCI/dev evals, regression, open-first
ToolLangfuse
TipoOpen-source + SaaS
Quando usarObservability prod + evals combinados
ToolBraintrust
TipoSaaS pago (free tier)
Quando usarEnterprise eval team, UI premium
ToolInspect AI
TipoOpen, research-grade
Quando usarSafety evals, research, agentic complex
ToolLangSmith
TipoLangChain SaaS
Quando usarJá em LangChain ecosystem
ToolHoneyHive
TipoSaaS
Quando usarProd-focused alternative
Promptfoo setup rápido
💡
npx promptfoo init → YAML com prompts + tests + providers → npx promptfoo eval. Assertions: contains, regex, factuality (LLM judge), similar, cost. CI: exits non-zero se regression. Dashboards HTML auto. Tier free + open.
Quiz rápido
Qual critério deve guiar a escolha de um framework de avaliação?
Pipeline recomendado
- Dev local: Promptfoo em CLI pra iterar prompts
- CI/PR: Promptfoo como gate — regression fail = blocked
- Staging: Langfuse captura traces, human review sample
- Production: Langfuse observability + feedback loop → golden set
- Quarterly: evaluation deep com Braintrust/Inspect
Mudança
Alteraçãoprompt, modelo, ferramenta ou recuperação
Avaliação automática
Conjunto de referênciacasos com resposta conhecida
Verificação determinísticaesquema válido, valor exato — barato
Julgamento por modelopara resposta aberta — com ordem invertida
Portão
Suíte de regressãocasos que já falharam em produção
Bloqueiaqueda de métrica barra a publicação
Depois
Produção
Falha realvira caso novo no conjunto
- → só o que não é objetivo
- → aprovado
- Fora da AWS
- Conceito de arquitetura
- Segurança e identidade
- Compute
- Gestão e governança
O desenho é um ciclo, e o portão é o que o torna útil: avaliação que não bloqueia nada é painel. A seta de volta — falha vira caso — é o que faz o sistema melhorar de forma cumulativa.
- 1 · Verificação objetiva primeiro, porque é grátis. Esquema válido, campo presente, valor exato. Onde existe resposta única, não há por que gastar um julgamento por modelo.
- 2 · O juiz é para o que não tem resposta única. Ele custa dinheiro e tem viés. Usá-lo onde a verificação objetiva bastaria é trocar precisão por despesa.
- 3 · Inverter a ordem cancela o viés de posição. O juiz prefere a primeira resposta. Rodar nas duas ordens e tirar a média separa preferência real de artefato do formato.
- 4 · A suíte de regressão é a memória. Sem ela, cada correção reabre um caso antigo e o progresso anda em círculos sem ninguém perceber.
- 5 · Só bloqueando é que a avaliação muda comportamento. Enquanto ela apenas informa, é ignorada nos dias de pressa — que são justamente os dias em que a regressão passa.
- 6 · A falha de produção fecha o ciclo. Cada uma vira caso novo. É o que faz o conjunto convergir para o uso real em vez de medir para sempre o que alguém imaginou no início.
Perguntas frequentes
❓ Como escolher ferramenta de avaliação?
Pelo que você precisa hoje: se é rodar no fluxo de integração contínua, a orientada a arquivo de configuração é a mais simples. Se é observar produção com rastro e conjunto, plataforma rende mais. O critério que decide é quem vai manter — ferramenta sofisticada sem dono vira relatório que ninguém abre.
❓ Vale escrever o próprio arcabouço de avaliação?
Vale quando o critério é específico e você só precisa de laço, comparação e relatório — o que é pouco código. Deixa de valer quando você começa a reimplementar rastro, armazenamento e visualização. A regra: escreva o critério, use ferramenta para a infraestrutura.
❓ Avaliação precisa estar na integração contínua?
Precisa, senão ela não protege nada — proteção que roda quando alguém lembra não é proteção. O arranjo viável é conjunto pequeno e rápido em cada mudança e completo antes de publicar, com limiar sobre regressão em relação à linha de base, não sobre nota absoluta.
Fixando
Quiz rápido
Qual é o pipeline recomendado ao começar do zero?
Quiz rápido
Por que os casos de avaliação devem ser versionados junto com o código?
Terminou de ler?
Marcar como concluído registra o XP, mantém sua sequência e coloca 3 cartas deste módulo na fila de revisão espaçada.
Próximos passos sugeridos
Temas deste módulo
Discussão
Carregando comentários…