Avaliação de busca: MRR, NDCG, P@K, golden datasets
⏱ 13 min·⭐ 65 XP
Pré-requisitos (0/1)0%
- ⬜🗄️ Vector DBs em 2026: Qdrant, Weaviate, Pinecone, pgvector(Search & Information Retrieval Profundo)
Recomendamos completar os pré-requisitos antes de seguir, mas nada te impede de continuar.
Sem métrica, você está chutando
Search é problema de optimization — você precisa de função objetivo. As 4 métricas canônicas: P@K (precision), R@K (recall), MRR (mean reciprocal rank), NDCG@K (normalized discounted cumulative gain).
As métricas
ƒ MRR
MRR = (1/|Q|) · Σ_q (1 / rank_q)
MRR
Mean Reciprocal Rank
=
(1/|Q|)
Média sobre queries
·
Σ_q
Soma sobre queries
(1 / rank_q)
Inverso da posição do 1º relevante
ƒ NDCG@K
NDCG@K = DCG@K / IDCG@K
DCG@K
Σ rel_i / log2(i+1) — discounted gain
/
IDCG@K
DCG da ordenação ideal
Tabela comparativa
| Métrica | Quando usar | Limite |
|---|---|---|
| Precision@K | Quanto dos K top é relevante? | Ignora posição relativa dentro do top-K |
| Recall@K | Quanto do total relevante está no top-K? | Precisa saber TODOS os relevantes — caro |
| MRR | Primeira resposta certa é o que importa | Insensível ao 2º+ relevante |
| NDCG@K | Ranking multi-relevância | Mais complexo de explicar |
| MAP (Mean Average Precision) | Recall + posição | Binary relevance, menos comum 2026 |
| ERR (Expected Reciprocal Rank) | Modela "user satisfaction" decay | Acadêmica, menos comum em produção |
MétricaPrecision@K
Quando usarQuanto dos K top é relevante?
LimiteIgnora posição relativa dentro do top-K
MétricaRecall@K
Quando usarQuanto do total relevante está no top-K?
LimitePrecisa saber TODOS os relevantes — caro
MétricaMRR
Quando usarPrimeira resposta certa é o que importa
LimiteInsensível ao 2º+ relevante
MétricaNDCG@K
Quando usarRanking multi-relevância
LimiteMais complexo de explicar
MétricaMAP (Mean Average Precision)
Quando usarRecall + posição
LimiteBinary relevance, menos comum 2026
MétricaERR (Expected Reciprocal Rank)
Quando usarModela "user satisfaction" decay
LimiteAcadêmica, menos comum em produção
Quiz rápido
Por que medir a posição do resultado relevante importa mais que só saber se ele apareceu?
Golden dataset — checklist
Tamanho mínimo200-500 queries para production-grade signal
DistribuiçãoHead (top queries) + torso (mediana) + tail (raras) — não só fáceis
Relevance judgments0-3 scale (irrelevant/marginal/relevant/perfect) — não binário
Inter-annotator agreement2+ avaliadores; Cohen kappa > 0.7
AtualizaçãoQuarterly — distribuição de queries muda
Eval suiteBEIR (academic), MS MARCO (open), próprio (sempre)
Pipeline offline → online
Offline gateNDCG@10 cai >2% no golden set = bloqueia merge
Shadow trafficRoda nova ranking lado-a-lado, compara métricas, sem afetar usuário
Interleaving (TDI)Mistura ranking A e B na mesma SERP, mede clique relativo — sinal 10x mais sensível que A/B clássico
A/B incrementalComeça 1% tráfego, escala se métrica de produto move
Long-term metricsReturn rate + 7-day retention — não só CTR
✅
Trilha Search & IR Profundo concluída. Badge Search Master desbloqueado.
Perguntas frequentes
❓ Quais métricas usar para avaliar busca?
Posição recíproca média quando existe uma resposta certa, ganho cumulativo descontado quando há graus de relevância, e precisão nos primeiros resultados quando a tela mostra poucos. A escolha vem da interface: se o usuário vê três resultados, medir os dez primeiros informa pouco.
❓ Como montar conjunto de referência para busca?
Com consultas reais do registro, e os documentos relevantes anotados por quem entende o domínio — incluindo grau de relevância quando faz sentido. Cinquenta consultas bem anotadas medem melhor que quinhentas anotadas às pressas, porque anotação inconsistente vira ruído.
❓ Por que medir busca antes de otimizar?
Porque toda mudança em corte, embedding ou reordenação parece melhorar quando testada em duas consultas escolhidas por quem fez a mudança. Sem conjunto de referência, a discussão é de opinião e a regressão passa. Medir primeiro é o que transforma ajuste em engenharia.
Fixando
Quiz rápido
Qual métrica é adequada quando existem graus de relevância, e não apenas relevante ou não?
Quiz rápido
Qual é o pré-requisito para qualquer uma dessas métricas ser confiável?
Terminou de ler?
Marcar como concluído registra o XP, mantém sua sequência e coloca 3 cartas deste módulo na fila de revisão espaçada.
Próximos passos sugeridos
Temas deste módulo
Discussão
Carregando comentários…