~ / blog / ia / avaliacao-rag
Atualizado em 16 set 2026 ia 11 min de leitura

IA: Avaliação de RAG em produção — métricas e framework

Sem métricas você só tem “parece bom”. Este guia mostra como medir retrieval e geração de forma objetiva e como colocar avaliação contínua no fluxo de desenvolvimento.

RAGavaliaçãométricasproduçãoLLM-as-judge

1. Por que avaliar RAG

Um protótipo que responde bem a 10 perguntas manuais pode falhar em 40% do tráfego real. Avaliação transforma “achismo” em números e permite detectar regressões quando você muda chunk size, embedding ou prompt.

2. Golden set

Monte 50–200 perguntas reais (ou realistas) com:

  • Resposta esperada (ou critérios de aceitação)
  • Documentos de referência que deveriam ser recuperados
  • Categoria (fácil / difícil / ambígua / fora do escopo)

Atualize o golden set quando o domínio mudar. Sem isso, as métricas envelhecem.

3. Métricas de retrieval

  • Hit Rate @k — percentual de queries em que pelo menos 1 documento relevante aparece no top-k
  • MRR — Mean Reciprocal Rank (posição do primeiro relevante)
  • nDCG — considera relevância graduada e posição
  • Context Precision / Recall — o quanto do contexto recuperado é realmente útil

4. Métricas de geração

  • Faithfulness — a resposta é suportada pelo contexto?
  • Answer Relevance — a resposta responde à pergunta?
  • Context Relevance — o contexto recuperado era adequado?

Ferramentas como RAGAS e DeepEval automatizam parte disso.

5. LLM-as-judge

Use um modelo forte (ex: GPT-4o ou Claude) com prompt estruturado para avaliar faithfulness e relevância em escala. Sempre calibre com uma amostra humana para evitar bias do juiz.

6. Continuous evaluation

  1. Golden set no CI (quebra o build se hit rate cair > X%)
  2. Amostra de produção (1–5%) avaliada diariamente
  3. Feedback explícito do usuário (👍/👎 + motivo)
  4. Alerta quando latência p95 ou taxa de “não sei” sobe

7. Checklist prático

  • [ ] Golden set versionado no repositório
  • [ ] Métricas de retrieval e geração rodando no CI
  • [ ] LLM-as-judge calibrado com amostra humana
  • [ ] Dashboard com tendência semanal
  • [ ] Processo de análise de falhas (root cause)

8. Exemplo numérico das métricas de retrieval

Imagine um golden set de 5 perguntas, com k = 5. Para cada uma, anota-se em que posição apareceu o primeiro documento relevante:

PerguntaPosição do 1º relevanteEntrou no top-5?Inverso da posição
P11sim1,000
P23sim0,333
P3não apareceunão0
P42sim0,500
P51sim1,000
MétricaCálculoResultado
Hit Rate @54 perguntas com acerto ÷ 580%
MRR(1 + 0,333 + 0 + 0,5 + 1) ÷ 50,567

O Hit Rate diz se a resposta certa chegou ao contexto. O MRR mostra também se chegou perto do topo. A P3 é a que merece investigação, pois o documento nem foi recuperado.

9. Como ler as métricas de geração

MétricaPergunta que respondeExemplo de falha
Faithfulnessa resposta está apoiada no contexto?o contexto diz "prazo de 30 dias" e a resposta diz "60 dias"
Answer Relevancea resposta trata do que foi perguntado?a pergunta é sobre prazo e a resposta fala de preço
Context Relevanceo contexto recuperado era adequado?os trechos são de outro assunto
Padrão nos númerosO que costuma indicarPor onde começar
Hit Rate baixoa busca não traz o documento certochunking, modelo de embedding e busca híbrida
Hit Rate alto, Faithfulness baixao contexto está certo, mas a resposta o ignorao prompt e as instruções ao modelo
Faithfulness alta, Answer Relevance baixaa resposta é fiel a um contexto que não servea recuperação e a interpretação da pergunta

10. Armadilhas do LLM-as-judge

ProblemaO que aconteceComo reduzir
Viés de verbosidadeo juiz tende a preferir respostas mais longasdefina na rubrica que tamanho não é critério
Autopreferênciaum modelo tende a favorecer respostas do mesmo modelouse um juiz diferente do modelo que gera
Variabilidadea mesma resposta recebe notas diferentestemperatura baixa, rubrica objetiva e notas em escala curta
Nota sem validaçãoninguém sabe se o juiz concorda com pessoascompare com uma amostra avaliada por humanos, como o artigo recomenda

Quer implementar isso na sua empresa?

Ajudamos times a colocar RAG, agentes e modelos locais em produção com segurança e observabilidade.

Falar com a IRN Devs Como contratar →

Quer aplicar isso ao seu contexto?

Se esse problema existe na sua operação, podemos analisar o cenário em um diagnóstico gratuito de 30 minutos.

solicitar diagnóstico gratuito →

Leia também