Canonical: https://www.strataigize.com/pt-BR/insights/what-an-ai-evaluation-actually-measures/
Description: Notas de benchmark são instrumentos de medição, e a maioria nunca foi validada. O que conferir antes de confiar em uma e o que construir no lugar.
Published: 2026-09-13T00:00:00.000Z
Modified: 2026-09-13T00:00:00.000Z

[← Blog](https://www.strataigize.com/pt-BR/insights/)

![](https://www.strataigize.com/blog/real/cover-what-an-ai-evaluation-actually-measures.webp)

# O que uma avaliação de IA realmente mede

Por [**Eric Hedlin**](https://www.strataigize.com/pt-BR/about/team/eric/), Cientista-chefe de IA · Publicado 13 de setembro de 2026 · 6 min de leitura

Uma nota de benchmark diz como um modelo se saiu num conjunto fixo de perguntas, pontuado de uma forma específica. Ela não diz se o modelo vai funcionar com os seus dados. Uma revisão de 445 benchmarks de modelos de linguagem feita em 2025 concluiu que só 16% aplicaram algum teste estatístico aos resultados, e outro trabalho mostra que cerca de metade dos modelos testados já tinha visto conteúdo dos benchmarks durante o treinamento. Antes de comprar um sistema de IA, monte um pequeno conjunto rotulado com os seus próprios casos reais e meça com base nele.

Neste artigo

1.  [Um benchmark é um instrumento, e instrumentos precisam de validação](https://www.strataigize.com/pt-BR/insights/what-an-ai-evaluation-actually-measures/#um-benchmark-%C3%A9-um-instrumento-e-instrumentos-precisam-de-valida%C3%A7%C3%A3o)
2.  [O problema da contaminação deixa o número ainda mais frágil](https://www.strataigize.com/pt-BR/insights/what-an-ai-evaluation-actually-measures/#o-problema-da-contamina%C3%A7%C3%A3o-deixa-o-n%C3%BAmero-ainda-mais-fr%C3%A1gil)
3.  [Como isso aparecia na pesquisa](https://www.strataigize.com/pt-BR/insights/what-an-ai-evaluation-actually-measures/#como-isso-aparecia-na-pesquisa)
4.  [A avaliação que você mesmo constrói é a única feita para a sua decisão](https://www.strataigize.com/pt-BR/insights/what-an-ai-evaluation-actually-measures/#a-avalia%C3%A7%C3%A3o-que-voc%C3%AA-mesmo-constr%C3%B3i-%C3%A9-a-%C3%BAnica-feita-para-a-sua-decis%C3%A3o)
5.  [O que perguntar a um fornecedor](https://www.strataigize.com/pt-BR/insights/what-an-ai-evaluation-actually-measures/#o-que-perguntar-a-um-fornecedor)
6.  [Como aplicamos isso](https://www.strataigize.com/pt-BR/insights/what-an-ai-evaluation-actually-measures/#como-aplicamos-isso)
7.  [Fontes](https://www.strataigize.com/pt-BR/insights/what-an-ai-evaluation-actually-measures/#fontes)

[Adicionar-nos como fonte preferida no Google](https://www.google.com/preferences/source?q=strataigize.com)

Uma configuração gratuita do Google para ver mais dos nossos artigos relevantes nas suas buscas. Você pode mudar a qualquer momento.

Toda apresentação de fornecedor de IA tem um gráfico em que a barra dele é mais alta que as outras. O gráfico costuma estar correto. Também costuma ser irrelevante para a pergunta que o comprador de fato está fazendo: se aquilo vai funcionar com os seus próprios documentos, os seus próprios chamados, as suas próprias imagens.

Essa distância não é desonestidade de marketing. É um problema de medição, e ele foi documentado com cuidado suficiente para que você mesmo possa verificá-lo.

## Um benchmark é um instrumento, e instrumentos precisam de validação

Nas ciências que medem coisas que não se veem diretamente, um instrumento de medição precisa conquistar confiança antes que as suas leituras signifiquem algo. A propriedade medida precisa estar definida. É preciso mostrar que o teste mede essa propriedade, e não algo correlacionado a ela. O resultado precisa vir com alguma estimativa de quanto dele é ruído. A psicometria chama isso de validade de construto, e é prática comum.

Benchmarks de modelos de linguagem são instrumentos exatamente desse tipo. “Raciocínio” e “utilidade” não são diretamente observáveis, então um benchmark faz as vezes deles. Se esse substituto funciona é uma pergunta que tem resposta, e em 2025 uma equipe de 29 revisores a respondeu para [445 benchmarks de conferências de ponta em processamento de linguagem natural e aprendizado de máquina](https://arxiv.org/abs/2511.04703), num trabalho publicado na trilha Datasets and Benchmarks da NeurIPS 2025.

Vale ler os números com calma:

-   **16,0%** fizeram algum teste estatístico ou estimativa de incerteza. Os outros 84% informam um número sem nenhuma indicação de quanto ele mudaria se o teste fosse rodado de novo.
-   **47,8%** dos benchmarks que chegaram a definir o seu alvo mediam um fenômeno controverso, ou seja, algo cuja definição a área não tem consenso.
-   **81,3%** pontuaram por correspondência exata de texto, e 40,7% não usaram mais nada. Uma resposta correta formulada de outro jeito conta como errada.
-   **42,6%** reaproveitaram itens de benchmarks existentes, e é assim que uma falha num teste se espalha para os testes que deveriam verificá-lo.

![Gráfico de barras de 445 benchmarks de modelos de linguagem: 16 por cento aplicaram algum teste estatístico, 47,8 por cento mediam um alvo controverso, 81,3 por cento pontuaram por correspondência exata de texto, 42,6 por cento reaproveitaram itens](https://www.strataigize.com/blog/real/what-an-ai-evaluation-actually-measures-chart-1.svg)

_A maioria dos 445 benchmarks nunca validou o instrumento. Fonte: [NeurIPS 2025, Measuring what Matters](https://arxiv.org/abs/2511.04703)._

Nada disso significa que os benchmarks não valem nada. Significa que uma nota de benchmark é uma afirmação mais fraca do que parece, e a força dessa afirmação raramente aparece ao lado dela.

## O problema da contaminação deixa o número ainda mais frágil

Um benchmark só funciona se o modelo ainda não viu as respostas. Os corpora de treinamento modernos são grandes o bastante, e coletados de forma ampla o bastante, para que isso seja difícil de garantir e fácil de errar.

Pesquisadores da Universidade Jiao Tong de Xangai [testaram 31 modelos em busca de sinais de vazamento de benchmark](https://arxiv.org/html/2404.18824v1) no GSM8K e no MATH, dois conjuntos de dados de raciocínio matemático, usando perplexidade e acurácia de previsão de n-gramas para detectar memorização. Cerca de metade mostrou sinais de ter treinado com dados dos benchmarks. No caso mais claro, o Qwen-1.8B reproduziu cada sequência de cinco palavras em 223 exemplos do conjunto de treinamento do GSM8K, 67 do conjunto de treinamento do MATH e 25 do conjunto de **teste** do MATH, a parte cujo único propósito é não ter sido vista.

Um modelo que memorizou parte de um teste vai pontuar bem nele e não vai dizer nada sobre o desempenho em qualquer outra coisa. Visto de fora, isso é idêntico a um modelo que simplesmente é bom.

## Como isso aparecia na pesquisa

O meu doutorado tratou de fazer modelos pré-treinados executarem tarefas visuais para as quais nunca foram treinados, sem exemplos rotulados: encontrar [correspondências semânticas com um modelo de difusão](https://proceedings.neurips.cc/paper_files/paper/2023/hash/1a074a28c3a6f2056562d00649ae6416-Abstract-Conference.html) na NeurIPS 2023 e depois [pontos-chave a partir da mesma classe de modelo](https://openaccess.thecvf.com/content/CVPR2024/html/Hedlin_Unsupervised_Keypoints_from_Pretrained_Diffusion_Models_CVPR_2024_paper.html) na conferência Computer Vision and Pattern Recognition de 2024. Os dois foram medidos em benchmarks rotulados padrão, porque é assim que a área compara métodos.

Esses números eram reais e as comparações eram justas. Mas não respondiam à pergunta que uma empresa faria: se o método funciona com as imagens dela, na resolução dela, com a iluminação dela, segundo a definição dela de resposta correta. Desempenho em benchmark e desempenho em produção são medições diferentes. Quem já levou um modelo de um artigo para um produto viu essa distância.

## A avaliação que você mesmo constrói é a única feita para a sua decisão

A solução é pouco glamorosa e funciona. Antes de se comprometer com um sistema de IA, reúna um conjunto de casos reais da sua própria operação e rotule à mão o resultado correto. É a meia jornada mais útil que alguém dedica a um projeto de IA.

**Tire amostras da realidade, não dos casos fáceis.** Pegue leads reais, chamados reais, faturas reais, fotos reais, incluindo os malformados. Um conjunto tirado só de exemplos limpos mede um sistema que você não tem.

**Mire em 100 a 300 itens rotulados para começar.** O suficiente para separar um sistema que acerta na maior parte das vezes de um que acerta só um pouco mais que o acaso, e pouco o bastante para que uma pessoa consiga fazer isso numa tarde.

**Escreva o que significa correto antes de olhar qualquer resultado.** Duas pessoas da mesma equipe muitas vezes discordam sobre se um lead era qualificado ou se um documento foi arquivado corretamente. Resolver essa discordância no papel vale a pena comprando algo ou não, e fazer isso depois significa que a definição se dobra para caber no resultado.

**Rotule os casos ambíguos como ambíguos.** Forçar uma resposta binária num caso que a sua própria equipe escalaria cria um teste que pune o comportamento correto.

**Guarde uma parte.** Mantenha uma porção que ninguém que constrói ou ajusta o sistema veja, incluindo o seu fornecedor. Essa parte reservada é a única cuja nota você pode aceitar pelo valor de face.

**Registre a taxa de discordância entre os seus próprios rotuladores.** Se duas pessoas da sua equipe concordam em 85% das vezes, um sistema com 85% está no nível humano na sua tarefa, e um fornecedor que promete 99% está medindo outra coisa ou viu as suas respostas.

## O que perguntar a um fornecedor

As perguntas úteis são sobre o método, não sobre a nota.

Pergunte em que o número informado foi medido e se o sistema foi ajustado nesses mesmos dados. Peça o desempenho nos casos em que ele erra, já que a análise de erros esteve quase ausente dos 445 benchmarks revisados e costuma ser onde mora o risco operacional. Pergunte qual seria o número num conjunto que o fornecedor nunca viu, e então forneça um. Peça um intervalo de confiança, ou o resultado de rodar a avaliação mais de uma vez.

Um fornecedor que consegue responder a isso está fazendo o trabalho. Um fornecedor que responde só com uma posição num ranking disse onde está no teste de outra pessoa.

## Como aplicamos isso

Todo sistema do nosso [catálogo de sistemas de IA](https://www.strataigize.com/pt-BR/services/ai-systems/) segue uma sequência fixa, e o segundo passo é combinar um conjunto rotulado à mão com os casos reais do próprio cliente antes que alguém fale em horas economizadas. Nada é escalado com base num número de benchmark. A [AI Opportunity Audit](https://www.strataigize.com/pt-BR/offers/ai-opportunity-audit/) que abre a maioria dos projetos entrega esse conjunto rotulado, e ele é seu tenhamos ou não construído algo depois.

A avaliação também é o que dá sentido a um limite de interrupção por escrito. Combinar de antemão parar num nível definido de desempenho é uma promessa vazia sem uma forma combinada de medir o desempenho.

## Fontes

-   Measuring what Matters: Construct Validity in Large Language Model Benchmarks, trilha Datasets and Benchmarks da NeurIPS 2025: [arxiv.org/abs/2511.04703](https://arxiv.org/abs/2511.04703)
-   Benchmarking Benchmark Leakage in Large Language Models, Xu, Wang, Fan e Liu: [arxiv.org/html/2404.18824v1](https://arxiv.org/html/2404.18824v1)

Autor

**Eric Hedlin**

Próximo passo

Onde o seu crescimento está vazando? O Growth Diagnostic compara o seu funil em seis perguntas.

[Executar o diagnóstico →](https://www.strataigize.com/tools/growth-diagnostic/)

Fale conosco

### Fale com a equipe que operaria isso

Diga-nos onde olhar e respondemos em até 24 horas com o ponto de partida. Sem proposta até você ver o valor.

[Adicionar-nos como fonte preferida no Google](https://www.google.com/preferences/source?q=strataigize.com)

Uma configuração gratuita do Google para ver mais dos nossos artigos relevantes nas suas buscas. Você pode mudar a qualquer momento.

## Leitura relacionada

[Todos os artigos de IA e automação →](https://www.strataigize.com/pt-BR/insights/topics/ai-automation/)

[Automação com IA para empresas de serviços: por onde começarAutomatize a entrada de contatos, os follow-ups e os relatórios sem trocar de ferramentas. Veja como escolher um primeiro fluxo e medir o retorno.](https://www.strataigize.com/pt-BR/insights/ai-automation-for-service-businesses/)[Prompts de imagem do Gemini: estilos, edições e formatosPrompts de imagem do Gemini em estilo fotográfico, mais técnicas de proporção, edição e consistência conferidas na documentação oficial do Google.](https://www.strataigize.com/pt-BR/insights/gemini-image-prompts/)[Copie e cole estes prompts do ChatGPT para imagens incríveisPrompts do ChatGPT para copiar e colar: logos 3D, retratos cinematográficos, degradês e mockups de produto, atualizados para o GPT Image em 2026.](https://www.strataigize.com/pt-BR/insights/chatgpt-prompts-for-stunning-visuals/)

## Quer que a gente faça isso por você?

Agende uma consulta gratuita de 30 minutos. Sem proposta até você ver o valor.

[Agendar consulta de crescimento →](https://www.strataigize.com/pt-BR/audit/) [Nota **5,0** no Clutch](https://clutch.co/profile/strataigize-marketing)
