Canonical: https://www.strataigize.com/it/insights/what-an-ai-evaluation-actually-measures/
Description: I punteggi dei benchmark sono strumenti di misura quasi mai validati come tali. Cosa verificare prima di fidarsi e cosa costruire al loro posto.
Published: 2026-09-13T00:00:00.000Z
Modified: 2026-09-13T00:00:00.000Z

[← Blog](https://www.strataigize.com/it/insights/)

![](https://www.strataigize.com/blog/real/cover-what-an-ai-evaluation-actually-measures.webp)

# Cosa misura davvero una valutazione dell'IA

Di [**Eric Hedlin**](https://www.strataigize.com/it/about/team/eric/), Capo scienziato IA · Pubblicato 13 settembre 2026 · 6 min di lettura

Un punteggio di benchmark vi dice come si è comportato un modello su un insieme fisso di domande, valutato in un modo particolare. Non vi dice se il modello funzionerà sui vostri dati. Una rassegna del 2025 su 445 benchmark per modelli linguistici ha rilevato che solo il 16% ha applicato un qualsiasi test statistico ai propri risultati, e un lavoro separato mostra che circa metà dei modelli testati aveva già visto contenuti dei benchmark durante l'addestramento. Prima di acquistare un sistema di IA, costruite un piccolo insieme etichettato con i vostri casi reali e misurate su quello.

In questo articolo

1.  [Un benchmark è uno strumento, e gli strumenti vanno validati](https://www.strataigize.com/it/insights/what-an-ai-evaluation-actually-measures/#un-benchmark-%C3%A8-uno-strumento-e-gli-strumenti-vanno-validati)
2.  [Il problema della contaminazione rende il numero ancora più fragile](https://www.strataigize.com/it/insights/what-an-ai-evaluation-actually-measures/#il-problema-della-contaminazione-rende-il-numero-ancora-pi%C3%B9-fragile)
3.  [Come appariva nella ricerca](https://www.strataigize.com/it/insights/what-an-ai-evaluation-actually-measures/#come-appariva-nella-ricerca)
4.  [La valutazione che costruite voi è l’unica pensata per la vostra decisione](https://www.strataigize.com/it/insights/what-an-ai-evaluation-actually-measures/#la-valutazione-che-costruite-voi-%C3%A8-lunica-pensata-per-la-vostra-decisione)
5.  [Cosa chiedere a un fornitore](https://www.strataigize.com/it/insights/what-an-ai-evaluation-actually-measures/#cosa-chiedere-a-un-fornitore)
6.  [Come lo applichiamo](https://www.strataigize.com/it/insights/what-an-ai-evaluation-actually-measures/#come-lo-applichiamo)
7.  [Fonti](https://www.strataigize.com/it/insights/what-an-ai-evaluation-actually-measures/#fonti)

[Aggiungerci come fonte preferita su Google](https://www.google.com/preferences/source?q=strataigize.com)

Un'impostazione gratuita di Google per vedere più dei nostri articoli rilevanti nelle sue ricerche. Può modificarla in qualsiasi momento.

Ogni presentazione di un fornitore di IA contiene un grafico in cui la sua barra è più alta delle altre. Il grafico di solito è corretto. Di solito è anche irrilevante per la domanda che l’acquirente si pone davvero: se quella cosa funzionerà sui suoi documenti, sui suoi ticket, sulle sue immagini.

Questo scarto non è disonestà del marketing. È un problema di misurazione, ed è stato documentato con abbastanza cura da poterlo verificare da soli.

## Un benchmark è uno strumento, e gli strumenti vanno validati

Nelle scienze che misurano cose non osservabili direttamente, uno strumento di misura deve guadagnarsi fiducia prima che le sue letture significhino qualcosa. La proprietà misurata deve essere definita. Bisogna dimostrare che il test misura quella proprietà e non qualcosa di correlato. Il risultato deve essere accompagnato da una stima di quanto sia rumore. La psicometria la chiama validità di costrutto, ed è prassi comune.

I benchmark per i modelli linguistici sono strumenti esattamente di questo tipo. “Ragionamento” e “utilità” non sono osservabili direttamente, quindi un benchmark li rappresenta. Se questo sostituto funzioni è una domanda che ha una risposta, e nel 2025 un gruppo di 29 revisori l’ha data per [445 benchmark tratti dalle principali conferenze di elaborazione del linguaggio naturale e apprendimento automatico](https://arxiv.org/abs/2511.04703), in un lavoro pubblicato nel track Datasets and Benchmarks di NeurIPS 2025.

Vale la pena leggere i numeri con calma:

-   **16,0%** ha svolto un qualsiasi test statistico o stima dell’incertezza. L’altro 84% riporta un numero senza indicare di quanto cambierebbe ripetendo la prova.
-   **47,8%** dei benchmark che definivano il proprio obiettivo misurava un fenomeno controverso, cioè qualcosa su cui il settore non concorda sulla definizione.
-   **81,3%** assegnava il punteggio con corrispondenza esatta delle stringhe, e il 40,7% non usava nient’altro. Una risposta corretta formulata diversamente conta come sbagliata.
-   **42,6%** riutilizzava elementi di benchmark esistenti, ed è così che un difetto in un test si propaga nei test che avrebbero dovuto controllarlo.

![Grafico a barre di 445 benchmark per modelli linguistici: il 16 per cento ha svolto un test statistico, il 47,8 per cento misurava un obiettivo controverso, l'81,3 per cento assegnava il punteggio con corrispondenza esatta delle stringhe, il 42,6 per cento riutilizzava elementi](https://www.strataigize.com/blog/real/what-an-ai-evaluation-actually-measures-chart-1.svg)

_La maggior parte dei 445 benchmark non ha mai validato lo strumento. Fonte: [NeurIPS 2025, Measuring what Matters](https://arxiv.org/abs/2511.04703)._

Niente di tutto questo significa che i benchmark siano inutili. Significa che un punteggio di benchmark è un’affermazione più debole di quanto sembri, e la forza di quell’affermazione raramente viene indicata accanto.

## Il problema della contaminazione rende il numero ancora più fragile

Un benchmark funziona solo se il modello non ha già visto le risposte. I corpus di addestramento moderni sono abbastanza grandi, e raccolti in modo abbastanza ampio, da rendere difficile garantirlo e facile sbagliare.

Ricercatori della Shanghai Jiao Tong University [hanno testato 31 modelli alla ricerca di segni di fuga dei benchmark](https://arxiv.org/html/2404.18824v1) su GSM8K e MATH, due dataset di ragionamento matematico, usando la perplessità e l’accuratezza di previsione degli n-grammi per rilevare la memorizzazione. Circa la metà mostrava segni di essere stata addestrata su dati dei benchmark. Nel caso più evidente, Qwen-1.8B riproduceva ogni sequenza di cinque parole in 223 esempi del set di addestramento di GSM8K, 67 del set di addestramento di MATH e 25 del set di **test** di MATH, la parte il cui unico scopo è non essere stata vista.

Un modello che ha memorizzato parte di un test otterrà un buon punteggio e non vi dirà nulla sulle prestazioni in qualsiasi altra cosa. Dall’esterno appare identico a un modello semplicemente bravo.

## Come appariva nella ricerca

Il mio dottorato riguardava il far svolgere a modelli preaddestrati compiti visivi per cui non erano mai stati addestrati, senza esempi etichettati: trovare [corrispondenze semantiche con un modello di diffusione](https://proceedings.neurips.cc/paper_files/paper/2023/hash/1a074a28c3a6f2056562d00649ae6416-Abstract-Conference.html) a NeurIPS 2023, poi [punti chiave dalla stessa classe di modelli](https://openaccess.thecvf.com/content/CVPR2024/html/Hedlin_Unsupervised_Keypoints_from_Pretrained_Diffusion_Models_CVPR_2024_paper.html) alla conferenza Computer Vision and Pattern Recognition del 2024. Entrambi sono stati misurati su benchmark etichettati standard, perché è così che il settore confronta i metodi.

Quei numeri erano reali e i confronti erano equi. Ma non potevano rispondere alla domanda che si porrebbe un’azienda: se il metodo funziona sulle sue immagini, alla sua risoluzione, con la sua illuminazione, secondo la sua definizione di risposta corretta. Le prestazioni sui benchmark e quelle in produzione sono misure diverse. Chiunque abbia portato un modello da un articolo a un prodotto ha visto questo scarto.

## La valutazione che costruite voi è l’unica pensata per la vostra decisione

La soluzione è poco affascinante e funziona. Prima di impegnarvi con un sistema di IA, raccogliete un insieme di casi reali della vostra attività ed etichettate a mano il risultato corretto. È la mezza giornata più utile che qualcuno possa dedicare a un progetto di IA.

**Campionate dalla realtà, non dai casi facili.** Prendete lead reali, ticket reali, fatture reali, foto reali, comprese quelle malformate. Un insieme tratto solo da esempi puliti misura un sistema che non avete.

**Puntate a 100-300 elementi etichettati per iniziare.** Abbastanza da distinguere un sistema che ha ragione la maggior parte delle volte da uno che ha ragione solo un po’ più spesso del caso, e pochi abbastanza da poterli fare davvero in un pomeriggio.

**Scrivete cosa significa corretto prima di guardare qualsiasi output.** Due persone dello stesso team spesso non concordano sul fatto che un lead fosse qualificato o che un documento fosse archiviato correttamente. Risolvere quel disaccordo sulla carta vale la pena a prescindere da ciò che comprerete, e farlo dopo significa piegare la definizione al risultato.

**Etichettate come ambigui i casi ambigui.** Imporre una risposta binaria a un caso che il vostro stesso team farebbe salire di livello crea un test che punisce il comportamento corretto.

**Tenetene da parte una porzione.** Conservate una parte che nessuno di chi costruisce o regola il sistema vede, compreso il vostro fornitore. Quella parte riservata è l’unica il cui punteggio potete prendere per buono.

**Registrate il tasso di disaccordo tra i vostri etichettatori.** Se due delle vostre persone concordano l’85% delle volte, un sistema che ottiene l’85% lavora a livello umano sul vostro compito, e un fornitore che promette il 99% sta misurando qualcos’altro o ha visto le vostre risposte.

## Cosa chiedere a un fornitore

Le domande utili riguardano il metodo, non il punteggio.

Chiedete su cosa è stato misurato il numero riportato e se il sistema è stato regolato su quegli stessi dati. Chiedete le prestazioni sui casi che sbaglia, perché l’analisi degli errori era in gran parte assente nei 445 benchmark esaminati ed è di solito lì che si trova il rischio operativo. Chiedete quale sarebbe il numero su un insieme che il fornitore non ha mai visto, e poi fornitene uno. Chiedete un intervallo di confidenza, o il risultato ottenuto ripetendo la valutazione più di una volta.

Un fornitore che sa rispondere a queste domande sta facendo il lavoro. Un fornitore che risponde solo con una posizione in classifica vi ha detto dove si colloca nel test di qualcun altro.

## Come lo applichiamo

Ogni sistema del nostro [catalogo di sistemi di IA](https://www.strataigize.com/it/services/ai-systems/) segue una sequenza fissa, e il secondo passo è concordare un insieme etichettato a mano con i casi reali del cliente prima che si parli di ore risparmiate. Nulla viene scalato sulla base di un punteggio di benchmark. L’[AI Opportunity Audit](https://www.strataigize.com/it/offers/ai-opportunity-audit/) che apre la maggior parte degli incarichi produce quell’insieme etichettato come deliverable, e resta vostro che poi costruiamo qualcosa o no.

La valutazione è anche ciò che dà senso a una soglia di interruzione scritta. Concordare in anticipo di fermarsi a un livello di prestazione definito è una promessa vuota senza un modo concordato di misurare le prestazioni.

## Fonti

-   Measuring what Matters: Construct Validity in Large Language Model Benchmarks, track Datasets and Benchmarks di NeurIPS 2025: [arxiv.org/abs/2511.04703](https://arxiv.org/abs/2511.04703)
-   Benchmarking Benchmark Leakage in Large Language Models, Xu, Wang, Fan e Liu: [arxiv.org/html/2404.18824v1](https://arxiv.org/html/2404.18824v1)

Autore

**Eric Hedlin**

Prossimo passo

Dove perde il tuo funnel? Il Growth Diagnostic lo confronta in sei domande.

[Esegui il diagnostic →](https://www.strataigize.com/tools/growth-diagnostic/)

Parla con noi

### Parli con il team che lo gestirebbe

Ci dica dove guardare e rispondiamo entro 24 ore con il punto di partenza. Nessuna proposta finché non vede il valore.

[Aggiungerci come fonte preferita su Google](https://www.google.com/preferences/source?q=strataigize.com)

Un'impostazione gratuita di Google per vedere più dei nostri articoli rilevanti nelle sue ricerche. Può modificarla in qualsiasi momento.

## Letture correlate

[Tutti gli articoli su IA e automazione →](https://www.strataigize.com/it/insights/topics/ai-automation/)

[Sviluppare o comprare agenti IA: una regola per il 2026Sviluppare o comprare agenti IA nel 2026: la regola decisionale, la vera struttura dei costi e perché i progetti esterni riescono il doppio degli interni.](https://www.strataigize.com/it/insights/build-vs-buy-ai-agents/)[Quanto costano gli agenti IA nel 2026? Fasce realiCosti degli agenti IA nel 2026: $3 000-$8 000 per un solo workflow, $40 000-$150 000 per la maggior parte dei progetti su misura, e cosa decide il prezzo.](https://www.strataigize.com/it/insights/how-much-do-ai-agents-cost/)[24 domande da fare a un fornitore di agenti IALe 24 domande che separano chi costruisce davvero agenti IA dall'agent washing: perimetro, dati, sicurezza, proprietà, prezzi e criteri di stop.](https://www.strataigize.com/it/insights/questions-to-ask-an-ai-agent-vendor/)

## Vuoi che lo facciamo per te?

Prenota una consulenza gratuita di 30 minuti. Nessun pitch finche non vedi il valore.

[Prenota una consulenza di crescita →](https://www.strataigize.com/it/audit/) [Valutazione **5,0** su Clutch](https://clutch.co/profile/strataigize-marketing)
