Canonical: https://www.strataigize.com/fr/insights/what-an-ai-evaluation-actually-measures/
Description: Les scores de référence sont des instruments de mesure, souvent non validés. Quoi vérifier avant d’en faire confiance, et quoi bâtir à la place.
Published: 2026-09-13T00:00:00.000Z
Modified: 2026-09-13T00:00:00.000Z

[← Blogue](https://www.strataigize.com/fr/insights/)

![](https://www.strataigize.com/blog/real/cover-what-an-ai-evaluation-actually-measures.webp)

# Ce qu’une évaluation IA mesure vraiment

Par [**Eric Hedlin**](https://www.strataigize.com/fr/about/team/eric/), Chief AI Scientist · Publié 13 septembre 2026 · 6 min de lecture

Un score de référence vous dit comment un modèle a performé sur un jeu fixe de questions, noté d’une façon particulière. Il ne vous dit pas si le modèle fonctionnera sur vos données. Une revue 2025 de 445 références de modèles de langue a trouvé que seulement 16 % avaient fait un test statistique sur leurs résultats, et un travail distinct montre qu’environ la moitié des modèles testés avaient déjà vu le contenu de la référence pendant l’entraînement. Avant d’acheter un système IA, bâtissez un petit jeu étiqueté à partir de vos propres cas réels et mesurez contre celui-là.

Dans cet article

1.  [Une référence est un instrument, et les instruments ont besoin de validation](https://www.strataigize.com/fr/insights/what-an-ai-evaluation-actually-measures/#une-r%C3%A9f%C3%A9rence-est-un-instrument-et-les-instruments-ont-besoin-de-validation)
2.  [Le problème de contamination rend le chiffre encore plus mou](https://www.strataigize.com/fr/insights/what-an-ai-evaluation-actually-measures/#le-probl%C3%A8me-de-contamination-rend-le-chiffre-encore-plus-mou)
3.  [À quoi cela ressemblait dans la recherche](https://www.strataigize.com/fr/insights/what-an-ai-evaluation-actually-measures/#%C3%A0-quoi-cela-ressemblait-dans-la-recherche)
4.  [L’évaluation que vous bâtissez vous-même est la seule cadrée sur votre décision](https://www.strataigize.com/fr/insights/what-an-ai-evaluation-actually-measures/#l%C3%A9valuation-que-vous-b%C3%A2tissez-vous-m%C3%AAme-est-la-seule-cadr%C3%A9e-sur-votre-d%C3%A9cision)
5.  [Quoi demander à un fournisseur](https://www.strataigize.com/fr/insights/what-an-ai-evaluation-actually-measures/#quoi-demander-%C3%A0-un-fournisseur)
6.  [Comment nous l’appliquons](https://www.strataigize.com/fr/insights/what-an-ai-evaluation-actually-measures/#comment-nous-lappliquons)
7.  [Sources](https://www.strataigize.com/fr/insights/what-an-ai-evaluation-actually-measures/#sources)

[Add us as a preferred source on Google](https://www.google.com/preferences/source?q=strataigize.com)

A free Google setting. It puts our work higher in your own results, changes nothing for anyone else, and you can undo it any time.

Chaque jeu de diapositives de fournisseur IA contient un graphique où leur barre est plus haute que les autres. Le graphique est d’habitude exact. Il est aussi d’habitude hors sujet pour la question que l’acheteur pose vraiment, à savoir si la chose fonctionnera sur ses propres documents, ses propres billets, ses propres images.

Cet écart n’est pas de la malhonnêteté marketing. C’est un problème de mesure, et il a été documenté assez soigneusement pour que vous puissiez le vérifier vous-même.

## Une référence est un instrument, et les instruments ont besoin de validation

Dans les sciences qui mesurent des choses que vous ne pouvez pas voir directement, un instrument de mesure doit gagner la confiance avant que ses lectures veuillent dire quelque chose. La propriété mesurée doit être définie. Le test doit être montré comme mesurant cette propriété plutôt que quelque chose de corrélé. Le résultat doit venir avec une estimation de la part qui est du bruit. La psychométrie appelle cela la validité de construit, et c’est une pratique ordinaire.

Les références de modèles de langue sont des instruments de exactement ce genre. Le « raisonnement » et l’« utilité » ne sont pas directement observables, donc une référence se substitue à eux. La question de savoir si le substitut fonctionne a une réponse, et en 2025 une équipe de 29 réviseurs y a répondu sur [445 références tirées de grandes conférences de traitement du langage naturel et d’apprentissage automatique](https://arxiv.org/abs/2511.04703), dans un travail publié dans la piste Datasets and Benchmarks de NeurIPS 2025.

Les chiffres valent une lecture lente :

-   **16,0 %** ont fait un test statistique ou une estimation d’incertitude. Les autres 84 % rapportent un chiffre sans indication de combien il bougerait si vous le relanciez.
-   **47,8 %** des références qui ont défini leur cible du tout mesuraient un phénomène contesté, c’est-à-dire quelque chose dont le champ ne s’entend pas sur la définition.
-   **81,3 %** ont noté par correspondance exacte de chaînes, et 40,7 % n’ont utilisé rien d’autre. Une bonne réponse formulée autrement compte comme fausse.
-   **42,6 %** ont réutilisé des items de références existantes, ce qui est comment un défaut dans un test se propage dans les tests qui étaient censés le vérifier.

![Graphique en barres de 445 références de modèles de langue : 16 pour cent ont fait un test statistique, 47,8 pour cent ont mesuré une cible contestée, 81,3 pour cent ont noté par correspondance exacte de chaînes, 42,6 pour cent ont réutilisé des items](https://www.strataigize.com/blog/real/what-an-ai-evaluation-actually-measures-chart-1.svg)

_La plupart des 445 références n’ont jamais validé l’instrument. Source : [NeurIPS 2025, Measuring what Matters](https://arxiv.org/abs/2511.04703)._

Rien de cela ne veut dire que les références ne valent rien. Cela veut dire qu’un score de référence est une affirmation plus faible qu’il n’y paraît, et que la force de l’affirmation est rarement énoncée à côté.

## Le problème de contamination rend le chiffre encore plus mou

Une référence ne fonctionne que si le modèle n’a pas déjà vu les réponses. Les corpus d’entraînement modernes sont assez grands, et assez largement moissonnés, pour que ce soit difficile à garantir et facile à rater.

Des chercheurs de l’Université Jiao Tong de Shanghai [ont testé 31 modèles pour des preuves de fuite de référence](https://arxiv.org/html/2404.18824v1) sur GSM8K et MATH, deux jeux de raisonnement mathématique, en utilisant la perplexité et la précision de prédiction de n-grammes pour détecter la mémorisation. Environ la moitié ont montré des signes d’avoir été entraînés sur les données de référence. Dans le cas le plus clair, Qwen-1.8B a reproduit chaque séquence de cinq mots dans 223 exemples du jeu d’entraînement GSM8K, 67 du jeu d’entraînement MATH, et 25 du jeu de **test** MATH, la scission dont tout le but est de rester non vue.

Un modèle qui a mémorisé une partie d’un test y scorera bien et ne vous dira rien sur la performance sur quoi que ce soit d’autre. De l’extérieur, cela a l’air identique à un modèle qui est simplement bon.

## À quoi cela ressemblait dans la recherche

Mon travail doctoral portait sur le fait d’amener des modèles préentraînés à faire des tâches visuelles pour lesquelles ils n’avaient jamais été entraînés, sans exemples étiquetés : trouver des [correspondances sémantiques avec un modèle de diffusion](https://proceedings.neurips.cc/paper_files/paper/2023/hash/1a074a28c3a6f2056562d00649ae6416-Abstract-Conference.html) à NeurIPS 2023, puis des [points clés de la même classe de modèle](https://openaccess.thecvf.com/content/CVPR2024/html/Hedlin_Unsupervised_Keypoints_from_Pretrained_Diffusion_Models_CVPR_2024_paper.html) à la conférence Computer Vision and Pattern Recognition en 2024. Les deux ont été mesurés contre des références étiquetées standard, parce que c’est ainsi que le champ compare les méthodes.

Ces chiffres étaient réels et les comparaisons étaient justes. Ils ne pouvaient pas non plus répondre à la question qu’une entreprise poserait, à savoir si la méthode fonctionne sur leurs images, à leur résolution, avec leur éclairage, sous leur définition d’une bonne réponse. La performance de référence et la performance déployée sont des mesures différentes. Quiconque a déplacé un modèle d’un article vers un produit a vu l’écart.

## L’évaluation que vous bâtissez vous-même est la seule cadrée sur votre décision

La correction n’a rien de glamour et elle fonctionne. Avant de vous engager sur un système IA, assemblez un jeu de vrais cas de votre propre opération et étiquetez le bon résultat à la main. C’est la demi-journée la plus utile que quiconque passe sur un projet IA.

**Échantillonnez la réalité, pas les cas faciles.** Tirez de vraies pistes, de vrais billets, de vraies factures, de vraies photographies, y compris les mal formés. Un jeu tiré seulement d’exemples propres mesure un système que vous n’avez pas.

**Visez 100 à 300 items étiquetés pour commencer.** Assez pour séparer un système qui a raison la plupart du temps d’un qui a raison un peu plus souvent que le hasard, et assez petit pour qu’une personne puisse vraiment le faire en un après-midi.

**Écrivez ce que « correct » veut dire avant de regarder toute sortie.** Deux personnes de la même équipe sont souvent en désaccord sur le fait qu’une piste était qualifiée ou qu’un document a été classé correctement. Trancher ce désaccord sur papier vaut la peine, que vous achetiez ou non, et le faire après coup veut dire que la définition se plie pour coller au résultat.

**Étiquetez les cas ambigus comme ambigus.** Forcer une réponse binaire sur un cas que votre propre équipe ferait monter construit un test qui punit le bon comportement.

**Gardez-en une part de côté.** Gardez une portion non vue par quiconque bâtit ou règle le système, y compris votre fournisseur. Cette portion tenue de côté est la seule dont le score vous pouvez prendre au premier degré.

**Notez le taux de désaccord entre vos propres étiqueteurs.** Si deux de vos gens s’entendent 85 % du temps, un système qui score 85 % performe au niveau humain sur votre tâche, et un fournisseur qui promet 99 % mesure autre chose ou a vu vos réponses.

## Quoi demander à un fournisseur

Les questions utiles portent sur la méthode plutôt que sur le score.

Demandez sur quoi le chiffre rapporté a été mesuré, et si le système a été réglé sur ces mêmes données. Demandez la performance sur les cas qu’il rate, puisque l’analyse d’erreurs était largement absente des 445 références revues et que c’est d’habitude là que vit le risque opérationnel. Demandez ce que serait le chiffre sur un jeu que le fournisseur n’a jamais vu, puis fournissez-en un. Demandez un intervalle de confiance, ou le résultat d’avoir fait tourner l’évaluation plus d’une fois.

Un fournisseur qui peut répondre à cela fait le travail. Un fournisseur qui répond seulement avec une position de tableau de classement vous a dit où il se classe sur le test de quelqu’un d’autre.

## Comment nous l’appliquons

Chaque système de notre [catalogue de systèmes d’IA](https://www.strataigize.com/services/ai-systems/) est bâti sur une séquence fixe, et la deuxième étape est qu’un jeu étiqueté à la main des propres cas réels du client est convenu avant que quiconque discute d’heures sauvées. Rien ne se met à l’échelle sur un chiffre de référence. L’[audit d’occasions IA](https://www.strataigize.com/offers/ai-opportunity-audit/) qui ouvre la plupart des engagements produit ce jeu étiqueté comme livrable, et il est à vous que nous bâtissions quelque chose après ou non.

L’évaluation est aussi ce qui rend un seuil d’arrêt écrit significatif. Convenir à l’avance d’arrêter à un niveau de performance défini est une promesse vide sans une façon convenue de mesurer la performance.

## Sources

-   Measuring what Matters: Construct Validity in Large Language Model Benchmarks, piste Datasets and Benchmarks de NeurIPS 2025 : [arxiv.org/abs/2511.04703](https://arxiv.org/abs/2511.04703)
-   Benchmarking Benchmark Leakage in Large Language Models, Xu, Wang, Fan et Liu : [arxiv.org/html/2404.18824v1](https://arxiv.org/html/2404.18824v1)

Auteur

**Eric Hedlin**, Chief AI Scientist at Strataigize. PhD in computer science (UBC). Signs off AI systems so they hold in production, with a baseline.

Prochaine étape

Six questions, un goulot. Le diagnostic de croissance compare chaque étape de votre entonnoir et vous donne le correctif qui paie en premier.

[Lancer le diagnostic →](https://www.strataigize.com/fr/tools/growth-diagnostic/)

Parlez-nous

### Parlez à l’équipe qui s’en occuperait

Dites-nous où regarder et nous répondons en moins de 24 heures avec l’endroit par lequel nous commencerions. Aucune proposition tant que vous n’avez pas vu la valeur.

[Add us as a preferred source on Google](https://www.google.com/preferences/source?q=strataigize.com)

A free Google setting. It puts our work higher in your own results, changes nothing for anyone else, and you can undo it any time.

## Lectures liées

[Tous les articles IA et automatisation →](https://www.strataigize.com/fr/insights/topics/ai-automation/)

[Automatisation IA pour les services : par où commencerAutomatisez la prise de pistes, les suivis et les rapports sans remplacer vos outils. Apprenez à choisir un premier flux et à mesurer son rendement.](https://www.strataigize.com/fr/insights/ai-automation-for-service-businesses/)[Invites d’images Gemini : styles photo, montages et ratiosExemples d’invites d’images Gemini de style photo, plus ratio d’aspect, montage et cohérence, vérifiés contre la documentation Google.](https://www.strataigize.com/fr/insights/gemini-image-prompts/)[Copiez-collez ces invites ChatGPT pour des visuels frappantsInvites ChatGPT à copier-coller pour des visuels frappants : logos 3D, portraits, dégradés et maquettes, mises à jour pour GPT Image en 2026.](https://www.strataigize.com/fr/insights/chatgpt-prompts-for-stunning-visuals/)

## Vous voulez que l’IA fasse cela pour votre croissance?

Nous bâtissons des systèmes d’acquisition, de contenu et d’automatisation pour des exploitants en Amérique du Nord. Voyez vos leviers en 30 minutes.

[Réserver un audit de croissance →](https://www.strataigize.com/fr/audit/) [Note de **5,0** sur Clutch](https://clutch.co/profile/strataigize-marketing)

[Explorer l’automatisation IA →](https://www.strataigize.com/fr/services/ai-automation-services/)
