# Données : un dossier sans score

> Dans l'édition du 28 septembre 2026, Quelle IA suit 5 benchmarks sur la lecture de documents, la mémoire des faits et les longs contextes, dont 4 encore actifs. C'est trop peu, et les sources sont trop inégales, pour en tirer un score et un classement honnêtes : Données reste un dossier, qui ne pèse pas dans le score général.

Page : https://quelleia.com/classement/donnees/

## SimpleQA Verified

1 000 questions factuelles courtes et précises (politique, sciences, arts, sport, géographie) pour voir si le modèle sait ou invente.

- État : actif
- Notation : Part de réponses jugées correctes par un modèle correcteur, qui distingue aussi les erreurs et les refus de répondre.
- Limites : Le score global traite un refus prudent comme une erreur, alors que la tendance à s'abstenir varie beaucoup d'un modèle à l'autre.
- Tenu par : Google DeepMind pour le jeu de questions ; Epoch AI pour l'évaluation
- 73 modèles mesurés
- Source : https://epoch.ai/benchmarks/simpleqa-verified

Meilleurs résultats publiés :

1. GPT-6 Astra : 75,6 %
2. Gemini 3.1 Pro : 73,5 %
3. Claude Opus 5.5 : 72,2 %

## GDP.pdf

100 questions sur de vrais documents PDF professionnels (finance, santé, droit, ingénierie) : tableaux, schémas, formulaires, clauses de contrat.

- État : actif
- Notation : Part de questions où la réponse remplit tous les critères d'une grille propre à chaque tâche.
- Limites : Scores bas en tout ou rien, 31 % au mieux. Le classement est tenu par Surge AI, fournisseur de données pour les laboratoires d'IA.
- Tenu par : Surge AI
- 30 modèles mesurés
- Source : https://surgehq.ai/leaderboards/gdp-pdf

Meilleurs résultats publiés :

1. GPT-5.6 Sol : 30,7 %
2. Claude Opus 5.5 : 30,6 %
3. Claude Fable 5 : 30 %

## CL-bench

Apprendre un savoir nouveau fourni dans la consigne (un droit fictif, les règles d'un jeu inventé) et l'appliquer aussitôt.

- État : actif
- Notation : Part des 1 899 tâches où la réponse satisfait tous les critères de la grille.
- Limites : Notation en tout ou rien : une réponse presque juste vaut zéro, d'où des scores bas, 28 % au mieux.
- Tenu par : Tencent Hunyuan et université Fudan
- 20 modèles mesurés
- Source : https://www.clbench.com/

Meilleurs résultats publiés :

1. GPT-5.4 : 27,9 %
2. GPT-5.1 : 23,7 %
3. Grok 4.20 : 22,2 %

## CL-bench Life

Raisonner à partir de traces désordonnées de la vie courante : conversations, notes éparses, historiques d'activité.

- État : actif
- Notation : Part des 405 tâches où la réponse satisfait tous les critères de la grille.
- Limites : Notation en tout ou rien, scores très bas (22 % au mieux) et peu de modèles testés.
- Tenu par : Tencent Hunyuan et université Fudan
- 14 modèles mesurés
- Source : https://www.clbench.com/

Meilleurs résultats publiés :

1. GPT-5.5 : 22,2 %
2. GPT-5.4 : 21,7 %
3. GPT-5.1 : 17,3 %

## Fiction.LiveBench

Répondre à des questions sur de longues histoires : qui sait quoi, dans quel ordre, ce qui est sous-entendu.

- État : archivé
- Notation : Part de bonnes réponses quand l'histoire fait environ 16 000 jetons ; le classement d'origine teste aussi des longueurs jusqu'à 192 000 jetons.
- Limites : Seulement 36 questions sur 30 histoires. La longueur retenue ici, 16 000 jetons, est courte face aux contextes des modèles actuels.
- Tenu par : Fiction.live
- 57 modèles mesurés
- Source : https://fiction.live/stories/Fiction-liveBench-Mar-14-2025/oQdzQvKHw8JyXbN87/home

Meilleurs résultats publiés :

1. GPT-5 : 97,2 %
2. o3-pro : 97,2 %
3. Grok 4 : 94,4 %

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
