Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

Classement · édition du

Classement des modèles de langage, Données

Quel modèle lit le mieux les documents et retient les faits ?

Un dossier, sans scorePourquoi pas de score ?

Données ne pèse pas dans le score général et n'a pas de classement. Les benchmarks de ce dossier sont suivis et leurs résultats figurent sur la fiche de chaque modèle, mais ils sont trop peu nombreux pour donner un score fiable.

Dans l'édition du 28 septembre 2026, Quelle IA suit 5 benchmarks sur la lecture de documents, la mémoire des faits et les longs contextes, dont 4 encore actifs. C'est trop peu, et les sources sont trop inégales, pour en tirer un score et un classement honnêtes : Données reste un dossier, qui ne pèse pas dans le score général. Voir le classement général.

SimpleQA VerifiedACTIF

1 000 questions factuelles courtes et précises (politique, sciences, arts, sport, géographie) pour voir si le modèle sait ou invente.

Notation
Part de réponses jugées correctes par un modèle correcteur, qui distingue aussi les erreurs et les refus de répondre.
Limites
Le score global traite un refus prudent comme une erreur, alors que la tendance à s'abstenir varie beaucoup d'un modèle à l'autre.
Tenu par
Google DeepMind pour le jeu de questions ; Epoch AI pour l'évaluation
  1. GPT-6 Astra75,6 %
  2. Gemini 3.1 Pro73,5 %
  3. Claude Opus 5.572,2 %

73 modèles mesurésLa fiche du benchmark →epoch.ai ↗

GDP.pdfACTIF

100 questions sur de vrais documents PDF professionnels (finance, santé, droit, ingénierie) : tableaux, schémas, formulaires, clauses de contrat.

Notation
Part de questions où la réponse remplit tous les critères d'une grille propre à chaque tâche.
Limites
Scores bas en tout ou rien, 31 % au mieux. Le classement est tenu par Surge AI, fournisseur de données pour les laboratoires d'IA.
Tenu par
Surge AI
  1. GPT-5.6 Sol30,7 %
  2. Claude Opus 5.530,6 %
  3. Claude Fable 530 %

30 modèles mesurésLa fiche du benchmark →surgehq.ai ↗

CL-benchACTIF

Apprendre un savoir nouveau fourni dans la consigne (un droit fictif, les règles d'un jeu inventé) et l'appliquer aussitôt.

Notation
Part des 1 899 tâches où la réponse satisfait tous les critères de la grille.
Limites
Notation en tout ou rien : une réponse presque juste vaut zéro, d'où des scores bas, 28 % au mieux.
Tenu par
Tencent Hunyuan et université Fudan
  1. GPT-5.427,9 %
  2. GPT-5.123,7 %
  3. Grok 4.2022,2 %

20 modèles mesurésLa fiche du benchmark →clbench.com ↗

CL-bench LifeACTIF

Raisonner à partir de traces désordonnées de la vie courante : conversations, notes éparses, historiques d'activité.

Notation
Part des 405 tâches où la réponse satisfait tous les critères de la grille.
Limites
Notation en tout ou rien, scores très bas (22 % au mieux) et peu de modèles testés.
Tenu par
Tencent Hunyuan et université Fudan
  1. GPT-5.522,2 %
  2. GPT-5.421,7 %
  3. GPT-5.117,3 %

14 modèles mesurésLa fiche du benchmark →clbench.com ↗

Fiction.LiveBenchARCHIVÉ

Répondre à des questions sur de longues histoires : qui sait quoi, dans quel ordre, ce qui est sous-entendu.

Notation
Part de bonnes réponses quand l'histoire fait environ 16 000 jetons ; le classement d'origine teste aussi des longueurs jusqu'à 192 000 jetons.
Limites
Seulement 36 questions sur 30 histoires. La longueur retenue ici, 16 000 jetons, est courte face aux contextes des modèles actuels.
Tenu par
Fiction.live
  1. GPT-597,2 %
  2. o3-pro97,2 %
  3. Grok 494,4 %

57 modèles mesurésLa fiche du benchmark →fiction.live ↗