{"source":"Quelle IA, le classement des modèles de langage","edition":"2026-W40","date":"2026-09-28","licence":"Réutilisation libre en citant « Quelle IA, quelleia.com » et la date de l'édition. Les mesures renvoient à leurs sources d'origine.","page":"https://quelleia.com/classement/donnees/","dossier":"Données","resume":"Dans l'édition du 28 septembre 2026, Quelle IA suit 5 benchmarks sur la lecture de documents, la mémoire des faits et les longs contextes, dont 4 encore actifs. C'est trop peu, et les sources sont trop inégales, pour en tirer un score et un classement honnêtes : Données reste un dossier, qui ne pèse pas dans le score général.","benchmarks":[{"id":"simpleqa_verified","nom":"SimpleQA Verified","etat":"actif","en_une_phrase":"1 000 questions factuelles courtes et précises (politique, sciences, arts, sport, géographie) pour voir si le modèle sait ou invente.","notation":"Part de réponses jugées correctes par un modèle correcteur, qui distingue aussi les erreurs et les refus de répondre.","limites":"Le score global traite un refus prudent comme une erreur, alors que la tendance à s'abstenir varie beaucoup d'un modèle à l'autre.","mainteneur":"Google DeepMind pour le jeu de questions ; Epoch AI pour l'évaluation","url":"https://epoch.ai/benchmarks/simpleqa-verified","meilleurs_resultats":[{"modele":"GPT-6 Astra","resultat":"75,6 %","fiche":"https://quelleia.com/modeles/gpt-6-astra/"},{"modele":"Gemini 3.1 Pro","resultat":"73,5 %","fiche":"https://quelleia.com/modeles/gemini-3-1-pro/"},{"modele":"Claude Opus 5.5","resultat":"72,2 %","fiche":"https://quelleia.com/modeles/claude-opus-5-5/"}]},{"id":"gdp_pdf","nom":"GDP.pdf","etat":"actif","en_une_phrase":"100 questions sur de vrais documents PDF professionnels (finance, santé, droit, ingénierie) : tableaux, schémas, formulaires, clauses de contrat.","notation":"Part de questions où la réponse remplit tous les critères d'une grille propre à chaque tâche.","limites":"Scores bas en tout ou rien, 31 % au mieux. Le classement est tenu par Surge AI, fournisseur de données pour les laboratoires d'IA.","mainteneur":"Surge AI","url":"https://surgehq.ai/leaderboards/gdp-pdf","meilleurs_resultats":[{"modele":"GPT-5.6 Sol","resultat":"30,7 %","fiche":"https://quelleia.com/modeles/gpt-5-6-sol/"},{"modele":"Claude Opus 5.5","resultat":"30,6 %","fiche":"https://quelleia.com/modeles/claude-opus-5-5/"},{"modele":"Claude Fable 5","resultat":"30 %","fiche":"https://quelleia.com/modeles/claude-fable-5/"}]},{"id":"cl_bench","nom":"CL-bench","etat":"actif","en_une_phrase":"Apprendre un savoir nouveau fourni dans la consigne (un droit fictif, les règles d'un jeu inventé) et l'appliquer aussitôt.","notation":"Part des 1 899 tâches où la réponse satisfait tous les critères de la grille.","limites":"Notation en tout ou rien : une réponse presque juste vaut zéro, d'où des scores bas, 28 % au mieux.","mainteneur":"Tencent Hunyuan et université Fudan","url":"https://www.clbench.com/","meilleurs_resultats":[{"modele":"GPT-5.4","resultat":"27,9 %","fiche":"https://quelleia.com/modeles/gpt-5-4/"},{"modele":"GPT-5.1","resultat":"23,7 %","fiche":"https://quelleia.com/modeles/gpt-5-1/"},{"modele":"Grok 4.20","resultat":"22,2 %","fiche":"https://quelleia.com/modeles/grok-4-20/"}]},{"id":"cl_bench_life","nom":"CL-bench Life","etat":"actif","en_une_phrase":"Raisonner à partir de traces désordonnées de la vie courante : conversations, notes éparses, historiques d'activité.","notation":"Part des 405 tâches où la réponse satisfait tous les critères de la grille.","limites":"Notation en tout ou rien, scores très bas (22 % au mieux) et peu de modèles testés.","mainteneur":"Tencent Hunyuan et université Fudan","url":"https://www.clbench.com/","meilleurs_resultats":[{"modele":"GPT-5.5","resultat":"22,2 %","fiche":"https://quelleia.com/modeles/gpt-5-5/"},{"modele":"GPT-5.4","resultat":"21,7 %","fiche":"https://quelleia.com/modeles/gpt-5-4/"},{"modele":"GPT-5.1","resultat":"17,3 %","fiche":"https://quelleia.com/modeles/gpt-5-1/"}]},{"id":"fiction_livebench","nom":"Fiction.LiveBench","etat":"archive","en_une_phrase":"Répondre à des questions sur de longues histoires : qui sait quoi, dans quel ordre, ce qui est sous-entendu.","notation":"Part de bonnes réponses quand l'histoire fait environ 16 000 jetons ; le classement d'origine teste aussi des longueurs jusqu'à 192 000 jetons.","limites":"Seulement 36 questions sur 30 histoires. La longueur retenue ici, 16 000 jetons, est courte face aux contextes des modèles actuels.","mainteneur":"Fiction.live","url":"https://fiction.live/stories/Fiction-liveBench-Mar-14-2025/oQdzQvKHw8JyXbN87/home","meilleurs_resultats":[{"modele":"GPT-5","resultat":"97,2 %","fiche":"https://quelleia.com/modeles/gpt-5/"},{"modele":"o3-pro","resultat":"97,2 %","fiche":"https://quelleia.com/modeles/o3-pro/"},{"modele":"Grok 4","resultat":"94,4 %","fiche":"https://quelleia.com/modeles/grok-4/"}]}]}