{"source":"Quelle IA, le classement des modèles de langage","page":"https://quelleia.com/benchmarks/csqa2/","edition":"2026-W40","date":"2026-09-28","echelle":"score_publie est le score de la source, dans son unité. score_0_1 est ce score ramené entre 0 et 1 pour le calcul. niveau_suggere est le score IA que cette seule mesure indique : 100 pour le meilleur modèle au lancement du site, 50 pour GPT-4o de novembre 2024. difficulte est le score IA d'un modèle qui obtient la moitié (score_0_1 = 0,5), pente la raideur de la courbe.","licence":"Réutilisation libre en citant « Quelle IA, quelleia.com » et la date de l'édition. Les mesures renvoient à leurs sources d'origine.","benchmark":{"id":"csqa2","nom":"CommonsenseQA 2.0","tache":"autre","etat":"archive","echelle":"unite","modeles":6,"poids_general":0,"difficulte":60.5,"pente":0.059,"en_une_phrase":"Des affirmations de bon sens sur les objets, les situations sociales et les causes, à juger vraies ou fausses.","notation":"Part de bonnes réponses ; le hasard donne 50 %.","limites":"Dix résultats seulement, tous sur d'anciens modèles. Inutile pour comparer les assistants actuels.","mainteneur":"Allen Institute for AI et université de Tel-Aviv (Talmor et al., 2021)","url":"https://allenai.github.io/csqa2/","verifie":true},"tache":{"id":"autre","nom":"Tests historiques","poids_general":0,"benchmarks_actifs":0},"modeles_mesures":6,"mesures":6,"classement":[{"rang":1,"modele":"t5-11b","nom":"T5-11B","editeur":"Google DeepMind","page":"https://quelleia.com/modeles/t5-11b/","score_publie":0.678,"score_0_1":0.356,"niveau_suggere":50.5,"reflexion":"inconnue","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://epoch.ai/benchmarks"},{"rang":2,"modele":"t5-3b","nom":"T5-3B","editeur":"Google DeepMind","page":"https://quelleia.com/modeles/t5-3b/","score_publie":0.602,"score_0_1":0.204,"niveau_suggere":37.4,"reflexion":"inconnue","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://epoch.ai/benchmarks"},{"rang":3,"modele":"gpt-3-5-turbo-jun-2023","nom":"GPT-3.5 Turbo (Jun 2023)","editeur":"OpenAI","page":"https://quelleia.com/modeles/gpt-3-5-turbo-jun-2023/","score_publie":0.57,"score_0_1":0.14,"niveau_suggere":29.7,"reflexion":"inconnue","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://epoch.ai/benchmarks"},{"rang":4,"modele":"t5-large","nom":"T5-Large","editeur":"Google DeepMind","page":"https://quelleia.com/modeles/t5-large/","score_publie":0.546,"score_0_1":0.092,"niveau_suggere":21.7,"reflexion":"inconnue","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://epoch.ai/benchmarks"},{"rang":5,"modele":"instructgpt-175b","nom":"InstructGPT 175B","editeur":"OpenAI","page":"https://quelleia.com/modeles/instructgpt-175b/","score_publie":0.529,"score_0_1":0.058,"niveau_suggere":13.3,"reflexion":"inconnue","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://epoch.ai/benchmarks"},{"rang":6,"modele":"llama-2-70b","nom":"Llama 2-70B","editeur":"Meta AI","page":"https://quelleia.com/modeles/llama-2-70b/","score_publie":0.5,"score_0_1":0,"niveau_suggere":-17.4,"reflexion":"inconnue","harnais":null,"configurations_mesurees":1,"date":null,"source":"https://epoch.ai/benchmarks"}]}