# CommonsenseQA 2.0

> Fiche du benchmark CommonsenseQA 2.0 sur Quelle IA, édition du 28 septembre 2026. Des affirmations de bon sens sur les objets, les situations sociales et les causes, à juger vraies ou fausses. En tête au 28 septembre 2026 : T5-11B (67,8 %). Notation, limites et classement des 6 modèles mesurés.

Page : https://quelleia.com/benchmarks/csqa2/
Source du benchmark : https://allenai.github.io/csqa2/
Mainteneur : Allen Institute for AI et université de Tel-Aviv (Talmor et al., 2021)
Tâche : Tests historiques
État : archivé

## À quoi il sert

CommonsenseQA 2.0 est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.

## Comment c'est noté

Part de bonnes réponses ; le hasard donne 50 %.

Pour le calcul, ce score est ramené entre 0 et 1 : 50 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

## Ce qu'il ne dit pas

Dix résultats seulement, tous sur d'anciens modèles. Inutile pour comparer les assistants actuels.

## Qui le tient

Allen Institute for AI et université de Tel-Aviv (Talmor et al., 2021).

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 75 % a un score IA d'environ 61. Le meilleur, T5-11B, atteint 67,8 %. Le benchmark est archivé, faute de modèle récent mesuré. Avec 6 modèles mesurés seulement, cet étalonnage reste fragile.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 68 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 86 %
- Score IA 100 (niveau de Claude Opus 5.5) : 96 %

## Son poids dans le score IA

0 % du score général. CommonsenseQA 2.0 est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

## Classement (6 modèles mesurés, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [T5-11B](https://quelleia.com/modeles/t5-11b.md) | Google DeepMind | non précisée | 67,8 % | 50,5 | https://epoch.ai/benchmarks |
| 2 | [T5-3B](https://quelleia.com/modeles/t5-3b.md) | Google DeepMind | non précisée | 60,2 % | 37,4 | https://epoch.ai/benchmarks |
| 3 | [GPT-3.5 Turbo (Jun 2023)](https://quelleia.com/modeles/gpt-3-5-turbo-jun-2023.md) | OpenAI | non précisée | 57 % | 29,7 | https://epoch.ai/benchmarks |
| 4 | [T5-Large](https://quelleia.com/modeles/t5-large.md) | Google DeepMind | non précisée | 54,6 % | 21,7 | https://epoch.ai/benchmarks |
| 5 | [InstructGPT 175B](https://quelleia.com/modeles/instructgpt-175b.md) | OpenAI | non précisée | 52,9 % | 13,3 | https://epoch.ai/benchmarks |
| 6 | [Llama 2-70B](https://quelleia.com/modeles/llama-2-70b.md) | Meta AI | non précisée | 50 % | -17,4 | https://epoch.ai/benchmarks |

## En bref

**Que mesure CommonsenseQA 2.0 ?** Des affirmations de bon sens sur les objets, les situations sociales et les causes, à juger vraies ou fausses. C'est un test historique, hors des scores d'aujourd'hui.

**Comment CommonsenseQA 2.0 est-il noté ?** Part de bonnes réponses ; le hasard donne 50 %. Un modèle qui obtient 75 % a un score IA d'environ 61.

**Qui est en tête sur CommonsenseQA 2.0 ?** T5-11B (Google DeepMind) est en tête de CommonsenseQA 2.0 avec 67,8 %, dans l'édition du 28 septembre 2026. Suivent T5-3B (60,2 %) et GPT-3.5 Turbo (Jun 2023) (57 %). 6 modèles y sont mesurés.

**Quelles sont les limites de CommonsenseQA 2.0 ?** Dix résultats seulement, tous sur d'anciens modèles. Inutile pour comparer les assistants actuels. Au 28 septembre 2026, le benchmark est archivé.

**Combien pèse CommonsenseQA 2.0 dans le score IA ?** CommonsenseQA 2.0 compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

**Qui maintient CommonsenseQA 2.0 ?** Allen Institute for AI et université de Tel-Aviv (Talmor et al., 2021). Sa page de référence : allenai.github.io/csqa2.

## Les autres tests historiques

- [MMLU](https://quelleia.com/benchmarks/mmlu.md) : 127 modèles · hors score, archivé
- [WinoGrande](https://quelleia.com/benchmarks/winogrande.md) : 77 modèles · hors score, archivé
- [ARC (AI2 Reasoning Challenge)](https://quelleia.com/benchmarks/arc_ai2.md) : 76 modèles · hors score, archivé
- [BoolQ](https://quelleia.com/benchmarks/boolq.md) : 76 modèles · hors score, archivé
- [HellaSwag](https://quelleia.com/benchmarks/hellaswag.md) : 75 modèles · hors score, archivé
- [PIQA](https://quelleia.com/benchmarks/piqa.md) : 59 modèles · hors score, archivé
- [LiveBench](https://quelleia.com/benchmarks/livebench.md) : 48 modèles · hors score, archivé
- [BIG-Bench Hard (BBH)](https://quelleia.com/benchmarks/bbh.md) : 45 modèles · hors score, archivé
- [OpenBookQA](https://quelleia.com/benchmarks/openbookqa.md) : 42 modèles · hors score, archivé
- [TriviaQA](https://quelleia.com/benchmarks/triviaqa.md) : 38 modèles · hors score, archivé
- [LAMBADA](https://quelleia.com/benchmarks/lambada.md) : 26 modèles · hors score, archivé
- [ScienceQA](https://quelleia.com/benchmarks/scienceqa.md) : 23 modèles · hors score, archivé
- [ANLI (Adversarial NLI)](https://quelleia.com/benchmarks/anli.md) : 11 modèles · hors score, archivé
- [SuperGLUE](https://quelleia.com/benchmarks/superglue.md) : 8 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
