Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

Test historiqueFiche benchmark · Allen Institute for AI et université de Tel-Aviv (Talmor et al., 2021) · allenai.github.io

CommonsenseQA 2.0

Des affirmations de bon sens sur les objets, les situations sociales et les causes, à juger vraies ou fausses.

ARCHIVÉ

À quoi il sert

CommonsenseQA 2.0 est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.

Comment c'est noté

Part de bonnes réponses ; le hasard donne 50 %.

Pour le calcul, ce score est ramené entre 0 et 1 : 50 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

Ce qu'il ne dit pas

Dix résultats seulement, tous sur d'anciens modèles. Inutile pour comparer les assistants actuels.

Qui le tient

Allen Institute for AI et université de Tel-Aviv (Talmor et al., 2021).

allenai.github.io/csqa2 · test historique · 6 modèles mesurés

Comment lire le score

6 modèles mesurés

En tête : T5-11B, 67,8 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 75 % a un score IA d'environ 61. Le meilleur, T5-11B, atteint 67,8 %. Le benchmark est archivé, faute de modèle récent mesuré. Avec 6 modèles mesurés seulement, cet étalonnage reste fragile.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
68 %
Score IA 76niveau de Claude Sonnet 4.5
86 %
Score IA 100niveau de Claude Opus 5.5
96 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. CommonsenseQA 2.0 est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1T5-11BGoogle DeepMind · poids ouvertsNon précisée67,8 %50,5
2T5-3BGoogle DeepMind · poids ouvertsNon précisée60,2 %37,4
3GPT-3.5 Turbo (Jun 2023)OpenAINon précisée57 %29,7
4T5-LargeGoogle DeepMindNon précisée54,6 %21,7
5InstructGPT 175BOpenAINon précisée52,9 %13,3
6Llama 2-70BMeta AI · poids ouvertsNon précisée50 %-17,4

6 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

En bref

Que mesure CommonsenseQA 2.0 ?
Des affirmations de bon sens sur les objets, les situations sociales et les causes, à juger vraies ou fausses. C'est un test historique, hors des scores d'aujourd'hui.
Comment CommonsenseQA 2.0 est-il noté ?
Part de bonnes réponses ; le hasard donne 50 %. Un modèle qui obtient 75 % a un score IA d'environ 61.
Qui est en tête sur CommonsenseQA 2.0 ?
T5-11B (Google DeepMind) est en tête de CommonsenseQA 2.0 avec 67,8 %, dans l'édition du 28 septembre 2026. Suivent T5-3B (60,2 %) et GPT-3.5 Turbo (Jun 2023) (57 %). 6 modèles y sont mesurés.
Quelles sont les limites de CommonsenseQA 2.0 ?
Dix résultats seulement, tous sur d'anciens modèles. Inutile pour comparer les assistants actuels. Au 28 septembre 2026, le benchmark est archivé.
Combien pèse CommonsenseQA 2.0 dans le score IA ?
CommonsenseQA 2.0 compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.
Qui maintient CommonsenseQA 2.0 ?
Allen Institute for AI et université de Tel-Aviv (Talmor et al., 2021). Sa page de référence : allenai.github.io/csqa2.

Les autres tests historiques

Tous les benchmarks →Comment le score IA est calculé →