Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

Test historiqueFiche benchmark · Wang et al. (2019) · super.gluebenchmark.com

SuperGLUE

Huit exercices de compréhension de texte en anglais : répondre par oui ou non, trouver à quoi renvoie un pronom, relier cause et effet.

ARCHIVÉ

À quoi il sert

SuperGLUE est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.

Comment c'est noté

Score global qui résume les résultats des huit exercices.

Ce qu'il ne dit pas

Test de 2019, vite dépassé par les modèles. Seuls une dizaine d'anciens modèles y figurent.

Comment lire le score

8 modèles mesurés · 10 mesures

En tête : T5-11B, 88,9 %

Chaque trait est un modèle, placé à son meilleur score. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 90 %. Le meilleur, T5-11B, atteint 88,9 %. Le benchmark est archivé, faute de modèle récent mesuré. Avec 8 modèles mesurés seulement, cet étalonnage reste fragile.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
90 %
Score IA 76niveau de Claude Sonnet 4.5
94 %
Score IA 100niveau de Claude Opus 5.5
97 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. SuperGLUE est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1T5-11BGoogle DeepMind · poids ouvertsNon précisée88,9 %45,9
2T5-3BGoogle DeepMind · poids ouvertsNon précisée86,4 %36,2
3Switch-LargeGoogle DeepMindNon précisée84,7 %30,5
4T5-LargeGoogle DeepMind · 2 configurationsNon précisée82,7 %24,4
5T5-BaseGoogle DeepMind · 2 configurationsNon précisée76,2 %7,6
6Switch-BaseGoogle DeepMindNon précisée73,3 %1,2
7InstructGPT 175BOpenAINon précisée71,8 %-1,9
8T5-SmallGoogle DeepMindNon précisée63,3 %-18,2

8 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

En bref

Que mesure SuperGLUE ?
Huit exercices de compréhension de texte en anglais : répondre par oui ou non, trouver à quoi renvoie un pronom, relier cause et effet. C'est un test historique, hors des scores d'aujourd'hui.
Comment SuperGLUE est-il noté ?
Score global qui résume les résultats des huit exercices. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 90 %.
Qui est en tête sur SuperGLUE ?
T5-11B (Google DeepMind) est en tête de SuperGLUE avec 88,9 %, dans l'édition du 28 septembre 2026. Suivent T5-3B (86,4 %) et Switch-Large (84,7 %). 8 modèles y sont mesurés.
Quelles sont les limites de SuperGLUE ?
Test de 2019, vite dépassé par les modèles. Seuls une dizaine d'anciens modèles y figurent. Au 28 septembre 2026, le benchmark est archivé.
Combien pèse SuperGLUE dans le score IA ?
SuperGLUE compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.
Qui maintient SuperGLUE ?
Wang et al. (2019). Sa page de référence : super.gluebenchmark.com.

Les autres tests historiques

Tous les benchmarks →Comment le score IA est calculé →