# SuperGLUE

> Fiche du benchmark SuperGLUE sur Quelle IA, édition du 28 septembre 2026. Huit exercices de compréhension de texte en anglais : répondre par oui ou non, trouver à quoi renvoie un pronom, relier cause et effet. En tête au 28 septembre 2026 : T5-11B (88,9 %). Notation, limites et classement des 8 modèles mesurés.

Page : https://quelleia.com/benchmarks/superglue/
Source du benchmark : https://super.gluebenchmark.com/
Mainteneur : Wang et al. (2019)
Tâche : Tests historiques
État : archivé

## À quoi il sert

SuperGLUE est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.

## Comment c'est noté

Score global qui résume les résultats des huit exercices.

## Ce qu'il ne dit pas

Test de 2019, vite dépassé par les modèles. Seuls une dizaine d'anciens modèles y figurent.

## Qui le tient

Wang et al. (2019).

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 90 %. Le meilleur, T5-11B, atteint 88,9 %. Le benchmark est archivé, faute de modèle récent mesuré. Avec 8 modèles mesurés seulement, cet étalonnage reste fragile.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 90 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 94 %
- Score IA 100 (niveau de Claude Opus 5.5) : 97 %

## Son poids dans le score IA

0 % du score général. SuperGLUE est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

## Classement (8 modèles mesurés · 10 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [T5-11B](https://quelleia.com/modeles/t5-11b.md) | Google DeepMind | non précisée | 88,9 % | 45,9 | https://epoch.ai/benchmarks |
| 2 | [T5-3B](https://quelleia.com/modeles/t5-3b.md) | Google DeepMind | non précisée | 86,4 % | 36,2 | https://epoch.ai/benchmarks |
| 3 | [Switch-Large](https://quelleia.com/modeles/switch-large.md) | Google DeepMind | non précisée | 84,7 % | 30,5 | https://epoch.ai/benchmarks |
| 4 | [T5-Large](https://quelleia.com/modeles/t5-large.md) | Google DeepMind | non précisée | 82,7 % | 24,4 | https://epoch.ai/benchmarks |
| 5 | [T5-Base](https://quelleia.com/modeles/t5-base.md) | Google DeepMind | non précisée | 76,2 % | 7,6 | https://epoch.ai/benchmarks |
| 6 | [Switch-Base](https://quelleia.com/modeles/switch-base.md) | Google DeepMind | non précisée | 73,3 % | 1,2 | https://epoch.ai/benchmarks |
| 7 | [InstructGPT 175B](https://quelleia.com/modeles/instructgpt-175b.md) | OpenAI | non précisée | 71,8 % | -1,9 | https://epoch.ai/benchmarks |
| 8 | [T5-Small](https://quelleia.com/modeles/t5-small.md) | Google DeepMind | non précisée | 63,3 % | -18,2 | https://epoch.ai/benchmarks |

## En bref

**Que mesure SuperGLUE ?** Huit exercices de compréhension de texte en anglais : répondre par oui ou non, trouver à quoi renvoie un pronom, relier cause et effet. C'est un test historique, hors des scores d'aujourd'hui.

**Comment SuperGLUE est-il noté ?** Score global qui résume les résultats des huit exercices. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 90 %.

**Qui est en tête sur SuperGLUE ?** T5-11B (Google DeepMind) est en tête de SuperGLUE avec 88,9 %, dans l'édition du 28 septembre 2026. Suivent T5-3B (86,4 %) et Switch-Large (84,7 %). 8 modèles y sont mesurés.

**Quelles sont les limites de SuperGLUE ?** Test de 2019, vite dépassé par les modèles. Seuls une dizaine d'anciens modèles y figurent. Au 28 septembre 2026, le benchmark est archivé.

**Combien pèse SuperGLUE dans le score IA ?** SuperGLUE compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

**Qui maintient SuperGLUE ?** Wang et al. (2019). Sa page de référence : super.gluebenchmark.com.

## Les autres tests historiques

- [MMLU](https://quelleia.com/benchmarks/mmlu.md) : 127 modèles · hors score, archivé
- [WinoGrande](https://quelleia.com/benchmarks/winogrande.md) : 77 modèles · hors score, archivé
- [ARC (AI2 Reasoning Challenge)](https://quelleia.com/benchmarks/arc_ai2.md) : 76 modèles · hors score, archivé
- [BoolQ](https://quelleia.com/benchmarks/boolq.md) : 76 modèles · hors score, archivé
- [HellaSwag](https://quelleia.com/benchmarks/hellaswag.md) : 75 modèles · hors score, archivé
- [PIQA](https://quelleia.com/benchmarks/piqa.md) : 59 modèles · hors score, archivé
- [LiveBench](https://quelleia.com/benchmarks/livebench.md) : 48 modèles · hors score, archivé
- [BIG-Bench Hard (BBH)](https://quelleia.com/benchmarks/bbh.md) : 45 modèles · hors score, archivé
- [OpenBookQA](https://quelleia.com/benchmarks/openbookqa.md) : 42 modèles · hors score, archivé
- [TriviaQA](https://quelleia.com/benchmarks/triviaqa.md) : 38 modèles · hors score, archivé
- [LAMBADA](https://quelleia.com/benchmarks/lambada.md) : 26 modèles · hors score, archivé
- [ScienceQA](https://quelleia.com/benchmarks/scienceqa.md) : 23 modèles · hors score, archivé
- [ANLI (Adversarial NLI)](https://quelleia.com/benchmarks/anli.md) : 11 modèles · hors score, archivé
- [CommonsenseQA 2.0](https://quelleia.com/benchmarks/csqa2.md) : 6 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
