# WinoGrande

> Fiche du benchmark WinoGrande sur Quelle IA, édition du 28 septembre 2026. Trouver à quoi renvoie un pronom ambigu dans une phrase, ce qui demande du bon sens et une connaissance du monde. En tête au 28 septembre 2026 : Llama 3.1-405B (89,2 %). Notation, limites et classement des 77 modèles mesurés.

Page : https://quelleia.com/benchmarks/winogrande/
Source du benchmark : https://winogrande.allenai.org/
Mainteneur : Allen Institute for AI (Sakaguchi et al., 2019)
Tâche : Tests historiques
État : archivé

## À quoi il sert

WinoGrande est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.

## Comment c'est noté

Part de bonnes réponses entre deux choix ; le hasard donne 50 %.

Pour le calcul, ce score est ramené entre 0 et 1 : 50 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

## Ce qu'il ne dit pas

Test de 2019 saturé. Les scores viennent d'articles aux réglages variés.

## Qui le tient

Allen Institute for AI (Sakaguchi et al., 2019).

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 75 % a un score IA d'environ 9. Le meilleur, Llama 3.1-405B, atteint 89,2 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 85 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 90 %
- Score IA 100 (niveau de Claude Opus 5.5) : 93 %

## Son poids dans le score IA

0 % du score général. WinoGrande est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

## Classement (77 modèles mesurés · 137 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [Llama 3.1-405B](https://quelleia.com/modeles/llama-3-1-405b.md) | Meta AI | non précisée | 89,2 % | 74,3 | https://epoch.ai/benchmarks |
| 2 | [Claude 3 Opus](https://quelleia.com/modeles/claude-3-opus.md) | Anthropic | non précisée | 88,5 % | 70,3 | https://epoch.ai/benchmarks |
| 3 | [GPT-4 (Mar 2023)](https://quelleia.com/modeles/gpt-4-mar-2023.md) | OpenAI | non précisée | 87,5 % | 64,7 | https://epoch.ai/benchmarks |
| 4 | [Falcon-180B](https://quelleia.com/modeles/falcon-180b.md) | Technology Innovation Institute | non précisée | 87,1 % | 62,6 | https://epoch.ai/benchmarks |
| 5 | [DeepSeek-V2 (MoE-236B, May 2024)](https://quelleia.com/modeles/deepseek-v2-moe-236b-may-2024.md) | DeepSeek | non précisée | 86,3 % | 58,4 | https://epoch.ai/benchmarks |
| 6 | [DeepSeek-V3](https://quelleia.com/modeles/deepseek-v3.md) | DeepSeek | non précisée | 85,2 % | 52,9 | https://epoch.ai/benchmarks |
| 7 | [PaLM (540B)](https://quelleia.com/modeles/palm-540b.md) | Google Research | non précisée | 85,1 % | 52,5 | https://epoch.ai/benchmarks |
| 8 | [DeepSeek-Coder-V2 236B](https://quelleia.com/modeles/deepseek-coder-v2-236b.md) | DeepSeek | non précisée | 83,7 % | 45,9 | https://epoch.ai/benchmarks |
| 9 | [Llama 3-70B](https://quelleia.com/modeles/llama-3-70b.md) | Meta AI | non précisée | 83,5 % | 44,9 | https://epoch.ai/benchmarks |
| 10 | [PaLM 2-L](https://quelleia.com/modeles/palm-2-l.md) | Google DeepMind | non précisée | 83 % | 42,7 | https://epoch.ai/benchmarks |
| 11 | [Qwen2.5-72B](https://quelleia.com/modeles/qwen2-5-72b.md) | Alibaba | non précisée | 82,3 % | 39,5 | https://epoch.ai/benchmarks |
| 12 | [davinci-002](https://quelleia.com/modeles/davinci-002.md) | OpenAI | non précisée | 81,6 % | 36,5 | https://epoch.ai/benchmarks |
| 12 | [GPT-3.5 Turbo (Jun 2023)](https://quelleia.com/modeles/gpt-3-5-turbo-jun-2023.md) | OpenAI | non précisée | 81,6 % | 36,5 | https://epoch.ai/benchmarks |
| 14 | [phi-3-medium 14B](https://quelleia.com/modeles/phi-3-medium-14b.md) | Microsoft | non précisée | 81,5 % | 36,0 | https://epoch.ai/benchmarks |
| 14 | [phi-3-small 7.4B](https://quelleia.com/modeles/phi-3-small-7-4b.md) | Microsoft | non précisée | 81,5 % | 36,0 | https://epoch.ai/benchmarks |
| 16 | [Qwen2.5-Coder-32B](https://quelleia.com/modeles/qwen2-5-coder-32b.md) | Alibaba | non précisée | 80,8 % | 33,0 | https://epoch.ai/benchmarks |
| 17 | [Llama 2-70B](https://quelleia.com/modeles/llama-2-70b.md) | Meta AI | non précisée | 80,2 % | 30,5 | https://epoch.ai/benchmarks |
| 18 | [GLaM](https://quelleia.com/modeles/glam.md) | Google DeepMind | non précisée | 79,2 % | 26,3 | https://epoch.ai/benchmarks |
| 18 | [PaLM 2-M](https://quelleia.com/modeles/palm-2-m.md) | Google DeepMind | non précisée | 79,2 % | 26,3 | https://epoch.ai/benchmarks |
| 20 | [Gemma 7B](https://quelleia.com/modeles/gemma-7b.md) | Google DeepMind | non précisée | 79 % | 25,4 | https://epoch.ai/benchmarks |
| 21 | [Megatron-Turing NLG 530B](https://quelleia.com/modeles/megatron-turing-nlg-530b.md) | Microsoft | non précisée | 78,9 % | 25,0 | https://epoch.ai/benchmarks |
| 22 | [Falcon 2 11B](https://quelleia.com/modeles/falcon-2-11b.md) | Technology Innovation Institute | non précisée | 78,3 % | 22,5 | https://epoch.ai/benchmarks |
| 23 | [Nemotron-4 15B](https://quelleia.com/modeles/nemotron-4-15b.md) | NVIDIA | non précisée | 78 % | 21,3 | https://epoch.ai/benchmarks |
| 24 | [PaLM 2-S](https://quelleia.com/modeles/palm-2-s.md) | Google DeepMind | non précisée | 77,9 % | 20,9 | https://epoch.ai/benchmarks |
| 25 | [InstructGPT 175B](https://quelleia.com/modeles/instructgpt-175b.md) | OpenAI | non précisée | 77,7 % | 20,1 | https://epoch.ai/benchmarks |
| 26 | [Mixtral 8x7B](https://quelleia.com/modeles/mixtral-8x7b.md) | Mistral AI | non précisée | 77,2 % | 18,0 | https://epoch.ai/benchmarks |
| 27 | [LLaMA-65B](https://quelleia.com/modeles/llama-65b.md) | Meta AI | non précisée | 77 % | 17,2 | https://epoch.ai/benchmarks |
| 27 | [PaLM 62B](https://quelleia.com/modeles/palm-62b.md) | Google DeepMind | non précisée | 77 % | 17,2 | https://epoch.ai/benchmarks |
| 29 | [Falcon-40B](https://quelleia.com/modeles/falcon-40b.md) | Technology Innovation Institute | non précisée | 76,9 % | 16,8 | https://epoch.ai/benchmarks |
| 30 | [Qwen2.5-Coder-14B](https://quelleia.com/modeles/qwen2-5-coder-14b.md) | Alibaba | non précisée | 76,8 % | 16,4 | https://epoch.ai/benchmarks |
| 31 | [Llama 2-34B](https://quelleia.com/modeles/llama-2-34b.md) | Meta AI | non précisée | 76,7 % | 16,0 | https://epoch.ai/benchmarks |
| 32 | [LLaMA-33B](https://quelleia.com/modeles/llama-33b.md) | Meta AI | non précisée | 76 % | 13,1 | https://epoch.ai/benchmarks |
| 33 | [Llama 3-8B](https://quelleia.com/modeles/llama-3-8b.md) | Meta AI | non précisée | 75,7 % | 11,9 | https://epoch.ai/benchmarks |
| 34 | [Mistral 7B v0.1](https://quelleia.com/modeles/mistral-7b-v0-1.md) | Mistral AI | non précisée | 75,3 % | 10,3 | https://epoch.ai/benchmarks |
| 35 | [Claude 3 Sonnet](https://quelleia.com/modeles/claude-3-sonnet.md) | Anthropic | non précisée | 75,1 % | 9,5 | https://epoch.ai/benchmarks |
| 36 | [Chinchilla](https://quelleia.com/modeles/chinchilla.md) | DeepMind | non précisée | 74,9 % | 8,7 | https://epoch.ai/benchmarks |
| 37 | [Claude 3 Haiku](https://quelleia.com/modeles/claude-3-haiku.md) | Anthropic | non précisée | 74,2 % | 5,8 | https://epoch.ai/benchmarks |
| 38 | [Phi-1.5](https://quelleia.com/modeles/phi-1-5.md) | Microsoft | non précisée | 73,4 % | 2,6 | https://epoch.ai/benchmarks |
| 39 | [Yi-9B](https://quelleia.com/modeles/yi-9b.md) | 01.AI | non précisée | 73 % | 1,0 | https://epoch.ai/benchmarks |
| 39 | [LLaMA-13B](https://quelleia.com/modeles/llama-13b.md) | Meta AI | non précisée | 73 % | 1,0 | https://epoch.ai/benchmarks |
| 41 | [Qwen2.5-Coder (7B)](https://quelleia.com/modeles/qwen2-5-coder-7b.md) | Alibaba | non précisée | 72,9 % | 0,6 | https://epoch.ai/benchmarks |
| 41 | [DeepSeek-Coder-V2-Lite-Base](https://quelleia.com/modeles/deepseek-coder-v2-lite-base.md) | DeepSeek | non précisée | 72,9 % | 0,6 | https://epoch.ai/benchmarks |
| 43 | [Llama 2-13B](https://quelleia.com/modeles/llama-2-13b.md) | Meta AI | non précisée | 72,8 % | 0,2 | https://epoch.ai/benchmarks |
| 44 | [Yi 6B](https://quelleia.com/modeles/yi-6b.md) | 01.AI | non précisée | 71,3 % | -6,0 | https://epoch.ai/benchmarks |
| 45 | [MPT-30B](https://quelleia.com/modeles/mpt-30b.md) | MosaicML | non précisée | 71 % | -7,3 | https://epoch.ai/benchmarks |
| 46 | [phi-3-mini 3.8B](https://quelleia.com/modeles/phi-3-mini-3-8b.md) | Microsoft | non précisée | 70,8 % | -8,1 | https://epoch.ai/benchmarks |
| 46 | [vicuna-13b-v1.1](https://quelleia.com/modeles/vicuna-13b-v1-1.md) |  | non précisée | 70,8 % | -8,1 | https://epoch.ai/benchmarks |
| 48 | [Gopher (280B)](https://quelleia.com/modeles/gopher-280b.md) | DeepMind | non précisée | 70,2 % | -10,6 | https://epoch.ai/benchmarks |
| 49 | [LLaMA-7B](https://quelleia.com/modeles/llama-7b.md) | Meta AI | non précisée | 70,1 % | -11,0 | https://epoch.ai/benchmarks |
| 50 | [Llama 2-7B](https://quelleia.com/modeles/llama-2-7b.md) | Meta AI | non précisée | 69,2 % | -14,8 | https://epoch.ai/benchmarks |
| 51 | [GPT-3.5 Turbo (Nov 2023)](https://quelleia.com/modeles/gpt-3-5-turbo-nov-2023.md) | OpenAI | non précisée | 68,8 % | -16,6 | https://epoch.ai/benchmarks |
| 52 | [MPT-7B](https://quelleia.com/modeles/mpt-7b.md) | MosaicML | non précisée | 68,6 % | -17,4 | https://epoch.ai/benchmarks |
| 53 | [Qwen2.5-Coder-3B](https://quelleia.com/modeles/qwen2-5-coder-3b.md) | Alibaba | non précisée | 67,4 % | -22,7 | https://epoch.ai/benchmarks |
| 54 | [Falcon-7B](https://quelleia.com/modeles/falcon-7b.md) | Technology Innovation Institute | non précisée | 67,2 % | -23,6 | https://epoch.ai/benchmarks |
| 55 | [open_llama_7b](https://quelleia.com/modeles/open-llama-7b.md) |  | non précisée | 67 % | -24,5 | https://epoch.ai/benchmarks |
| 56 | [GPT-NeoX-20B](https://quelleia.com/modeles/gpt-neox-20b.md) | EleutherAI | non précisée | 66,1 % | -28,6 | https://epoch.ai/benchmarks |
| 57 | [INTELLECT-1](https://quelleia.com/modeles/intellect-1.md) | Prime Intellect | non précisée | 65,8 % | -29,9 | https://epoch.ai/benchmarks |
| 58 | [Gemma 2B](https://quelleia.com/modeles/gemma-2b.md) | Google DeepMind | non précisée | 65,4 % | -31,9 | https://epoch.ai/benchmarks |
| 59 | [XGen-7B](https://quelleia.com/modeles/xgen-7b.md) | Salesforce | non précisée | 64,9 % | -34,3 | https://epoch.ai/benchmarks |
| 60 | [opt-13b](https://quelleia.com/modeles/opt-13b.md) | Meta AI | non précisée | 64,7 % | -35,3 | https://epoch.ai/benchmarks |
| 61 | [GPT-J-6B](https://quelleia.com/modeles/gpt-j-6b.md) | EleutherAI | non précisée | 64,5 % | -36,2 | https://epoch.ai/benchmarks |
| 62 | [StarCoder 2 15B](https://quelleia.com/modeles/starcoder-2-15b.md) | Hugging Face | non précisée | 64,3 % | -37,2 | https://epoch.ai/benchmarks |
| 63 | [RedPajama-INCITE-7B-Base](https://quelleia.com/modeles/redpajama-incite-7b-base.md) |  | non précisée | 63,8 % | -39,7 | https://epoch.ai/benchmarks |
| 64 | [DeepSeek Coder 33B](https://quelleia.com/modeles/deepseek-coder-33b.md) | DeepSeek | non précisée | 62 % | -49,3 | https://epoch.ai/benchmarks |
| 65 | [Dolly 2.0-12b](https://quelleia.com/modeles/dolly-2-0-12b.md) | Databricks | non précisée | 61,8 % | -50,4 | https://epoch.ai/benchmarks |
| 66 | [OPT-1.3B](https://quelleia.com/modeles/opt-1-3b.md) | Meta AI | non précisée | 61 % | -55,0 | https://epoch.ai/benchmarks |
| 67 | [Cerebras-GPT-13B](https://quelleia.com/modeles/cerebras-gpt-13b.md) | Cerebras Systems | non précisée | 60,8 % | -56,2 | https://epoch.ai/benchmarks |
| 68 | [Qwen2.5-Coder (1.5B)](https://quelleia.com/modeles/qwen2-5-coder-1-5b.md) | Alibaba | non précisée | 60,7 % | -56,8 | https://epoch.ai/benchmarks |
| 69 | [CodeQwen1.5-7B](https://quelleia.com/modeles/codeqwen1-5-7b.md) | Alibaba | non précisée | 59,8 % | -62,4 | https://epoch.ai/benchmarks |
| 70 | [GPT-2 (1.5B)](https://quelleia.com/modeles/gpt-2-1-5b.md) | OpenAI | non précisée | 58,3 % | -72,6 | https://epoch.ai/benchmarks |
| 71 | [DeepSeek Coder 6.7B](https://quelleia.com/modeles/deepseek-coder-6-7b.md) | DeepSeek | non précisée | 57,6 % | -77,9 | https://epoch.ai/benchmarks |
| 72 | [StarCoder 2 3B](https://quelleia.com/modeles/starcoder-2-3b.md) | Hugging Face | non précisée | 57,1 % | -82,0 | https://epoch.ai/benchmarks |
| 72 | [StarCoder 2 7B](https://quelleia.com/modeles/starcoder-2-7b.md) | Hugging Face | non précisée | 57,1 % | -82,0 | https://epoch.ai/benchmarks |
| 74 | [Qwen2.5-Coder-0.5B](https://quelleia.com/modeles/qwen2-5-coder-0-5b.md) | Alibaba | non précisée | 54,8 % | -104,4 | https://epoch.ai/benchmarks |
| 75 | [Phi-2](https://quelleia.com/modeles/phi-2.md) | Microsoft | non précisée | 54,7 % | -105,6 | https://epoch.ai/benchmarks |
| 76 | [DeepSeek Coder 1.3B](https://quelleia.com/modeles/deepseek-coder-1-3b.md) | DeepSeek | non précisée | 53,3 % | -125,0 | https://epoch.ai/benchmarks |
| 77 | [stablelm-tuned-alpha-7b](https://quelleia.com/modeles/stablelm-tuned-alpha-7b.md) | Stability AI | non précisée | 51,5 % | -166,9 | https://epoch.ai/benchmarks |

## En bref

**Que mesure WinoGrande ?** Trouver à quoi renvoie un pronom ambigu dans une phrase, ce qui demande du bon sens et une connaissance du monde. C'est un test historique, hors des scores d'aujourd'hui.

**Comment WinoGrande est-il noté ?** Part de bonnes réponses entre deux choix ; le hasard donne 50 %. Un modèle qui obtient 75 % a un score IA d'environ 9.

**Qui est en tête sur WinoGrande ?** Llama 3.1-405B (Meta AI) est en tête de WinoGrande avec 89,2 %, dans l'édition du 28 septembre 2026. Suivent Claude 3 Opus (88,5 %) et GPT-4 (Mar 2023) (87,5 %). 77 modèles y sont mesurés.

**Quelles sont les limites de WinoGrande ?** Test de 2019 saturé. Les scores viennent d'articles aux réglages variés. Au 28 septembre 2026, le benchmark est archivé.

**Combien pèse WinoGrande dans le score IA ?** WinoGrande compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

**Qui maintient WinoGrande ?** Allen Institute for AI (Sakaguchi et al., 2019). Sa page de référence : winogrande.allenai.org.

## Les autres tests historiques

- [MMLU](https://quelleia.com/benchmarks/mmlu.md) : 127 modèles · hors score, archivé
- [ARC (AI2 Reasoning Challenge)](https://quelleia.com/benchmarks/arc_ai2.md) : 76 modèles · hors score, archivé
- [BoolQ](https://quelleia.com/benchmarks/boolq.md) : 76 modèles · hors score, archivé
- [HellaSwag](https://quelleia.com/benchmarks/hellaswag.md) : 75 modèles · hors score, archivé
- [PIQA](https://quelleia.com/benchmarks/piqa.md) : 59 modèles · hors score, archivé
- [LiveBench](https://quelleia.com/benchmarks/livebench.md) : 48 modèles · hors score, archivé
- [BIG-Bench Hard (BBH)](https://quelleia.com/benchmarks/bbh.md) : 45 modèles · hors score, archivé
- [OpenBookQA](https://quelleia.com/benchmarks/openbookqa.md) : 42 modèles · hors score, archivé
- [TriviaQA](https://quelleia.com/benchmarks/triviaqa.md) : 38 modèles · hors score, archivé
- [LAMBADA](https://quelleia.com/benchmarks/lambada.md) : 26 modèles · hors score, archivé
- [ScienceQA](https://quelleia.com/benchmarks/scienceqa.md) : 23 modèles · hors score, archivé
- [ANLI (Adversarial NLI)](https://quelleia.com/benchmarks/anli.md) : 11 modèles · hors score, archivé
- [SuperGLUE](https://quelleia.com/benchmarks/superglue.md) : 8 modèles · hors score, archivé
- [CommonsenseQA 2.0](https://quelleia.com/benchmarks/csqa2.md) : 6 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
