Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

Test historiqueFiche benchmark · Allen Institute for AI (Sakaguchi et al., 2019) · winogrande.allenai.org

WinoGrande

Trouver à quoi renvoie un pronom ambigu dans une phrase, ce qui demande du bon sens et une connaissance du monde.

ARCHIVÉ

À quoi il sert

WinoGrande est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.

Comment c'est noté

Part de bonnes réponses entre deux choix ; le hasard donne 50 %.

Pour le calcul, ce score est ramené entre 0 et 1 : 50 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

Ce qu'il ne dit pas

Test de 2019 saturé. Les scores viennent d'articles aux réglages variés.

Qui le tient

Allen Institute for AI (Sakaguchi et al., 2019).

winogrande.allenai.org · test historique · 77 modèles mesurés

Comment lire le score

77 modèles mesurés · 137 mesures

En tête : Llama 3.1-405B, 89,2 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 75 % a un score IA d'environ 9. Le meilleur, Llama 3.1-405B, atteint 89,2 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
85 %
Score IA 76niveau de Claude Sonnet 4.5
90 %
Score IA 100niveau de Claude Opus 5.5
93 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. WinoGrande est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Llama 3.1-405BMeta AI · poids ouverts · 2 configurationsNon précisée89,2 %74,3
2Claude 3 OpusAnthropicNon précisée88,5 %70,3
3GPT-4 (Mar 2023)OpenAI · 2 configurationsNon précisée87,5 %64,7
4Falcon-180BTechnology Innovation Institute · poids ouvertsNon précisée87,1 %62,6
5DeepSeek-V2 (MoE-236B, May 2024)DeepSeek · poids ouvertsNon précisée86,3 %58,4
6DeepSeek-V3DeepSeek · poids ouvertsNon précisée85,2 %52,9
7PaLM (540B)Google Research · 5 configurationsNon précisée85,1 %52,5
8DeepSeek-Coder-V2 236BDeepSeek · poids ouvertsNon précisée83,7 %45,9
9Llama 3-70BMeta AI · poids ouvertsNon précisée83,5 %44,9
10PaLM 2-LGoogle DeepMindNon précisée83 %42,7
77 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 77 →Replier le classement ↑
11Qwen2.5-72BAlibaba · poids ouvertsNon précisée82,3 %39,5
12davinci-002OpenAINon précisée81,6 %36,5
12GPT-3.5 Turbo (Jun 2023)OpenAINon précisée81,6 %36,5
14phi-3-medium 14BMicrosoft · poids ouvertsNon précisée81,5 %36,0
14phi-3-small 7.4BMicrosoft · poids ouvertsNon précisée81,5 %36,0
16Qwen2.5-Coder-32BAlibaba · poids ouvertsNon précisée80,8 %33,0
17Llama 2-70BMeta AI · poids ouvertsNon précisée80,2 %30,5
18GLaMGoogle DeepMind · 3 configurationsNon précisée79,2 %26,3
18PaLM 2-MGoogle DeepMindNon précisée79,2 %26,3
20Gemma 7BGoogle DeepMind · poids ouverts · 3 configurationsNon précisée79 %25,4
21Megatron-Turing NLG 530BMicrosoft · 4 configurationsNon précisée78,9 %25,0
22Falcon 2 11BTechnology Innovation Institute · poids ouverts · 2 configurationsNon précisée78,3 %22,5
23Nemotron-4 15BNVIDIANon précisée78 %21,3
24PaLM 2-SGoogle DeepMindNon précisée77,9 %20,9
25InstructGPT 175BOpenAI · 13 configurationsNon précisée77,7 %20,1
26Mixtral 8x7BMistral AI · poids ouverts · 2 configurationsNon précisée77,2 %18,0
27LLaMA-65BMeta AI · poids ouverts · 2 configurationsNon précisée77 %17,2
27PaLM 62BGoogle DeepMind · 2 configurationsNon précisée77 %17,2
29Falcon-40BTechnology Innovation Institute · poids ouverts · 3 configurationsNon précisée76,9 %16,8
30Qwen2.5-Coder-14BAlibabaNon précisée76,8 %16,4
31Llama 2-34BMeta AI · 2 configurationsNon précisée76,7 %16,0
32LLaMA-33BMeta AI · poids ouverts · 2 configurationsNon précisée76 %13,1
33Llama 3-8BMeta AI · poids ouverts · 2 configurationsNon précisée75,7 %11,9
34Mistral 7B v0.1Mistral AI · poids ouverts · 5 configurationsNon précisée75,3 %10,3
35Claude 3 SonnetAnthropicNon précisée75,1 %9,5
36ChinchillaDeepMind · 2 configurationsNon précisée74,9 %8,7
37Claude 3 HaikuAnthropicNon précisée74,2 %5,8
38Phi-1.5Microsoft · poids ouvertsNon précisée73,4 %2,6
39Yi-9B01.AINon précisée73 %1,0
39LLaMA-13BMeta AI · poids ouverts · 3 configurationsNon précisée73 %1,0
41Qwen2.5-Coder (7B)Alibaba · poids ouvertsNon précisée72,9 %0,6
41DeepSeek-Coder-V2-Lite-BaseDeepSeekNon précisée72,9 %0,6
43Llama 2-13BMeta AI · poids ouverts · 3 configurationsNon précisée72,8 %0,2
44Yi 6B01.AI · poids ouvertsNon précisée71,3 %-6,0
45MPT-30BMosaicML · poids ouvertsNon précisée71 %-7,3
46phi-3-mini 3.8BMicrosoft · poids ouvertsNon précisée70,8 %-8,1
46vicuna-13b-v1.1Non précisée70,8 %-8,1
48Gopher (280B)DeepMind · 5 configurationsNon précisée70,2 %-10,6
49LLaMA-7BMeta AI · poids ouverts · 5 configurationsNon précisée70,1 %-11,0
50Llama 2-7BMeta AI · poids ouverts · 3 configurationsNon précisée69,2 %-14,8
51GPT-3.5 Turbo (Nov 2023)OpenAINon précisée68,8 %-16,6
52MPT-7BMosaicML · poids ouverts · 3 configurationsNon précisée68,6 %-17,4
53Qwen2.5-Coder-3BAlibabaNon précisée67,4 %-22,7
54Falcon-7BTechnology Innovation Institute · poids ouverts · 5 configurationsNon précisée67,2 %-23,6
55open_llama_7bNon précisée67 %-24,5
56GPT-NeoX-20BEleutherAI · poids ouvertsNon précisée66,1 %-28,6
57INTELLECT-1Prime IntellectNon précisée65,8 %-29,9
58Gemma 2BGoogle DeepMind · poids ouvertsNon précisée65,4 %-31,9
59XGen-7BSalesforce · poids ouvertsNon précisée64,9 %-34,3
60opt-13bMeta AINon précisée64,7 %-35,3
61GPT-J-6BEleutherAI · poids ouvertsNon précisée64,5 %-36,2
62StarCoder 2 15BHugging Face · poids ouvertsNon précisée64,3 %-37,2
63RedPajama-INCITE-7B-BaseNon précisée63,8 %-39,7
64DeepSeek Coder 33BDeepSeek · poids ouvertsNon précisée62 %-49,3
65Dolly 2.0-12bDatabricks · poids ouvertsNon précisée61,8 %-50,4
66OPT-1.3BMeta AI · poids ouvertsNon précisée61 %-55,0
67Cerebras-GPT-13BCerebras Systems · poids ouvertsNon précisée60,8 %-56,2
68Qwen2.5-Coder (1.5B)Alibaba · poids ouvertsNon précisée60,7 %-56,8
69CodeQwen1.5-7BAlibabaNon précisée59,8 %-62,4
70GPT-2 (1.5B)OpenAI · poids ouverts · 2 configurationsNon précisée58,3 %-72,6
71DeepSeek Coder 6.7BDeepSeek · poids ouvertsNon précisée57,6 %-77,9
72StarCoder 2 3BHugging Face · poids ouvertsNon précisée57,1 %-82,0
72StarCoder 2 7BHugging Face · poids ouvertsNon précisée57,1 %-82,0
74Qwen2.5-Coder-0.5BAlibaba · poids ouvertsNon précisée54,8 %-104,4
75Phi-2Microsoft · poids ouvertsNon précisée54,7 %-105,6
76DeepSeek Coder 1.3BDeepSeek · poids ouvertsNon précisée53,3 %-125,0
77stablelm-tuned-alpha-7bStability AINon précisée51,5 %-166,9

En bref

Que mesure WinoGrande ?
Trouver à quoi renvoie un pronom ambigu dans une phrase, ce qui demande du bon sens et une connaissance du monde. C'est un test historique, hors des scores d'aujourd'hui.
Comment WinoGrande est-il noté ?
Part de bonnes réponses entre deux choix ; le hasard donne 50 %. Un modèle qui obtient 75 % a un score IA d'environ 9.
Qui est en tête sur WinoGrande ?
Llama 3.1-405B (Meta AI) est en tête de WinoGrande avec 89,2 %, dans l'édition du 28 septembre 2026. Suivent Claude 3 Opus (88,5 %) et GPT-4 (Mar 2023) (87,5 %). 77 modèles y sont mesurés.
Quelles sont les limites de WinoGrande ?
Test de 2019 saturé. Les scores viennent d'articles aux réglages variés. Au 28 septembre 2026, le benchmark est archivé.
Combien pèse WinoGrande dans le score IA ?
WinoGrande compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.
Qui maintient WinoGrande ?
Allen Institute for AI (Sakaguchi et al., 2019). Sa page de référence : winogrande.allenai.org.

Les autres tests historiques

Tous les benchmarks →Comment le score IA est calculé →