Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

Test historiqueFiche benchmark · Zellers et al. (université de Washington et Allen Institute for AI) · rowanzellers.com

HellaSwag

Choisir la suite la plus plausible d'une courte scène du quotidien parmi quatre propositions, dont trois pièges écrits par une machine.

ARCHIVÉ

À quoi il sert

HellaSwag est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.

Comment c'est noté

Part de bonnes réponses ; le hasard donne 25 %.

Pour le calcul, ce score est ramené entre 0 et 1 : 25 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

Ce qu'il ne dit pas

Test de 2019, saturé et largement présent dans les données d'entraînement. Il ne dit rien des modèles actuels.

Qui le tient

Zellers et al. (université de Washington et Allen Institute for AI).

rowanzellers.com/hellaswag · test historique · 75 modèles mesurés

Comment lire le score

75 modèles mesurés · 113 mesures

En tête : GPT-4 (Mar 2023), 95,3 %

Chaque trait est un modèle, placé à son meilleur score. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 88 %. Le meilleur, GPT-4 (Mar 2023), atteint 95,3 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
88 %
Score IA 76niveau de Claude Sonnet 4.5
91 %
Score IA 100niveau de Claude Opus 5.5
94 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. HellaSwag est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-4 (Mar 2023)OpenAI · 2 configurationsNon précisée95,3 %118,3
2Llama 3.1-405BMeta AI · poids ouvertsNon précisée89,2 %59,3
3Falcon-180BTechnology Innovation Institute · poids ouvertsNon précisée89 %57,9
4DeepSeek-V3DeepSeek · poids ouvertsNon précisée88,9 %57,2
5DeepSeek-V2 (MoE-236B, May 2024)DeepSeek · poids ouvertsNon précisée87,1 %45,8
6PaLM 2-LGoogle DeepMindNon précisée86,8 %44,0
7Mixtral 8x7BMistral AI · poids ouverts · 2 configurationsNon précisée86,7 %43,4
8davinci-003OpenAI · 3 configurationsNon précisée85,5 %36,7
9Llama 2-70BMeta AI · poids ouvertsNon précisée85,3 %35,6
10Falcon-40BTechnology Innovation Institute · poids ouverts · 4 configurationsNon précisée85,3 %35,5
75 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 75 →Replier le classement ↑
11Qwen2.5-72BAlibaba · poids ouvertsNon précisée84,8 %32,9
12LLaMA-65BMeta AI · poids ouvertsNon précisée84,2 %29,8
13Stable Beluga 2Stability AI · poids ouvertsNon précisée84,1 %29,3
14PaLM 2-MGoogle DeepMindNon précisée84 %28,8
15PaLM (540B)Google Research · 3 configurationsNon précisée83,8 %27,7
16Qwen2.5-Coder-32BAlibaba · poids ouvertsNon précisée83 %23,8
17Falcon 2 11BTechnology Innovation Institute · poids ouverts · 4 configurationsNon précisée82,9 %23,4
18LLaMA-33BMeta AI · poids ouvertsNon précisée82,8 %22,8
19phi-3-medium 14BMicrosoft · poids ouvertsNon précisée82,4 %20,9
19Megatron-Turing NLG 530BMicrosoft · 4 configurationsNon précisée82,4 %20,9
19Nemotron-4 15BNVIDIANon précisée82,4 %20,9
22Gemma 7BGoogle DeepMind · poids ouverts · 2 configurationsNon précisée82,2 %20,0
23PaLM 2-SGoogle DeepMindNon précisée82 %19,0
24davinci-002OpenAINon précisée81,5 %16,7
25Mistral 7B v0.1Mistral AI · poids ouvertsNon précisée81 %14,4
26Llama 2-13BMeta AI · poids ouvertsNon précisée80,7 %13,1
27Qwen2.5-Coder-14BAlibabaNon précisée80,2 %10,9
28InstructGPT 175BOpenAI · 9 configurationsNon précisée79,3 %7,0
29Gopher (280B)DeepMind · 2 configurationsNon précisée79,2 %6,6
29LLaMA-13BMeta AI · poids ouvertsNon précisée79,2 %6,6
31OPT-175BMeta AI · poids ouvertsNon précisée79,1 %6,1
32internlm-20bShanghai AI LaboratoryNon précisée78,1 %2,0
32Falcon-7BTechnology Innovation Institute · poids ouverts · 7 configurationsNon précisée78,1 %2,0
34GPT-3 175B (davinci)OpenAINon précisée77,5 %-0,5
35GLaMGoogle DeepMind · 3 configurationsNon précisée77,2 %-1,7
35Llama 2-7BMeta AI · poids ouverts · 2 configurationsNon précisée77,2 %-1,7
37phi-3-small 7.4BMicrosoft · poids ouvertsNon précisée77 %-2,5
38Qwen2.5-Coder (7B)Alibaba · poids ouvertsNon précisée76,8 %-3,3
39phi-3-mini 3.8BMicrosoft · poids ouvertsNon précisée76,7 %-3,7
40Yi-9B01.AINon précisée76,4 %-4,9
40MPT-7BMosaicML · poids ouverts · 3 configurationsNon précisée76,4 %-4,9
42LLaMA-7BMeta AI · poids ouverts · 3 configurationsNon précisée76,2 %-5,7
43OPT-66BMeta AI · poids ouvertsNon précisée74,5 %-12,3
44BLOOM-176BHugging Face · poids ouvertsNon précisée74,4 %-12,6
44Yi 6B01.AI · poids ouvertsNon précisée74,4 %-12,6
46XGen-7BSalesforce · poids ouvertsNon précisée74,2 %-13,4
47open_llama_7bNon précisée71,8 %-22,3
48INTELLECT-1Prime IntellectNon précisée71,4 %-23,7
49Gemma 2BGoogle DeepMind · poids ouvertsNon précisée71,4 %-23,7
50Qwen2.5-Coder-3BAlibabaNon précisée70,9 %-25,5
51Baichuan2-13BBaichuan · poids ouvertsNon précisée70,8 %-25,9
51Dolly 2.0-12bDatabricks · poids ouvertsNon précisée70,8 %-25,9
53internlm-7bShanghai AI LaboratoryNon précisée70,6 %-26,6
54GPT-NeoX-20BEleutherAI · poids ouvertsNon précisée70,5 %-27,0
55RedPajama-INCITE-7B-BaseNon précisée70,3 %-27,7
56opt-13bMeta AINon précisée69,9 %-29,1
57GPT-3 6.7BOpenAINon précisée68,2 %-35,1
58Baichuan 2-7BBaichuan · poids ouvertsNon précisée68 %-35,8
59InstructGPT 6BOpenAINon précisée67,6 %-37,2
60GPT-J-6BEleutherAI · poids ouvertsNon précisée66,2 %-42,0
61Qwen2.5-Coder (1.5B)Alibaba · poids ouvertsNon précisée61,8 %-57,1
62Cerebras-GPT-13BCerebras Systems · poids ouvertsNon précisée59,4 %-65,3
63vicuna-13b-v1.1Non précisée57,8 %-70,8
64chatglm2-6bZ.ai (Zhipu AI)Non précisée57 %-73,6
65InstructGPT 1.3BOpenAINon précisée56,1 %-76,7
66GPT-3 XL (babbage)OpenAINon précisée55,5 %-78,8
67Phi-2Microsoft · poids ouvertsNon précisée53,6 %-85,6
68Qwen2.5-Coder-0.5BAlibaba · poids ouvertsNon précisée48,4 %-105,2
69Phi-1.5Microsoft · poids ouvertsNon précisée47,6 %-108,4
70GPT-3 MediumOpenAINon précisée43,5 %-126,0
71InstructGPT 350MOpenAINon précisée42,9 %-128,8
72GPT-Neo-2.7BEleutherAI · poids ouvertsNon précisée42,7 %-129,8
73OPT-1.3BMeta AI · poids ouvertsNon précisée41,5 %-135,6
74stablelm-tuned-alpha-7bStability AINon précisée40,7 %-139,6
75GPT-2 (1.5B)OpenAI · poids ouvertsNon précisée40 %-143,3

En bref

Que mesure HellaSwag ?
Choisir la suite la plus plausible d'une courte scène du quotidien parmi quatre propositions, dont trois pièges écrits par une machine. C'est un test historique, hors des scores d'aujourd'hui.
Comment HellaSwag est-il noté ?
Part de bonnes réponses ; le hasard donne 25 %. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 88 %.
Qui est en tête sur HellaSwag ?
GPT-4 (Mar 2023) (OpenAI) est en tête de HellaSwag avec 95,3 %, dans l'édition du 28 septembre 2026. Suivent Llama 3.1-405B (89,2 %) et Falcon-180B (89 %). 75 modèles y sont mesurés.
Quelles sont les limites de HellaSwag ?
Test de 2019, saturé et largement présent dans les données d'entraînement. Il ne dit rien des modèles actuels. Au 28 septembre 2026, le benchmark est archivé.
Combien pèse HellaSwag dans le score IA ?
HellaSwag compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.
Qui maintient HellaSwag ?
Zellers et al. (université de Washington et Allen Institute for AI). Sa page de référence : rowanzellers.com/hellaswag.

Les autres tests historiques

Tous les benchmarks →Comment le score IA est calculé →