# HellaSwag

> Fiche du benchmark HellaSwag sur Quelle IA, édition du 28 septembre 2026. Choisir la suite la plus plausible d'une courte scène du quotidien parmi quatre propositions, dont trois pièges écrits par une machine. En tête au 28 septembre 2026 : GPT-4 (Mar 2023) (95,3 %). Notation, limites et classement des 75 modèles mesurés.

Page : https://quelleia.com/benchmarks/hellaswag/
Source du benchmark : https://rowanzellers.com/hellaswag/
Mainteneur : Zellers et al. (université de Washington et Allen Institute for AI)
Tâche : Tests historiques
État : archivé

## À quoi il sert

HellaSwag est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.

## Comment c'est noté

Part de bonnes réponses ; le hasard donne 25 %.

Pour le calcul, ce score est ramené entre 0 et 1 : 25 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

## Ce qu'il ne dit pas

Test de 2019, saturé et largement présent dans les données d'entraînement. Il ne dit rien des modèles actuels.

## Qui le tient

Zellers et al. (université de Washington et Allen Institute for AI).

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 88 %. Le meilleur, GPT-4 (Mar 2023), atteint 95,3 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 88 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 91 %
- Score IA 100 (niveau de Claude Opus 5.5) : 94 %

## Son poids dans le score IA

0 % du score général. HellaSwag est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

## Classement (75 modèles mesurés · 113 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [GPT-4 (Mar 2023)](https://quelleia.com/modeles/gpt-4-mar-2023.md) | OpenAI | non précisée | 95,3 % | 118,3 | https://epoch.ai/benchmarks |
| 2 | [Llama 3.1-405B](https://quelleia.com/modeles/llama-3-1-405b.md) | Meta AI | non précisée | 89,2 % | 59,3 | https://epoch.ai/benchmarks |
| 3 | [Falcon-180B](https://quelleia.com/modeles/falcon-180b.md) | Technology Innovation Institute | non précisée | 89 % | 57,9 | https://epoch.ai/benchmarks |
| 4 | [DeepSeek-V3](https://quelleia.com/modeles/deepseek-v3.md) | DeepSeek | non précisée | 88,9 % | 57,2 | https://epoch.ai/benchmarks |
| 5 | [DeepSeek-V2 (MoE-236B, May 2024)](https://quelleia.com/modeles/deepseek-v2-moe-236b-may-2024.md) | DeepSeek | non précisée | 87,1 % | 45,8 | https://epoch.ai/benchmarks |
| 6 | [PaLM 2-L](https://quelleia.com/modeles/palm-2-l.md) | Google DeepMind | non précisée | 86,8 % | 44,0 | https://epoch.ai/benchmarks |
| 7 | [Mixtral 8x7B](https://quelleia.com/modeles/mixtral-8x7b.md) | Mistral AI | non précisée | 86,7 % | 43,4 | https://epoch.ai/benchmarks |
| 8 | [davinci-003](https://quelleia.com/modeles/davinci-003.md) | OpenAI | non précisée | 85,5 % | 36,7 | https://epoch.ai/benchmarks |
| 9 | [Llama 2-70B](https://quelleia.com/modeles/llama-2-70b.md) | Meta AI | non précisée | 85,3 % | 35,6 | https://epoch.ai/benchmarks |
| 10 | [Falcon-40B](https://quelleia.com/modeles/falcon-40b.md) | Technology Innovation Institute | non précisée | 85,3 % | 35,5 | https://epoch.ai/benchmarks |
| 11 | [Qwen2.5-72B](https://quelleia.com/modeles/qwen2-5-72b.md) | Alibaba | non précisée | 84,8 % | 32,9 | https://epoch.ai/benchmarks |
| 12 | [LLaMA-65B](https://quelleia.com/modeles/llama-65b.md) | Meta AI | non précisée | 84,2 % | 29,8 | https://epoch.ai/benchmarks |
| 13 | [Stable Beluga 2](https://quelleia.com/modeles/stable-beluga-2.md) | Stability AI | non précisée | 84,1 % | 29,3 | https://epoch.ai/benchmarks |
| 14 | [PaLM 2-M](https://quelleia.com/modeles/palm-2-m.md) | Google DeepMind | non précisée | 84 % | 28,8 | https://epoch.ai/benchmarks |
| 15 | [PaLM (540B)](https://quelleia.com/modeles/palm-540b.md) | Google Research | non précisée | 83,8 % | 27,7 | https://epoch.ai/benchmarks |
| 16 | [Qwen2.5-Coder-32B](https://quelleia.com/modeles/qwen2-5-coder-32b.md) | Alibaba | non précisée | 83 % | 23,8 | https://epoch.ai/benchmarks |
| 17 | [Falcon 2 11B](https://quelleia.com/modeles/falcon-2-11b.md) | Technology Innovation Institute | non précisée | 82,9 % | 23,4 | https://epoch.ai/benchmarks |
| 18 | [LLaMA-33B](https://quelleia.com/modeles/llama-33b.md) | Meta AI | non précisée | 82,8 % | 22,8 | https://epoch.ai/benchmarks |
| 19 | [phi-3-medium 14B](https://quelleia.com/modeles/phi-3-medium-14b.md) | Microsoft | non précisée | 82,4 % | 20,9 | https://epoch.ai/benchmarks |
| 19 | [Megatron-Turing NLG 530B](https://quelleia.com/modeles/megatron-turing-nlg-530b.md) | Microsoft | non précisée | 82,4 % | 20,9 | https://epoch.ai/benchmarks |
| 19 | [Nemotron-4 15B](https://quelleia.com/modeles/nemotron-4-15b.md) | NVIDIA | non précisée | 82,4 % | 20,9 | https://epoch.ai/benchmarks |
| 22 | [Gemma 7B](https://quelleia.com/modeles/gemma-7b.md) | Google DeepMind | non précisée | 82,2 % | 20,0 | https://epoch.ai/benchmarks |
| 23 | [PaLM 2-S](https://quelleia.com/modeles/palm-2-s.md) | Google DeepMind | non précisée | 82 % | 19,0 | https://epoch.ai/benchmarks |
| 24 | [davinci-002](https://quelleia.com/modeles/davinci-002.md) | OpenAI | non précisée | 81,5 % | 16,7 | https://epoch.ai/benchmarks |
| 25 | [Mistral 7B v0.1](https://quelleia.com/modeles/mistral-7b-v0-1.md) | Mistral AI | non précisée | 81 % | 14,4 | https://epoch.ai/benchmarks |
| 26 | [Llama 2-13B](https://quelleia.com/modeles/llama-2-13b.md) | Meta AI | non précisée | 80,7 % | 13,1 | https://epoch.ai/benchmarks |
| 27 | [Qwen2.5-Coder-14B](https://quelleia.com/modeles/qwen2-5-coder-14b.md) | Alibaba | non précisée | 80,2 % | 10,9 | https://epoch.ai/benchmarks |
| 28 | [InstructGPT 175B](https://quelleia.com/modeles/instructgpt-175b.md) | OpenAI | non précisée | 79,3 % | 7,0 | https://epoch.ai/benchmarks |
| 29 | [Gopher (280B)](https://quelleia.com/modeles/gopher-280b.md) | DeepMind | non précisée | 79,2 % | 6,6 | https://epoch.ai/benchmarks |
| 29 | [LLaMA-13B](https://quelleia.com/modeles/llama-13b.md) | Meta AI | non précisée | 79,2 % | 6,6 | https://epoch.ai/benchmarks |
| 31 | [OPT-175B](https://quelleia.com/modeles/opt-175b.md) | Meta AI | non précisée | 79,1 % | 6,1 | https://epoch.ai/benchmarks |
| 32 | [internlm-20b](https://quelleia.com/modeles/internlm-20b.md) | Shanghai AI Laboratory | non précisée | 78,1 % | 2,0 | https://epoch.ai/benchmarks |
| 32 | [Falcon-7B](https://quelleia.com/modeles/falcon-7b.md) | Technology Innovation Institute | non précisée | 78,1 % | 2,0 | https://epoch.ai/benchmarks |
| 34 | [GPT-3 175B (davinci)](https://quelleia.com/modeles/gpt-3-175b-davinci.md) | OpenAI | non précisée | 77,5 % | -0,5 | https://epoch.ai/benchmarks |
| 35 | [GLaM](https://quelleia.com/modeles/glam.md) | Google DeepMind | non précisée | 77,2 % | -1,7 | https://epoch.ai/benchmarks |
| 35 | [Llama 2-7B](https://quelleia.com/modeles/llama-2-7b.md) | Meta AI | non précisée | 77,2 % | -1,7 | https://epoch.ai/benchmarks |
| 37 | [phi-3-small 7.4B](https://quelleia.com/modeles/phi-3-small-7-4b.md) | Microsoft | non précisée | 77 % | -2,5 | https://epoch.ai/benchmarks |
| 38 | [Qwen2.5-Coder (7B)](https://quelleia.com/modeles/qwen2-5-coder-7b.md) | Alibaba | non précisée | 76,8 % | -3,3 | https://epoch.ai/benchmarks |
| 39 | [phi-3-mini 3.8B](https://quelleia.com/modeles/phi-3-mini-3-8b.md) | Microsoft | non précisée | 76,7 % | -3,7 | https://epoch.ai/benchmarks |
| 40 | [Yi-9B](https://quelleia.com/modeles/yi-9b.md) | 01.AI | non précisée | 76,4 % | -4,9 | https://epoch.ai/benchmarks |
| 40 | [MPT-7B](https://quelleia.com/modeles/mpt-7b.md) | MosaicML | non précisée | 76,4 % | -4,9 | https://epoch.ai/benchmarks |
| 42 | [LLaMA-7B](https://quelleia.com/modeles/llama-7b.md) | Meta AI | non précisée | 76,2 % | -5,7 | https://epoch.ai/benchmarks |
| 43 | [OPT-66B](https://quelleia.com/modeles/opt-66b.md) | Meta AI | non précisée | 74,5 % | -12,3 | https://epoch.ai/benchmarks |
| 44 | [BLOOM-176B](https://quelleia.com/modeles/bloom-176b.md) | Hugging Face | non précisée | 74,4 % | -12,6 | https://epoch.ai/benchmarks |
| 44 | [Yi 6B](https://quelleia.com/modeles/yi-6b.md) | 01.AI | non précisée | 74,4 % | -12,6 | https://epoch.ai/benchmarks |
| 46 | [XGen-7B](https://quelleia.com/modeles/xgen-7b.md) | Salesforce | non précisée | 74,2 % | -13,4 | https://epoch.ai/benchmarks |
| 47 | [open_llama_7b](https://quelleia.com/modeles/open-llama-7b.md) |  | non précisée | 71,8 % | -22,3 | https://epoch.ai/benchmarks |
| 48 | [INTELLECT-1](https://quelleia.com/modeles/intellect-1.md) | Prime Intellect | non précisée | 71,4 % | -23,7 | https://epoch.ai/benchmarks |
| 49 | [Gemma 2B](https://quelleia.com/modeles/gemma-2b.md) | Google DeepMind | non précisée | 71,4 % | -23,7 | https://epoch.ai/benchmarks |
| 50 | [Qwen2.5-Coder-3B](https://quelleia.com/modeles/qwen2-5-coder-3b.md) | Alibaba | non précisée | 70,9 % | -25,5 | https://epoch.ai/benchmarks |
| 51 | [Baichuan2-13B](https://quelleia.com/modeles/baichuan2-13b.md) | Baichuan | non précisée | 70,8 % | -25,9 | https://epoch.ai/benchmarks |
| 51 | [Dolly 2.0-12b](https://quelleia.com/modeles/dolly-2-0-12b.md) | Databricks | non précisée | 70,8 % | -25,9 | https://epoch.ai/benchmarks |
| 53 | [internlm-7b](https://quelleia.com/modeles/internlm-7b.md) | Shanghai AI Laboratory | non précisée | 70,6 % | -26,6 | https://epoch.ai/benchmarks |
| 54 | [GPT-NeoX-20B](https://quelleia.com/modeles/gpt-neox-20b.md) | EleutherAI | non précisée | 70,5 % | -27,0 | https://epoch.ai/benchmarks |
| 55 | [RedPajama-INCITE-7B-Base](https://quelleia.com/modeles/redpajama-incite-7b-base.md) |  | non précisée | 70,3 % | -27,7 | https://epoch.ai/benchmarks |
| 56 | [opt-13b](https://quelleia.com/modeles/opt-13b.md) | Meta AI | non précisée | 69,9 % | -29,1 | https://epoch.ai/benchmarks |
| 57 | [GPT-3 6.7B](https://quelleia.com/modeles/gpt-3-6-7b.md) | OpenAI | non précisée | 68,2 % | -35,1 | https://epoch.ai/benchmarks |
| 58 | [Baichuan 2-7B](https://quelleia.com/modeles/baichuan-2-7b.md) | Baichuan | non précisée | 68 % | -35,8 | https://epoch.ai/benchmarks |
| 59 | [InstructGPT 6B](https://quelleia.com/modeles/instructgpt-6b.md) | OpenAI | non précisée | 67,6 % | -37,2 | https://epoch.ai/benchmarks |
| 60 | [GPT-J-6B](https://quelleia.com/modeles/gpt-j-6b.md) | EleutherAI | non précisée | 66,2 % | -42,0 | https://epoch.ai/benchmarks |
| 61 | [Qwen2.5-Coder (1.5B)](https://quelleia.com/modeles/qwen2-5-coder-1-5b.md) | Alibaba | non précisée | 61,8 % | -57,1 | https://epoch.ai/benchmarks |
| 62 | [Cerebras-GPT-13B](https://quelleia.com/modeles/cerebras-gpt-13b.md) | Cerebras Systems | non précisée | 59,4 % | -65,3 | https://epoch.ai/benchmarks |
| 63 | [vicuna-13b-v1.1](https://quelleia.com/modeles/vicuna-13b-v1-1.md) |  | non précisée | 57,8 % | -70,8 | https://epoch.ai/benchmarks |
| 64 | [chatglm2-6b](https://quelleia.com/modeles/chatglm2-6b.md) | Z.ai (Zhipu AI) | non précisée | 57 % | -73,6 | https://epoch.ai/benchmarks |
| 65 | [InstructGPT 1.3B](https://quelleia.com/modeles/instructgpt-1-3b.md) | OpenAI | non précisée | 56,1 % | -76,7 | https://epoch.ai/benchmarks |
| 66 | [GPT-3 XL (babbage)](https://quelleia.com/modeles/gpt-3-xl-babbage.md) | OpenAI | non précisée | 55,5 % | -78,8 | https://epoch.ai/benchmarks |
| 67 | [Phi-2](https://quelleia.com/modeles/phi-2.md) | Microsoft | non précisée | 53,6 % | -85,6 | https://epoch.ai/benchmarks |
| 68 | [Qwen2.5-Coder-0.5B](https://quelleia.com/modeles/qwen2-5-coder-0-5b.md) | Alibaba | non précisée | 48,4 % | -105,2 | https://epoch.ai/benchmarks |
| 69 | [Phi-1.5](https://quelleia.com/modeles/phi-1-5.md) | Microsoft | non précisée | 47,6 % | -108,4 | https://epoch.ai/benchmarks |
| 70 | [GPT-3 Medium](https://quelleia.com/modeles/gpt-3-medium.md) | OpenAI | non précisée | 43,5 % | -126,0 | https://epoch.ai/benchmarks |
| 71 | [InstructGPT 350M](https://quelleia.com/modeles/instructgpt-350m.md) | OpenAI | non précisée | 42,9 % | -128,8 | https://epoch.ai/benchmarks |
| 72 | [GPT-Neo-2.7B](https://quelleia.com/modeles/gpt-neo-2-7b.md) | EleutherAI | non précisée | 42,7 % | -129,8 | https://epoch.ai/benchmarks |
| 73 | [OPT-1.3B](https://quelleia.com/modeles/opt-1-3b.md) | Meta AI | non précisée | 41,5 % | -135,6 | https://epoch.ai/benchmarks |
| 74 | [stablelm-tuned-alpha-7b](https://quelleia.com/modeles/stablelm-tuned-alpha-7b.md) | Stability AI | non précisée | 40,7 % | -139,6 | https://epoch.ai/benchmarks |
| 75 | [GPT-2 (1.5B)](https://quelleia.com/modeles/gpt-2-1-5b.md) | OpenAI | non précisée | 40 % | -143,3 | https://epoch.ai/benchmarks |

## En bref

**Que mesure HellaSwag ?** Choisir la suite la plus plausible d'une courte scène du quotidien parmi quatre propositions, dont trois pièges écrits par une machine. C'est un test historique, hors des scores d'aujourd'hui.

**Comment HellaSwag est-il noté ?** Part de bonnes réponses ; le hasard donne 25 %. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 88 %.

**Qui est en tête sur HellaSwag ?** GPT-4 (Mar 2023) (OpenAI) est en tête de HellaSwag avec 95,3 %, dans l'édition du 28 septembre 2026. Suivent Llama 3.1-405B (89,2 %) et Falcon-180B (89 %). 75 modèles y sont mesurés.

**Quelles sont les limites de HellaSwag ?** Test de 2019, saturé et largement présent dans les données d'entraînement. Il ne dit rien des modèles actuels. Au 28 septembre 2026, le benchmark est archivé.

**Combien pèse HellaSwag dans le score IA ?** HellaSwag compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

**Qui maintient HellaSwag ?** Zellers et al. (université de Washington et Allen Institute for AI). Sa page de référence : rowanzellers.com/hellaswag.

## Les autres tests historiques

- [MMLU](https://quelleia.com/benchmarks/mmlu.md) : 127 modèles · hors score, archivé
- [WinoGrande](https://quelleia.com/benchmarks/winogrande.md) : 77 modèles · hors score, archivé
- [ARC (AI2 Reasoning Challenge)](https://quelleia.com/benchmarks/arc_ai2.md) : 76 modèles · hors score, archivé
- [BoolQ](https://quelleia.com/benchmarks/boolq.md) : 76 modèles · hors score, archivé
- [PIQA](https://quelleia.com/benchmarks/piqa.md) : 59 modèles · hors score, archivé
- [LiveBench](https://quelleia.com/benchmarks/livebench.md) : 48 modèles · hors score, archivé
- [BIG-Bench Hard (BBH)](https://quelleia.com/benchmarks/bbh.md) : 45 modèles · hors score, archivé
- [OpenBookQA](https://quelleia.com/benchmarks/openbookqa.md) : 42 modèles · hors score, archivé
- [TriviaQA](https://quelleia.com/benchmarks/triviaqa.md) : 38 modèles · hors score, archivé
- [LAMBADA](https://quelleia.com/benchmarks/lambada.md) : 26 modèles · hors score, archivé
- [ScienceQA](https://quelleia.com/benchmarks/scienceqa.md) : 23 modèles · hors score, archivé
- [ANLI (Adversarial NLI)](https://quelleia.com/benchmarks/anli.md) : 11 modèles · hors score, archivé
- [SuperGLUE](https://quelleia.com/benchmarks/superglue.md) : 8 modèles · hors score, archivé
- [CommonsenseQA 2.0](https://quelleia.com/benchmarks/csqa2.md) : 6 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
