# PIQA

> Fiche du benchmark PIQA sur Quelle IA, édition du 28 septembre 2026. Choisir, entre deux façons de faire, celle qui marche dans le monde physique pour un problème de tous les jours. En tête au 28 septembre 2026 : GPT-4o mini (88,7 %). Notation, limites et classement des 59 modèles mesurés.

Page : https://quelleia.com/benchmarks/piqa/
Source du benchmark : https://arxiv.org/abs/1911.11641
Mainteneur : Bisk et al. (2019)
Tâche : Tests historiques
État : archivé

## À quoi il sert

PIQA est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.

## Comment c'est noté

Part de bonnes réponses entre deux choix ; le hasard donne 50 %.

Pour le calcul, ce score est ramené entre 0 et 1 : 50 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

## Ce qu'il ne dit pas

Test de 2019 saturé. Avec deux choix seulement, le hasard pèse lourd et les écarts entre modèles sont faibles.

## Qui le tient

Bisk et al. (2019).

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 86 %. Le meilleur, GPT-4o mini, atteint 88,7 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 86 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 88 %
- Score IA 100 (niveau de Claude Opus 5.5) : 90 %

## Son poids dans le score IA

0 % du score général. PIQA est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

## Classement (59 modèles mesurés · 113 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [GPT-4o mini](https://quelleia.com/modeles/gpt-4o-mini.md) | OpenAI | non précisée | 88,7 % | 88,8 | https://epoch.ai/benchmarks |
| 2 | [Phi-3.5-MoE](https://quelleia.com/modeles/phi-3-5-moe.md) | Microsoft | non précisée | 88,6 % | 87,5 | https://epoch.ai/benchmarks |
| 3 | [Gemini 1.5 Flash (Sep 2024)](https://quelleia.com/modeles/gemini-1-5-flash-sep-2024.md) | Google DeepMind | non précisée | 87,5 % | 73,5 | https://epoch.ai/benchmarks |
| 4 | [Llama 3.1-405B](https://quelleia.com/modeles/llama-3-1-405b.md) | Meta AI | non précisée | 85,9 % | 54,6 | https://epoch.ai/benchmarks |
| 5 | [Falcon-180B](https://quelleia.com/modeles/falcon-180b.md) | Technology Innovation Institute | non précisée | 84,9 % | 43,4 | https://epoch.ai/benchmarks |
| 6 | [DeepSeek-V3](https://quelleia.com/modeles/deepseek-v3.md) | DeepSeek | non précisée | 84,7 % | 41,2 | https://epoch.ai/benchmarks |
| 7 | [Inflection-1](https://quelleia.com/modeles/inflection-1.md) | Inflection AI | non précisée | 84,2 % | 35,8 | https://epoch.ai/benchmarks |
| 8 | [DeepSeek-V2 (MoE-236B, May 2024)](https://quelleia.com/modeles/deepseek-v2-moe-236b-may-2024.md) | DeepSeek | non précisée | 83,9 % | 32,6 | https://epoch.ai/benchmarks |
| 9 | [Gemma 2 9B](https://quelleia.com/modeles/gemma-2-9b.md) | Google DeepMind | non précisée | 83,7 % | 30,5 | https://epoch.ai/benchmarks |
| 10 | [Mixtral 8x7B](https://quelleia.com/modeles/mixtral-8x7b.md) | Mistral AI | non précisée | 83,6 % | 29,4 | https://epoch.ai/benchmarks |
| 11 | [Mistral NeMo](https://quelleia.com/modeles/mistral-nemo.md) | Mistral AI | non précisée | 83,5 % | 28,4 | https://epoch.ai/benchmarks |
| 12 | [Stable Beluga 2](https://quelleia.com/modeles/stable-beluga-2.md) | Stability AI | non précisée | 83,3 % | 26,3 | https://epoch.ai/benchmarks |
| 13 | [Megatron-Turing NLG 530B](https://quelleia.com/modeles/megatron-turing-nlg-530b.md) | Microsoft | non précisée | 83,2 % | 25,2 | https://epoch.ai/benchmarks |
| 14 | [Mistral 7B v0.1](https://quelleia.com/modeles/mistral-7b-v0-1.md) | Mistral AI | non précisée | 83 % | 23,2 | https://epoch.ai/benchmarks |
| 14 | [Falcon-40B](https://quelleia.com/modeles/falcon-40b.md) | Technology Innovation Institute | non précisée | 83 % | 23,2 | https://epoch.ai/benchmarks |
| 16 | [Llama 2-70B](https://quelleia.com/modeles/llama-2-70b.md) | Meta AI | non précisée | 82,8 % | 21,1 | https://epoch.ai/benchmarks |
| 16 | [LLaMA-65B](https://quelleia.com/modeles/llama-65b.md) | Meta AI | non précisée | 82,8 % | 21,1 | https://epoch.ai/benchmarks |
| 18 | [Qwen2.5-72B](https://quelleia.com/modeles/qwen2-5-72b.md) | Alibaba | non précisée | 82,6 % | 19,1 | https://epoch.ai/benchmarks |
| 19 | [Nemotron-4 15B](https://quelleia.com/modeles/nemotron-4-15b.md) | NVIDIA | non précisée | 82,4 % | 17,1 | https://epoch.ai/benchmarks |
| 20 | [PaLM (540B)](https://quelleia.com/modeles/palm-540b.md) | Google Research | non précisée | 82,3 % | 16,1 | https://epoch.ai/benchmarks |
| 20 | [LLaMA-33B](https://quelleia.com/modeles/llama-33b.md) | Meta AI | non précisée | 82,3 % | 16,1 | https://epoch.ai/benchmarks |
| 20 | [InstructGPT 175B](https://quelleia.com/modeles/instructgpt-175b.md) | OpenAI | non précisée | 82,3 % | 16,1 | https://epoch.ai/benchmarks |
| 23 | [Mistral 7B v0.2](https://quelleia.com/modeles/mistral-7b-v0-2.md) | Mistral AI | non précisée | 82,2 % | 15,0 | https://epoch.ai/benchmarks |
| 24 | [MPT-30B](https://quelleia.com/modeles/mpt-30b.md) | MosaicML | non précisée | 81,9 % | 12,0 | https://epoch.ai/benchmarks |
| 24 | [Llama 2-34B](https://quelleia.com/modeles/llama-2-34b.md) | Meta AI | non précisée | 81,9 % | 12,0 | https://epoch.ai/benchmarks |
| 26 | [Chinchilla](https://quelleia.com/modeles/chinchilla.md) | DeepMind | non précisée | 81,8 % | 11,0 | https://epoch.ai/benchmarks |
| 26 | [Gopher (280B)](https://quelleia.com/modeles/gopher-280b.md) | DeepMind | non précisée | 81,8 % | 11,0 | https://epoch.ai/benchmarks |
| 28 | [Llama 3.1-8B](https://quelleia.com/modeles/llama-3-1-8b.md) | Meta AI | non précisée | 81,2 % | 5,1 | https://epoch.ai/benchmarks |
| 28 | [Gemma 7B](https://quelleia.com/modeles/gemma-7b.md) | Google DeepMind | non précisée | 81,2 % | 5,1 | https://epoch.ai/benchmarks |
| 30 | [Phi-3.5-mini](https://quelleia.com/modeles/phi-3-5-mini.md) | Microsoft | non précisée | 81 % | 3,1 | https://epoch.ai/benchmarks |
| 31 | [Llama 2-13B](https://quelleia.com/modeles/llama-2-13b.md) | Meta AI | non précisée | 80,8 % | 1,2 | https://epoch.ai/benchmarks |
| 32 | [MPT-7B](https://quelleia.com/modeles/mpt-7b.md) | MosaicML | non précisée | 80,6 % | -0,8 | https://epoch.ai/benchmarks |
| 33 | [PaLM 62B](https://quelleia.com/modeles/palm-62b.md) | Google DeepMind | non précisée | 80,5 % | -1,8 | https://epoch.ai/benchmarks |
| 34 | [internlm-20b](https://quelleia.com/modeles/internlm-20b.md) | Shanghai AI Laboratory | non précisée | 80,3 % | -3,7 | https://epoch.ai/benchmarks |
| 34 | [Falcon-7B](https://quelleia.com/modeles/falcon-7b.md) | Technology Innovation Institute | non précisée | 80,3 % | -3,7 | https://epoch.ai/benchmarks |
| 36 | [LLaMA-13B](https://quelleia.com/modeles/llama-13b.md) | Meta AI | non précisée | 80,1 % | -5,6 | https://epoch.ai/benchmarks |
| 37 | [Qwen-14B](https://quelleia.com/modeles/qwen-14b.md) | Alibaba | non précisée | 79,9 % | -7,6 | https://epoch.ai/benchmarks |
| 38 | [LLaMA-7B](https://quelleia.com/modeles/llama-7b.md) | Meta AI | non précisée | 79,8 % | -8,5 | https://epoch.ai/benchmarks |
| 39 | [Llama 2-7B](https://quelleia.com/modeles/llama-2-7b.md) | Meta AI | non précisée | 78,8 % | -18,1 | https://epoch.ai/benchmarks |
| 40 | [Baichuan2-13B](https://quelleia.com/modeles/baichuan2-13b.md) | Baichuan | non précisée | 78,1 % | -24,7 | https://epoch.ai/benchmarks |
| 41 | [Qwen-7B](https://quelleia.com/modeles/qwen-7b.md) | Alibaba | non précisée | 77,9 % | -26,5 | https://epoch.ai/benchmarks |
| 41 | [internlm-7b](https://quelleia.com/modeles/internlm-7b.md) | Shanghai AI Laboratory | non précisée | 77,9 % | -26,5 | https://epoch.ai/benchmarks |
| 43 | [vicuna-13b-v1.1](https://quelleia.com/modeles/vicuna-13b-v1-1.md) |  | non précisée | 77,4 % | -31,2 | https://epoch.ai/benchmarks |
| 44 | [Gemma 2B](https://quelleia.com/modeles/gemma-2b.md) | Google DeepMind | non précisée | 77,3 % | -32,2 | https://epoch.ai/benchmarks |
| 45 | [RedPajama-INCITE-7B-Base](https://quelleia.com/modeles/redpajama-incite-7b-base.md) |  | non précisée | 76,9 % | -35,9 | https://epoch.ai/benchmarks |
| 46 | [GPT-NeoX-20B](https://quelleia.com/modeles/gpt-neox-20b.md) | EleutherAI | non précisée | 76,7 % | -37,7 | https://epoch.ai/benchmarks |
| 47 | [Baichuan1-7B](https://quelleia.com/modeles/baichuan1-7b.md) | Baichuan | non précisée | 76,2 % | -42,4 | https://epoch.ai/benchmarks |
| 48 | [open_llama_7b](https://quelleia.com/modeles/open-llama-7b.md) |  | non précisée | 76 % | -44,2 | https://epoch.ai/benchmarks |
| 49 | [opt-13b](https://quelleia.com/modeles/opt-13b.md) | Meta AI | non précisée | 75,7 % | -47,0 | https://epoch.ai/benchmarks |
| 50 | [XGen-7B](https://quelleia.com/modeles/xgen-7b.md) | Salesforce | non précisée | 75,5 % | -48,9 | https://epoch.ai/benchmarks |
| 51 | [Dolly 2.0-12b](https://quelleia.com/modeles/dolly-2-0-12b.md) | Databricks | non précisée | 75,4 % | -49,8 | https://epoch.ai/benchmarks |
| 51 | [GPT-J-6B](https://quelleia.com/modeles/gpt-j-6b.md) | EleutherAI | non précisée | 75,4 % | -49,8 | https://epoch.ai/benchmarks |
| 53 | [Cerebras-GPT-13B](https://quelleia.com/modeles/cerebras-gpt-13b.md) | Cerebras Systems | non précisée | 73,5 % | -67,4 | https://epoch.ai/benchmarks |
| 54 | [Qwen-1_8B](https://quelleia.com/modeles/qwen-1-8b.md) | Alibaba | non précisée | 73,3 % | -69,2 | https://epoch.ai/benchmarks |
| 55 | [GPT-Neo-2.7B](https://quelleia.com/modeles/gpt-neo-2-7b.md) | EleutherAI | non précisée | 72,9 % | -73,0 | https://epoch.ai/benchmarks |
| 56 | [GPT-2 (1.5B)](https://quelleia.com/modeles/gpt-2-1-5b.md) | OpenAI | non précisée | 70,5 % | -95,6 | https://epoch.ai/benchmarks |
| 57 | [chatglm2-6b](https://quelleia.com/modeles/chatglm2-6b.md) | Z.ai (Zhipu AI) | non précisée | 69,6 % | -104,2 | https://epoch.ai/benchmarks |
| 58 | [OPT-1.3B](https://quelleia.com/modeles/opt-1-3b.md) | Meta AI | non précisée | 69 % | -110,1 | https://epoch.ai/benchmarks |
| 59 | [stablelm-tuned-alpha-7b](https://quelleia.com/modeles/stablelm-tuned-alpha-7b.md) | Stability AI | non précisée | 65,8 % | -142,8 | https://epoch.ai/benchmarks |

## En bref

**Que mesure PIQA ?** Choisir, entre deux façons de faire, celle qui marche dans le monde physique pour un problème de tous les jours. C'est un test historique, hors des scores d'aujourd'hui.

**Comment PIQA est-il noté ?** Part de bonnes réponses entre deux choix ; le hasard donne 50 %. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 86 %.

**Qui est en tête sur PIQA ?** GPT-4o mini (OpenAI) est en tête de PIQA avec 88,7 %, dans l'édition du 28 septembre 2026. Suivent Phi-3.5-MoE (88,6 %) et Gemini 1.5 Flash (Sep 2024) (87,5 %). 59 modèles y sont mesurés.

**Quelles sont les limites de PIQA ?** Test de 2019 saturé. Avec deux choix seulement, le hasard pèse lourd et les écarts entre modèles sont faibles. Au 28 septembre 2026, le benchmark est archivé.

**Combien pèse PIQA dans le score IA ?** PIQA compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

**Qui maintient PIQA ?** Bisk et al. (2019). Sa page de référence : arxiv.org/abs/1911.11641.

## Les autres tests historiques

- [MMLU](https://quelleia.com/benchmarks/mmlu.md) : 127 modèles · hors score, archivé
- [WinoGrande](https://quelleia.com/benchmarks/winogrande.md) : 77 modèles · hors score, archivé
- [ARC (AI2 Reasoning Challenge)](https://quelleia.com/benchmarks/arc_ai2.md) : 76 modèles · hors score, archivé
- [BoolQ](https://quelleia.com/benchmarks/boolq.md) : 76 modèles · hors score, archivé
- [HellaSwag](https://quelleia.com/benchmarks/hellaswag.md) : 75 modèles · hors score, archivé
- [LiveBench](https://quelleia.com/benchmarks/livebench.md) : 48 modèles · hors score, archivé
- [BIG-Bench Hard (BBH)](https://quelleia.com/benchmarks/bbh.md) : 45 modèles · hors score, archivé
- [OpenBookQA](https://quelleia.com/benchmarks/openbookqa.md) : 42 modèles · hors score, archivé
- [TriviaQA](https://quelleia.com/benchmarks/triviaqa.md) : 38 modèles · hors score, archivé
- [LAMBADA](https://quelleia.com/benchmarks/lambada.md) : 26 modèles · hors score, archivé
- [ScienceQA](https://quelleia.com/benchmarks/scienceqa.md) : 23 modèles · hors score, archivé
- [ANLI (Adversarial NLI)](https://quelleia.com/benchmarks/anli.md) : 11 modèles · hors score, archivé
- [SuperGLUE](https://quelleia.com/benchmarks/superglue.md) : 8 modèles · hors score, archivé
- [CommonsenseQA 2.0](https://quelleia.com/benchmarks/csqa2.md) : 6 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
