Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

Test historiqueFiche benchmark · Bisk et al. (2019) · arxiv.org

PIQA

Choisir, entre deux façons de faire, celle qui marche dans le monde physique pour un problème de tous les jours.

ARCHIVÉ

À quoi il sert

PIQA est un test historique : il ne compte dans aucun score d'aujourd'hui. Il sert à situer les anciens modèles sur la même échelle que les nouveaux.

Comment c'est noté

Part de bonnes réponses entre deux choix ; le hasard donne 50 %.

Pour le calcul, ce score est ramené entre 0 et 1 : 50 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

Ce qu'il ne dit pas

Test de 2019 saturé. Avec deux choix seulement, le hasard pèse lourd et les écarts entre modèles sont faibles.

Comment lire le score

59 modèles mesurés · 113 mesures

En tête : GPT-4o mini, 88,7 %

Chaque trait est un modèle, placé à son meilleur score. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 86 %. Le meilleur, GPT-4o mini, atteint 88,7 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
86 %
Score IA 76niveau de Claude Sonnet 4.5
88 %
Score IA 100niveau de Claude Opus 5.5
90 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. PIQA est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-4o miniOpenAINon précisée88,7 %88,8
2Phi-3.5-MoEMicrosoft · poids ouvertsNon précisée88,6 %87,5
3Gemini 1.5 Flash (Sep 2024)Google DeepMindNon précisée87,5 %73,5
4Llama 3.1-405BMeta AI · poids ouvertsNon précisée85,9 %54,6
5Falcon-180BTechnology Innovation Institute · poids ouvertsNon précisée84,9 %43,4
6DeepSeek-V3DeepSeek · poids ouvertsNon précisée84,7 %41,2
7Inflection-1Inflection AINon précisée84,2 %35,8
8DeepSeek-V2 (MoE-236B, May 2024)DeepSeek · poids ouvertsNon précisée83,9 %32,6
9Gemma 2 9BGoogle DeepMind · poids ouvertsNon précisée83,7 %30,5
10Mixtral 8x7BMistral AI · poids ouvertsNon précisée83,6 %29,4
59 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 59 →Replier le classement ↑
11Mistral NeMoMistral AI · poids ouvertsNon précisée83,5 %28,4
12Stable Beluga 2Stability AI · poids ouvertsNon précisée83,3 %26,3
13Megatron-Turing NLG 530BMicrosoft · 4 configurationsNon précisée83,2 %25,2
14Mistral 7B v0.1Mistral AI · poids ouverts · 3 configurationsNon précisée83 %23,2
14Falcon-40BTechnology Innovation Institute · poids ouverts · 2 configurationsNon précisée83 %23,2
16Llama 2-70BMeta AI · poids ouverts · 4 configurationsNon précisée82,8 %21,1
16LLaMA-65BMeta AI · poids ouverts · 3 configurationsNon précisée82,8 %21,1
18Qwen2.5-72BAlibaba · poids ouvertsNon précisée82,6 %19,1
19Nemotron-4 15BNVIDIANon précisée82,4 %17,1
20PaLM (540B)Google Research · 2 configurationsNon précisée82,3 %16,1
20LLaMA-33BMeta AI · poids ouverts · 4 configurationsNon précisée82,3 %16,1
20InstructGPT 175BOpenAI · 8 configurationsNon précisée82,3 %16,1
23Mistral 7B v0.2Mistral AINon précisée82,2 %15,0
24MPT-30BMosaicML · poids ouvertsNon précisée81,9 %12,0
24Llama 2-34BMeta AI · 3 configurationsNon précisée81,9 %12,0
26ChinchillaDeepMind · 2 configurationsNon précisée81,8 %11,0
26Gopher (280B)DeepMind · 4 configurationsNon précisée81,8 %11,0
28Llama 3.1-8BMeta AI · poids ouvertsNon précisée81,2 %5,1
28Gemma 7BGoogle DeepMind · poids ouverts · 2 configurationsNon précisée81,2 %5,1
30Phi-3.5-miniMicrosoft · poids ouvertsNon précisée81 %3,1
31Llama 2-13BMeta AI · poids ouverts · 6 configurationsNon précisée80,8 %1,2
32MPT-7BMosaicML · poids ouverts · 4 configurationsNon précisée80,6 %-0,8
33PaLM 62BGoogle DeepMindNon précisée80,5 %-1,8
34internlm-20bShanghai AI LaboratoryNon précisée80,3 %-3,7
34Falcon-7BTechnology Innovation Institute · poids ouverts · 5 configurationsNon précisée80,3 %-3,7
36LLaMA-13BMeta AI · poids ouverts · 3 configurationsNon précisée80,1 %-5,6
37Qwen-14BAlibaba · poids ouverts · 2 configurationsNon précisée79,9 %-7,6
38LLaMA-7BMeta AI · poids ouverts · 5 configurationsNon précisée79,8 %-8,5
39Llama 2-7BMeta AI · poids ouverts · 6 configurationsNon précisée78,8 %-18,1
40Baichuan2-13BBaichuan · poids ouverts · 2 configurationsNon précisée78,1 %-24,7
41Qwen-7BAlibaba · poids ouvertsNon précisée77,9 %-26,5
41internlm-7bShanghai AI LaboratoryNon précisée77,9 %-26,5
43vicuna-13b-v1.1Non précisée77,4 %-31,2
44Gemma 2BGoogle DeepMind · poids ouvertsNon précisée77,3 %-32,2
45RedPajama-INCITE-7B-BaseNon précisée76,9 %-35,9
46GPT-NeoX-20BEleutherAI · poids ouvertsNon précisée76,7 %-37,7
47Baichuan1-7BBaichuan · poids ouvertsNon précisée76,2 %-42,4
48open_llama_7bNon précisée76 %-44,2
49opt-13bMeta AINon précisée75,7 %-47,0
50XGen-7BSalesforce · poids ouvertsNon précisée75,5 %-48,9
51Dolly 2.0-12bDatabricks · poids ouvertsNon précisée75,4 %-49,8
51GPT-J-6BEleutherAI · poids ouvertsNon précisée75,4 %-49,8
53Cerebras-GPT-13BCerebras Systems · poids ouvertsNon précisée73,5 %-67,4
54Qwen-1_8BAlibabaNon précisée73,3 %-69,2
55GPT-Neo-2.7BEleutherAI · poids ouvertsNon précisée72,9 %-73,0
56GPT-2 (1.5B)OpenAI · poids ouvertsNon précisée70,5 %-95,6
57chatglm2-6bZ.ai (Zhipu AI)Non précisée69,6 %-104,2
58OPT-1.3BMeta AI · poids ouvertsNon précisée69 %-110,1
59stablelm-tuned-alpha-7bStability AINon précisée65,8 %-142,8

En bref

Que mesure PIQA ?
Choisir, entre deux façons de faire, celle qui marche dans le monde physique pour un problème de tous les jours. C'est un test historique, hors des scores d'aujourd'hui.
Comment PIQA est-il noté ?
Part de bonnes réponses entre deux choix ; le hasard donne 50 %. Le test est devenu facile : d'après sa courbe d'étalonnage, un modèle de score IA 51 y obtient déjà environ 86 %.
Qui est en tête sur PIQA ?
GPT-4o mini (OpenAI) est en tête de PIQA avec 88,7 %, dans l'édition du 28 septembre 2026. Suivent Phi-3.5-MoE (88,6 %) et Gemini 1.5 Flash (Sep 2024) (87,5 %). 59 modèles y sont mesurés.
Quelles sont les limites de PIQA ?
Test de 2019 saturé. Avec deux choix seulement, le hasard pèse lourd et les écarts entre modèles sont faibles. Au 28 septembre 2026, le benchmark est archivé.
Combien pèse PIQA dans le score IA ?
PIQA compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est un test historique : il n'entre dans aucun score d'aujourd'hui et sert à situer les anciens modèles sur l'échelle commune.
Qui maintient PIQA ?
Bisk et al. (2019). Sa page de référence : arxiv.org/abs/1911.11641.

Les autres tests historiques

Tous les benchmarks →Comment le score IA est calculé →