# VPCT (Visual Physics Comprehension Test)

> Fiche du benchmark VPCT (Visual Physics Comprehension Test) sur Quelle IA, édition du 28 septembre 2026. 100 schémas où une bille roule sur des rampes : prédire dans lequel des trois seaux elle va tomber. En tête au 28 septembre 2026 : Gemini 3 Pro (91 %). Notation, limites et classement des 28 modèles mesurés.

Page : https://quelleia.com/benchmarks/vpct/
Source du benchmark : https://cbrower.dev/vpct
Mainteneur : Chase Brower (projet personnel)
Tâche : Vision et multimodal
État : archivé

## À quoi il sert

VPCT (Visual Physics Comprehension Test) servait à noter la tâche Vision et multimodal. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.

## Comment c'est noté

Part de bonnes réponses ; le hasard donne 33 %, les trois humains testés ont fait 100 %.

Pour le calcul, ce score est ramené entre 0 et 1 : 33 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

## Ce qu'il ne dit pas

Tâche unique et très étroite, tenue par une seule personne. Elle teste l'intuition physique sur un schéma, rien d'autre.

## Qui le tient

Chase Brower (projet personnel).

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 67 % a un score IA d'environ 81. Le meilleur, Gemini 3 Pro, atteint 91 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 33 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 49 %
- Score IA 100 (niveau de Claude Opus 5.5) : plus de 99 %

## Son poids dans le score IA

0 % du score général. VPCT (Visual Physics Comprehension Test) est archivé et ne compte plus : la tâche Vision et multimodal (5 % du score général) repose sur 3 autres benchmarks.

## Classement (28 modèles mesurés · 38 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [Gemini 3 Pro](https://quelleia.com/modeles/gemini-3-pro.md) | Google DeepMind | non précisée | 91 % | 89,0 | https://epoch.ai/benchmarks |
| 2 | [GPT-5.2](https://quelleia.com/modeles/gpt-5-2.md) | OpenAI | Maximale | 84 % | 86,1 | https://epoch.ai/benchmarks |
| 3 | [Gemini 3 Flash](https://quelleia.com/modeles/gemini-3-flash.md) | Google DeepMind | non précisée | 72,6 % | 82,9 | https://epoch.ai/benchmarks |
| 4 | [GPT-5](https://quelleia.com/modeles/gpt-5.md) | OpenAI | Élevée | 66 % | 81,2 | https://epoch.ai/benchmarks |
| 5 | [GPT-5.1](https://quelleia.com/modeles/gpt-5-1.md) | OpenAI | Élevée | 58,7 % | 79,4 | https://epoch.ai/benchmarks |
| 6 | [o4-mini](https://quelleia.com/modeles/o4-mini.md) | OpenAI | Moyenne | 57,5 % | 79,1 | https://epoch.ai/benchmarks |
| 7 | [o3](https://quelleia.com/modeles/o3.md) | OpenAI | Moyenne | 52 % | 77,5 | https://epoch.ai/benchmarks |
| 8 | [Gemini 2.5 Pro (Mar 2025)](https://quelleia.com/modeles/gemini-2-5-pro-mar-2025.md) | Google DeepMind | non précisée | 48 % | 76,2 | https://epoch.ai/benchmarks |
| 9 | [Gemini 2.5 Pro (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-pro-jun-2025.md) | Google DeepMind | non précisée | 46,4 % | 75,6 | https://epoch.ai/benchmarks |
| 10 | [Gemini 2.5 Flash (Sep 2025)](https://quelleia.com/modeles/gemini-2-5-flash-sep-2025.md) | Google DeepMind | non précisée | 46,2 % | 75,5 | https://epoch.ai/benchmarks |
| 11 | [GPT-4.5](https://quelleia.com/modeles/gpt-4-5.md) | OpenAI | non précisée | 45 % | 75,0 | https://epoch.ai/benchmarks |
| 12 | [gemini-robotics-er-1.5-preview](https://quelleia.com/modeles/gemini-robotics-er-1-5-preview.md) | Google DeepMind | non précisée | 40,8 % | 72,8 | https://epoch.ai/benchmarks |
| 13 | [Gemini 2.5 Pro (May 2025)](https://quelleia.com/modeles/gemini-2-5-pro-may-2025.md) | Google DeepMind | non précisée | 40,5 % | 72,7 | https://epoch.ai/benchmarks |
| 14 | [GPT-5 mini](https://quelleia.com/modeles/gpt-5-mini.md) | OpenAI | Moyenne | 40,2 % | 72,5 | https://epoch.ai/benchmarks |
| 15 | [Claude Opus 4.5](https://quelleia.com/modeles/claude-opus-4-5.md) | Anthropic | Budget | 40 % | 72,3 | https://epoch.ai/benchmarks |
| 15 | [GPT-4o (Nov 2024)](https://quelleia.com/modeles/gpt-4o-nov-2024.md) | OpenAI | non précisée | 40 % | 72,3 | https://epoch.ai/benchmarks |
| 17 | [Claude Sonnet 4.5](https://quelleia.com/modeles/claude-sonnet-4-5.md) | Anthropic | Budget | 39,8 % | 72,2 | https://epoch.ai/benchmarks |
| 18 | [Claude 3.7 Sonnet](https://quelleia.com/modeles/claude-3-7-sonnet.md) | Anthropic | non précisée | 39 % | 71,6 | https://epoch.ai/benchmarks |
| 19 | [Claude Opus 4](https://quelleia.com/modeles/claude-opus-4.md) | Anthropic | Budget | 38 % | 70,7 | https://epoch.ai/benchmarks |
| 19 | [Gemini 2.5 Flash (Apr 2025)](https://quelleia.com/modeles/gemini-2-5-flash-apr-2025.md) | Google DeepMind | non précisée | 38 % | 70,7 | https://epoch.ai/benchmarks |
| 21 | [GPT-5 nano](https://quelleia.com/modeles/gpt-5-nano.md) | OpenAI | Élevée | 37,2 % | 69,9 | https://epoch.ai/benchmarks |
| 22 | [o1](https://quelleia.com/modeles/o1.md) | OpenAI | Moyenne | 37 % | 69,7 | https://epoch.ai/benchmarks |
| 23 | [Claude Opus 4.1](https://quelleia.com/modeles/claude-opus-4-1.md) | Anthropic | non précisée | 35 % | 66,3 | https://epoch.ai/benchmarks |
| 24 | [Claude Sonnet 4](https://quelleia.com/modeles/claude-sonnet-4.md) | Anthropic | Budget | 34 % | 62,4 | https://epoch.ai/benchmarks |
| 24 | [GPT-4o mini](https://quelleia.com/modeles/gpt-4o-mini.md) | OpenAI | non précisée | 34 % | 62,4 | https://epoch.ai/benchmarks |
| 26 | [Claude 3.5 Sonnet](https://quelleia.com/modeles/claude-3-5-sonnet.md) | Anthropic | non précisée | 33 % | 62,4 | https://epoch.ai/benchmarks |
| 26 | [Claude 3.5 Sonnet (October 2024)](https://quelleia.com/modeles/claude-3-5-sonnet-october-2024.md) | Anthropic | non précisée | 33 % | 62,4 | https://epoch.ai/benchmarks |
| 28 | [Gemini 2.5 Flash-Lite (Sep 2025)](https://quelleia.com/modeles/gemini-2-5-flash-lite-sep-2025.md) | Google DeepMind | non précisée | 30 % | 62,4 | https://epoch.ai/benchmarks |

## En bref

**Que mesure VPCT (Visual Physics Comprehension Test) ?** 100 schémas où une bille roule sur des rampes : prédire dans lequel des trois seaux elle va tomber. Sur Quelle IA, il est rangé dans la tâche Vision et multimodal.

**Comment VPCT (Visual Physics Comprehension Test) est-il noté ?** Part de bonnes réponses ; le hasard donne 33 %, les trois humains testés ont fait 100 %. Un modèle qui obtient 67 % a un score IA d'environ 81.

**Qui est en tête sur VPCT (Visual Physics Comprehension Test) ?** Gemini 3 Pro (Google DeepMind) est en tête de VPCT (Visual Physics Comprehension Test) avec 91 %, dans l'édition du 28 septembre 2026. Suivent GPT-5.2 (84 %) et Gemini 3 Flash (72,6 %). 28 modèles y sont mesurés.

**Quelles sont les limites de VPCT (Visual Physics Comprehension Test) ?** Tâche unique et très étroite, tenue par une seule personne. Elle teste l'intuition physique sur un schéma, rien d'autre. Au 28 septembre 2026, le benchmark est archivé.

**Combien pèse VPCT (Visual Physics Comprehension Test) dans le score IA ?** VPCT (Visual Physics Comprehension Test) compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est archivé et ne compte plus : la tâche Vision et multimodal (5 % du score général) repose sur 3 autres benchmarks.

**Qui maintient VPCT (Visual Physics Comprehension Test) ?** Chase Brower (projet personnel). Sa page de référence : cbrower.dev/vpct.

## Les autres benchmarks de la tâche Vision et multimodal

- [Arena, vision](https://quelleia.com/benchmarks/arena_vision.md) : 121 modèles · 1,67 % du score
- [Furniture Assembly](https://quelleia.com/benchmarks/furniture_assembly.md) : 28 modèles · 1,67 % du score
- [Blueprint-Bench 2](https://quelleia.com/benchmarks/blueprint_bench_2.md) : 26 modèles · 1,67 % du score
- [Video-MME](https://quelleia.com/benchmarks/videomme.md) : 50 modèles · hors score, archivé
- [GeoBench](https://quelleia.com/benchmarks/geobench.md) : 27 modèles · hors score, archivé
- [CadEval](https://quelleia.com/benchmarks/cadeval.md) : 15 modèles · hors score, archivé
- [SpatialViz-Bench](https://quelleia.com/benchmarks/spatialviz_bench.md) : 8 modèles · hors score, archivé
- [MindCube](https://quelleia.com/benchmarks/mindcube.md) : 5 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
