# MindCube

> Fiche du benchmark MindCube sur Quelle IA, édition du 28 septembre 2026. Reconstituer mentalement une scène à partir de quelques photos prises sous des angles différents, et dire ce qu'on verrait en se déplaçant. En tête au 28 septembre 2026 : Gemma 3 12B (46,7 %). Notation, limites et classement des 5 modèles mesurés.

Page : https://quelleia.com/benchmarks/mindcube/
Source du benchmark : https://mind-cube.github.io/
Mainteneur : Chercheurs de Northwestern, Stanford, NYU et de l'université de Washington
Tâche : Vision et multimodal
État : archivé

## À quoi il sert

MindCube servait à noter la tâche Vision et multimodal. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.

## Comment c'est noté

Part de bonnes réponses à choix multiples sur plus de 21 000 questions ; les humains font environ 95 %.

## Ce qu'il ne dit pas

Cinq modèles seulement dans les données d'Epoch, aucun sorti après mai 2025. Rien sur les modèles récents.

## Qui le tient

Chercheurs de Northwestern, Stanford, NYU et de l'université de Washington.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 74. Le meilleur, Gemma 3 12B, atteint 46,7 %. Le benchmark est archivé, faute de modèle récent mesuré. Avec 5 modèles mesurés seulement, cet étalonnage reste fragile.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 44 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 51 %
- Score IA 100 (niveau de Claude Opus 5.5) : 57 %

## Son poids dans le score IA

0 % du score général. MindCube est archivé et ne compte plus : la tâche Vision et multimodal (5 % du score général) repose sur 3 autres benchmarks.

## Classement (5 modèles mesurés, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [Gemma 3 12B](https://quelleia.com/modeles/gemma-3-12b.md) | Google DeepMind | non précisée | 46,7 % | 62,0 | https://mind-cube.github.io/ |
| 2 | [mPLUG-Owl3-7B-241101](https://quelleia.com/modeles/mplug-owl3-7b-241101.md) |  | non précisée | 44,9 % | 55,3 | https://mind-cube.github.io/ |
| 3 | [Claude Sonnet 4](https://quelleia.com/modeles/claude-sonnet-4.md) | Anthropic | non précisée | 44,8 % | 55,0 | https://mind-cube.github.io/ |
| 4 | [LLaVA-Video-7B-Qwen2](https://quelleia.com/modeles/llava-video-7b-qwen2.md) |  | non précisée | 42 % | 44,7 | https://mind-cube.github.io/ |
| 5 | [LongVA-7B](https://quelleia.com/modeles/longva-7b.md) |  | non précisée | 29,5 % | -5,0 | https://mind-cube.github.io/ |

## En bref

**Que mesure MindCube ?** Reconstituer mentalement une scène à partir de quelques photos prises sous des angles différents, et dire ce qu'on verrait en se déplaçant. Sur Quelle IA, il est rangé dans la tâche Vision et multimodal.

**Comment MindCube est-il noté ?** Part de bonnes réponses à choix multiples sur plus de 21 000 questions ; les humains font environ 95 %. Un modèle qui obtient 50 % a un score IA d'environ 74.

**Qui est en tête sur MindCube ?** Gemma 3 12B (Google DeepMind) est en tête de MindCube avec 46,7 %, dans l'édition du 28 septembre 2026. Suivent mPLUG-Owl3-7B-241101 (44,9 %) et Claude Sonnet 4 (44,8 %). 5 modèles y sont mesurés.

**Quelles sont les limites de MindCube ?** Cinq modèles seulement dans les données d'Epoch, aucun sorti après mai 2025. Rien sur les modèles récents. Au 28 septembre 2026, le benchmark est archivé.

**Combien pèse MindCube dans le score IA ?** MindCube compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est archivé et ne compte plus : la tâche Vision et multimodal (5 % du score général) repose sur 3 autres benchmarks.

**Qui maintient MindCube ?** Chercheurs de Northwestern, Stanford, NYU et de l'université de Washington. Sa page de référence : mind-cube.github.io.

## Les autres benchmarks de la tâche Vision et multimodal

- [Arena, vision](https://quelleia.com/benchmarks/arena_vision.md) : 121 modèles · 1,67 % du score
- [Furniture Assembly](https://quelleia.com/benchmarks/furniture_assembly.md) : 28 modèles · 1,67 % du score
- [Blueprint-Bench 2](https://quelleia.com/benchmarks/blueprint_bench_2.md) : 26 modèles · 1,67 % du score
- [Video-MME](https://quelleia.com/benchmarks/videomme.md) : 50 modèles · hors score, archivé
- [VPCT (Visual Physics Comprehension Test)](https://quelleia.com/benchmarks/vpct.md) : 28 modèles · hors score, archivé
- [GeoBench](https://quelleia.com/benchmarks/geobench.md) : 27 modèles · hors score, archivé
- [CadEval](https://quelleia.com/benchmarks/cadeval.md) : 15 modèles · hors score, archivé
- [SpatialViz-Bench](https://quelleia.com/benchmarks/spatialviz_bench.md) : 8 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
