Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

VisionFiche benchmark · Chercheurs de Northwestern, Stanford, NYU et de l'université de Washington · mind-cube.github.io

MindCube

Reconstituer mentalement une scène à partir de quelques photos prises sous des angles différents, et dire ce qu'on verrait en se déplaçant.

ARCHIVÉ

À quoi il sert

MindCube servait à noter la tâche Vision et multimodal. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.

Comment c'est noté

Part de bonnes réponses à choix multiples sur plus de 21 000 questions ; les humains font environ 95 %.

Ce qu'il ne dit pas

Cinq modèles seulement dans les données d'Epoch, aucun sorti après mai 2025. Rien sur les modèles récents.

Qui le tient

Chercheurs de Northwestern, Stanford, NYU et de l'université de Washington.

mind-cube.github.io · tâche Vision · 5 modèles mesurés

Comment lire le score

5 modèles mesurés

En tête : Gemma 3 12B, 46,7 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 74. Le meilleur, Gemma 3 12B, atteint 46,7 %. Le benchmark est archivé, faute de modèle récent mesuré. Avec 5 modèles mesurés seulement, cet étalonnage reste fragile.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
44 %
Score IA 76niveau de Claude Sonnet 4.5
51 %
Score IA 100niveau de Claude Opus 5.5
57 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. MindCube est archivé et ne compte plus : la tâche Vision et multimodal (5 % du score général) repose sur 3 autres benchmarks.

En couleur, la tâche Vision et multimodal dans le score général. MindCube n'y a plus de part.

Le classement du benchmark

Scores relevés sur mind-cube.github.io · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Gemma 3 12BGoogle DeepMind · poids ouvertsNon précisée46,7 %62,0
2mPLUG-Owl3-7B-241101Non précisée44,9 %55,3
3Claude Sonnet 4AnthropicNon précisée44,8 %55,0
4LLaVA-Video-7B-Qwen2Non précisée42 %44,7
5LongVA-7BNon précisée29,5 %-5,0

5 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

En bref

Que mesure MindCube ?
Reconstituer mentalement une scène à partir de quelques photos prises sous des angles différents, et dire ce qu'on verrait en se déplaçant. Sur Quelle IA, il est rangé dans la tâche Vision et multimodal.
Comment MindCube est-il noté ?
Part de bonnes réponses à choix multiples sur plus de 21 000 questions ; les humains font environ 95 %. Un modèle qui obtient 50 % a un score IA d'environ 74.
Qui est en tête sur MindCube ?
Gemma 3 12B (Google DeepMind) est en tête de MindCube avec 46,7 %, dans l'édition du 28 septembre 2026. Suivent mPLUG-Owl3-7B-241101 (44,9 %) et Claude Sonnet 4 (44,8 %). 5 modèles y sont mesurés.
Quelles sont les limites de MindCube ?
Cinq modèles seulement dans les données d'Epoch, aucun sorti après mai 2025. Rien sur les modèles récents. Au 28 septembre 2026, le benchmark est archivé.
Combien pèse MindCube dans le score IA ?
MindCube compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est archivé et ne compte plus : la tâche Vision et multimodal (5 % du score général) repose sur 3 autres benchmarks.
Qui maintient MindCube ?
Chercheurs de Northwestern, Stanford, NYU et de l'université de Washington. Sa page de référence : mind-cube.github.io.

Les autres benchmarks de la tâche Vision et multimodal

Tous les benchmarks →Comment le score IA est calculé →