À quoi il sert
MindCube servait à noter la tâche Vision et multimodal. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.
VisionFiche benchmark · Chercheurs de Northwestern, Stanford, NYU et de l'université de Washington · mind-cube.github.io
Reconstituer mentalement une scène à partir de quelques photos prises sous des angles différents, et dire ce qu'on verrait en se déplaçant.
MindCube servait à noter la tâche Vision et multimodal. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.
Part de bonnes réponses à choix multiples sur plus de 21 000 questions ; les humains font environ 95 %.
Cinq modèles seulement dans les données d'Epoch, aucun sorti après mai 2025. Rien sur les modèles récents.
Chercheurs de Northwestern, Stanford, NYU et de l'université de Washington.
mind-cube.github.io · tâche Vision · 5 modèles mesurés
En tête : Gemma 3 12B, 46,7 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 74. Le meilleur, Gemma 3 12B, atteint 46,7 %. Le benchmark est archivé, faute de modèle récent mesuré. Avec 5 modèles mesurés seulement, cet étalonnage reste fragile.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
0 %du score général. MindCube est archivé et ne compte plus : la tâche Vision et multimodal (5 % du score général) repose sur 3 autres benchmarks.
En couleur, la tâche Vision et multimodal dans le score général. MindCube n'y a plus de part.
5 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.