À quoi il sert
SpatialViz-Bench servait à noter la tâche Vision et multimodal. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.
VisionFiche benchmark · Auteurs de l'article SpatialViz-Bench (2025) · arxiv.org
1 180 questions de visualisation dans l'espace : rotation mentale, pliage, coupe d'objets, mécanismes en mouvement.
SpatialViz-Bench servait à noter la tâche Vision et multimodal. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.
Part de bonnes réponses à choix multiples ; les humains font environ 82 %.
Huit modèles seulement, recopiés de l'article d'origine de 2025, sans mise à jour depuis.
Auteurs de l'article SpatialViz-Bench (2025).
arxiv.org/abs/2507.07610 · tâche Vision · 8 modèles mesurés
En tête : Gemini 2.5 Pro (Jun 2025), 44,7 %
Chaque trait est un modèle, placé à son meilleur score. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 48 %. Le meilleur, Gemini 2.5 Pro (Jun 2025), atteint 44,7 %. Le benchmark est archivé, faute de modèle récent mesuré. Avec 8 modèles mesurés seulement, cet étalonnage reste fragile.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
0 %du score général. SpatialViz-Bench est archivé et ne compte plus : la tâche Vision et multimodal (5 % du score général) repose sur 3 autres benchmarks.
En couleur, la tâche Vision et multimodal dans le score général. SpatialViz-Bench n'y a plus de part.
8 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.