Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

VisionFiche benchmark · Auteurs de l'article SpatialViz-Bench (2025) · arxiv.org

SpatialViz-Bench

1 180 questions de visualisation dans l'espace : rotation mentale, pliage, coupe d'objets, mécanismes en mouvement.

ARCHIVÉ

À quoi il sert

SpatialViz-Bench servait à noter la tâche Vision et multimodal. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.

Comment c'est noté

Part de bonnes réponses à choix multiples ; les humains font environ 82 %.

Ce qu'il ne dit pas

Huit modèles seulement, recopiés de l'article d'origine de 2025, sans mise à jour depuis.

Comment lire le score

8 modèles mesurés

En tête : Gemini 2.5 Pro (Jun 2025), 44,7 %

Chaque trait est un modèle, placé à son meilleur score. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 48 %. Le meilleur, Gemini 2.5 Pro (Jun 2025), atteint 44,7 %. Le benchmark est archivé, faute de modèle récent mesuré. Avec 8 modèles mesurés seulement, cet étalonnage reste fragile.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
34 %
Score IA 76niveau de Claude Sonnet 4.5
41 %
Score IA 100niveau de Claude Opus 5.5
48 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. SpatialViz-Bench est archivé et ne compte plus : la tâche Vision et multimodal (5 % du score général) repose sur 3 autres benchmarks.

En couleur, la tâche Vision et multimodal dans le score général. SpatialViz-Bench n'y a plus de part.

Le classement du benchmark

Scores relevés sur arxiv.org · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Gemini 2.5 Pro (Jun 2025)Google DeepMindNon précisée44,7 %90,0
2o1OpenAINon précisée41,4 %78,7
3Gemini 2.5 Flash (Jun 2025)Google DeepMindNon précisée36,9 %62,8
4Llama 4 ScoutMeta AI · poids ouvertsNon précisée34,2 %53,1
5Claude 3.7 SonnetAnthropicNon précisée33,9 %51,9
6Qwen2.5-72BAlibaba · poids ouvertsNon précisée33,3 %49,6
7Qwen-VL-MaxAlibabaNon précisée32 %44,7
8Llama 4 MaverickMeta AI · poids ouvertsNon précisée31,8 %43,8

8 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

En bref

Que mesure SpatialViz-Bench ?
1 180 questions de visualisation dans l'espace : rotation mentale, pliage, coupe d'objets, mécanismes en mouvement. Sur Quelle IA, il est rangé dans la tâche Vision et multimodal.
Comment SpatialViz-Bench est-il noté ?
Part de bonnes réponses à choix multiples ; les humains font environ 82 %. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 48 %.
Qui est en tête sur SpatialViz-Bench ?
Gemini 2.5 Pro (Jun 2025) (Google DeepMind) est en tête de SpatialViz-Bench avec 44,7 %, dans l'édition du 28 septembre 2026. Suivent o1 (41,4 %) et Gemini 2.5 Flash (Jun 2025) (36,9 %). 8 modèles y sont mesurés.
Quelles sont les limites de SpatialViz-Bench ?
Huit modèles seulement, recopiés de l'article d'origine de 2025, sans mise à jour depuis. Au 28 septembre 2026, le benchmark est archivé.
Combien pèse SpatialViz-Bench dans le score IA ?
SpatialViz-Bench compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est archivé et ne compte plus : la tâche Vision et multimodal (5 % du score général) repose sur 3 autres benchmarks.
Qui maintient SpatialViz-Bench ?
Auteurs de l'article SpatialViz-Bench (2025). Sa page de référence : arxiv.org/abs/2507.07610.

Les autres benchmarks de la tâche Vision et multimodal

Tous les benchmarks →Comment le score IA est calculé →