# SpatialViz-Bench

> Fiche du benchmark SpatialViz-Bench sur Quelle IA, édition du 28 septembre 2026. 1 180 questions de visualisation dans l'espace : rotation mentale, pliage, coupe d'objets, mécanismes en mouvement. En tête au 28 septembre 2026 : Gemini 2.5 Pro (Jun 2025) (44,7 %). Notation, limites et classement des 8 modèles mesurés.

Page : https://quelleia.com/benchmarks/spatialviz_bench/
Source du benchmark : https://arxiv.org/abs/2507.07610
Mainteneur : Auteurs de l'article SpatialViz-Bench (2025)
Tâche : Vision et multimodal
État : archivé

## À quoi il sert

SpatialViz-Bench servait à noter la tâche Vision et multimodal. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.

## Comment c'est noté

Part de bonnes réponses à choix multiples ; les humains font environ 82 %.

## Ce qu'il ne dit pas

Huit modèles seulement, recopiés de l'article d'origine de 2025, sans mise à jour depuis.

## Qui le tient

Auteurs de l'article SpatialViz-Bench (2025).

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 48 %. Le meilleur, Gemini 2.5 Pro (Jun 2025), atteint 44,7 %. Le benchmark est archivé, faute de modèle récent mesuré. Avec 8 modèles mesurés seulement, cet étalonnage reste fragile.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 34 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 41 %
- Score IA 100 (niveau de Claude Opus 5.5) : 48 %

## Son poids dans le score IA

0 % du score général. SpatialViz-Bench est archivé et ne compte plus : la tâche Vision et multimodal (5 % du score général) repose sur 3 autres benchmarks.

## Classement (8 modèles mesurés, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [Gemini 2.5 Pro (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-pro-jun-2025.md) | Google DeepMind | non précisée | 44,7 % | 90,0 | https://arxiv.org/abs/2507.07610 |
| 2 | [o1](https://quelleia.com/modeles/o1.md) | OpenAI | non précisée | 41,4 % | 78,7 | https://arxiv.org/abs/2507.07610 |
| 3 | [Gemini 2.5 Flash (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-flash-jun-2025.md) | Google DeepMind | non précisée | 36,9 % | 62,8 | https://arxiv.org/abs/2507.07610 |
| 4 | [Llama 4 Scout](https://quelleia.com/modeles/llama-4-scout.md) | Meta AI | non précisée | 34,2 % | 53,1 | https://arxiv.org/abs/2507.07610 |
| 5 | [Claude 3.7 Sonnet](https://quelleia.com/modeles/claude-3-7-sonnet.md) | Anthropic | non précisée | 33,9 % | 51,9 | https://arxiv.org/abs/2507.07610 |
| 6 | [Qwen2.5-72B](https://quelleia.com/modeles/qwen2-5-72b.md) | Alibaba | non précisée | 33,3 % | 49,6 | https://arxiv.org/abs/2507.07610 |
| 7 | [Qwen-VL-Max](https://quelleia.com/modeles/qwen-vl-max.md) | Alibaba | non précisée | 32 % | 44,7 | https://arxiv.org/abs/2507.07610 |
| 8 | [Llama 4 Maverick](https://quelleia.com/modeles/llama-4-maverick.md) | Meta AI | non précisée | 31,8 % | 43,8 | https://arxiv.org/abs/2507.07610 |

## En bref

**Que mesure SpatialViz-Bench ?** 1 180 questions de visualisation dans l'espace : rotation mentale, pliage, coupe d'objets, mécanismes en mouvement. Sur Quelle IA, il est rangé dans la tâche Vision et multimodal.

**Comment SpatialViz-Bench est-il noté ?** Part de bonnes réponses à choix multiples ; les humains font environ 82 %. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 48 %.

**Qui est en tête sur SpatialViz-Bench ?** Gemini 2.5 Pro (Jun 2025) (Google DeepMind) est en tête de SpatialViz-Bench avec 44,7 %, dans l'édition du 28 septembre 2026. Suivent o1 (41,4 %) et Gemini 2.5 Flash (Jun 2025) (36,9 %). 8 modèles y sont mesurés.

**Quelles sont les limites de SpatialViz-Bench ?** Huit modèles seulement, recopiés de l'article d'origine de 2025, sans mise à jour depuis. Au 28 septembre 2026, le benchmark est archivé.

**Combien pèse SpatialViz-Bench dans le score IA ?** SpatialViz-Bench compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est archivé et ne compte plus : la tâche Vision et multimodal (5 % du score général) repose sur 3 autres benchmarks.

**Qui maintient SpatialViz-Bench ?** Auteurs de l'article SpatialViz-Bench (2025). Sa page de référence : arxiv.org/abs/2507.07610.

## Les autres benchmarks de la tâche Vision et multimodal

- [Arena, vision](https://quelleia.com/benchmarks/arena_vision.md) : 121 modèles · 1,67 % du score
- [Furniture Assembly](https://quelleia.com/benchmarks/furniture_assembly.md) : 28 modèles · 1,67 % du score
- [Blueprint-Bench 2](https://quelleia.com/benchmarks/blueprint_bench_2.md) : 26 modèles · 1,67 % du score
- [Video-MME](https://quelleia.com/benchmarks/videomme.md) : 50 modèles · hors score, archivé
- [VPCT (Visual Physics Comprehension Test)](https://quelleia.com/benchmarks/vpct.md) : 28 modèles · hors score, archivé
- [GeoBench](https://quelleia.com/benchmarks/geobench.md) : 27 modèles · hors score, archivé
- [CadEval](https://quelleia.com/benchmarks/cadeval.md) : 15 modèles · hors score, archivé
- [MindCube](https://quelleia.com/benchmarks/mindcube.md) : 5 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
