# Blueprint-Bench 2

> Fiche du benchmark Blueprint-Bench 2 sur Quelle IA, édition du 28 septembre 2026. Dessiner le plan en 2D d'un appartement à partir d'une vingtaine de photos : pièces, portes, tailles relatives. En tête au 28 septembre 2026 : GPT-6 Astra (49,7 %). Notation, limites et classement des 26 modèles mesurés.

Page : https://quelleia.com/benchmarks/blueprint_bench_2/
Source du benchmark : https://andonlabs.com/evals/blueprint-bench-2
Mainteneur : Andon Labs
Tâche : Vision et multimodal
État : actif

## À quoi il sert

Sur Quelle IA, Blueprint-Bench 2 sert à noter la tâche Vision et multimodal : c'est l'un de ses 3 benchmarks. Il départage surtout les modèles dont le score IA approche 99.

## Comment c'est noté

Ressemblance entre le plan produit et le vrai, ramenée de 0 (hasard) à 1 (plan parfait) ; calcul automatique, sans IA correctrice.

## Ce qu'il ne dit pas

Une cinquantaine d'appartements seulement. Les humains testés obtiennent environ 0,59 et le meilleur modèle 0,50.

## Qui le tient

Andon Labs.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 99. Le meilleur, GPT-6 Astra, atteint 49,7 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : moins de 1 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 7 %
- Score IA 100 (niveau de Claude Opus 5.5) : 52 %

## Son poids dans le score IA

1,67 % du score général. Blueprint-Bench 2 porte 33 % de la tâche Vision et multimodal (5 % du score général), que se partagent 3 benchmarks.

## Classement (26 modèles mesurés, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [GPT-6 Astra](https://quelleia.com/modeles/gpt-6-astra.md) | OpenAI | non précisée | 49,7 % | 99,0 | https://andonlabs.com/evals/blueprint-bench-2 |
| 2 | [Claude Fable 5.1](https://quelleia.com/modeles/claude-fable-5-1.md) | Anthropic | non précisée | 41,9 % | 96,2 | https://andonlabs.com/evals/blueprint-bench-2 |
| 3 | [Claude Fable 5](https://quelleia.com/modeles/claude-fable-5.md) | Anthropic | non précisée | 38,6 % | 95,0 | https://andonlabs.com/evals/blueprint-bench-2 |
| 3 | [Gemini 3.8 Flash](https://quelleia.com/modeles/gemini-3-8-flash.md) | Google DeepMind | non précisée | 38,6 % | 95,0 | https://andonlabs.com/evals/blueprint-bench-2 |
| 5 | [GPT-5.5](https://quelleia.com/modeles/gpt-5-5.md) | OpenAI | non précisée | 36,2 % | 94,1 | https://andonlabs.com/evals/blueprint-bench-2 |
| 6 | [GPT-5.6 Sol](https://quelleia.com/modeles/gpt-5-6-sol.md) | OpenAI | non précisée | 33,6 % | 93,1 | https://andonlabs.com/evals/blueprint-bench-2 |
| 6 | [Gemini 3.5 Flash](https://quelleia.com/modeles/gemini-3-5-flash.md) | Google DeepMind | non précisée | 33,6 % | 93,1 | https://andonlabs.com/evals/blueprint-bench-2 |
| 8 | [Grok 4.6](https://quelleia.com/modeles/grok-4-6.md) | xAI | non précisée | 33,2 % | 92,9 | https://andonlabs.com/evals/blueprint-bench-2 |
| 9 | [Gemini 3.6 Flash](https://quelleia.com/modeles/gemini-3-6-flash.md) | Google DeepMind | non précisée | 31,2 % | 92,1 | https://andonlabs.com/evals/blueprint-bench-2 |
| 10 | [GPT-5.6 Terra](https://quelleia.com/modeles/gpt-5-6-terra.md) | OpenAI | non précisée | 30,8 % | 92,0 | https://andonlabs.com/evals/blueprint-bench-2 |
| 11 | [Claude Opus 5](https://quelleia.com/modeles/claude-opus-5.md) | Anthropic | non précisée | 30,4 % | 91,8 | https://andonlabs.com/evals/blueprint-bench-2 |
| 12 | [Kimi K3](https://quelleia.com/modeles/kimi-k3.md) | Moonshot | non précisée | 29,5 % | 91,4 | https://andonlabs.com/evals/blueprint-bench-2 |
| 13 | [Grok 4.5](https://quelleia.com/modeles/grok-4-5.md) | xAI | non précisée | 27,3 % | 90,5 | https://andonlabs.com/evals/blueprint-bench-2 |
| 14 | [GPT-5.4](https://quelleia.com/modeles/gpt-5-4.md) | OpenAI | non précisée | 27,1 % | 90,4 | https://andonlabs.com/evals/blueprint-bench-2 |
| 15 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | non précisée | 26,5 % | 90,1 | https://andonlabs.com/evals/blueprint-bench-2 |
| 16 | [Claude Sonnet 5](https://quelleia.com/modeles/claude-sonnet-5.md) | Anthropic | non précisée | 24,9 % | 89,4 | https://andonlabs.com/evals/blueprint-bench-2 |
| 17 | [Claude Opus 4.7](https://quelleia.com/modeles/claude-opus-4-7.md) | Anthropic | non précisée | 24,5 % | 89,2 | https://andonlabs.com/evals/blueprint-bench-2 |
| 18 | [GPT-5.6 Luna](https://quelleia.com/modeles/gpt-5-6-luna.md) | OpenAI | non précisée | 22,6 % | 88,2 | https://andonlabs.com/evals/blueprint-bench-2 |
| 19 | [Claude Opus 4.8](https://quelleia.com/modeles/claude-opus-4-8.md) | Anthropic | non précisée | 14,5 % | 83,5 | https://andonlabs.com/evals/blueprint-bench-2 |
| 20 | [Claude Sonnet 4.6](https://quelleia.com/modeles/claude-sonnet-4-6.md) | Anthropic | non précisée | 6,7 % | 75,9 | https://andonlabs.com/evals/blueprint-bench-2 |
| 21 | [Kimi K2.6](https://quelleia.com/modeles/kimi-k2-6.md) | Moonshot | non précisée | 3,9 % | 70,8 | https://andonlabs.com/evals/blueprint-bench-2 |
| 22 | [Grok 4.20](https://quelleia.com/modeles/grok-4-20.md) | xAI | non précisée | 0 % | 58,5 | https://andonlabs.com/evals/blueprint-bench-2 |
| 22 | [Gemini 3 Flash](https://quelleia.com/modeles/gemini-3-flash.md) | Google DeepMind | non précisée | 0 % | 58,5 | https://andonlabs.com/evals/blueprint-bench-2 |
| 22 | [Grok 4.3 Beta](https://quelleia.com/modeles/grok-4-3-beta.md) | xAI | non précisée | 0 % | 58,5 | https://andonlabs.com/evals/blueprint-bench-2 |
| 22 | [Claude Haiku 4.5](https://quelleia.com/modeles/claude-haiku-4-5.md) | Anthropic | non précisée | 0 % | 58,5 | https://andonlabs.com/evals/blueprint-bench-2 |
| 22 | [Gemini Robotics-ER 1.6](https://quelleia.com/modeles/gemini-robotics-er-1-6.md) | Google DeepMind | non précisée | 0 % | 58,5 | https://andonlabs.com/evals/blueprint-bench-2 |

## En bref

**Que mesure Blueprint-Bench 2 ?** Dessiner le plan en 2D d'un appartement à partir d'une vingtaine de photos : pièces, portes, tailles relatives. Sur Quelle IA, il est rangé dans la tâche Vision et multimodal.

**Comment Blueprint-Bench 2 est-il noté ?** Ressemblance entre le plan produit et le vrai, ramenée de 0 (hasard) à 1 (plan parfait) ; calcul automatique, sans IA correctrice. Un modèle qui obtient 50 % a un score IA d'environ 99.

**Qui est en tête sur Blueprint-Bench 2 ?** GPT-6 Astra (OpenAI) est en tête de Blueprint-Bench 2 avec 49,7 %, dans l'édition du 28 septembre 2026. Suivent Claude Fable 5.1 (41,9 %) et Claude Fable 5 (38,6 %). 26 modèles y sont mesurés.

**Quelles sont les limites de Blueprint-Bench 2 ?** Une cinquantaine d'appartements seulement. Les humains testés obtiennent environ 0,59 et le meilleur modèle 0,50. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse Blueprint-Bench 2 dans le score IA ?** Blueprint-Bench 2 compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 33 % de la tâche Vision et multimodal (5 % du score général), que se partagent 3 benchmarks.

**Qui maintient Blueprint-Bench 2 ?** Andon Labs. Sa page de référence : andonlabs.com/evals/blueprint-bench-2.

## Les autres benchmarks de la tâche Vision et multimodal

- [Arena, vision](https://quelleia.com/benchmarks/arena_vision.md) : 121 modèles · 1,67 % du score
- [Furniture Assembly](https://quelleia.com/benchmarks/furniture_assembly.md) : 28 modèles · 1,67 % du score
- [Video-MME](https://quelleia.com/benchmarks/videomme.md) : 50 modèles · hors score, archivé
- [VPCT (Visual Physics Comprehension Test)](https://quelleia.com/benchmarks/vpct.md) : 28 modèles · hors score, archivé
- [GeoBench](https://quelleia.com/benchmarks/geobench.md) : 27 modèles · hors score, archivé
- [CadEval](https://quelleia.com/benchmarks/cadeval.md) : 15 modèles · hors score, archivé
- [SpatialViz-Bench](https://quelleia.com/benchmarks/spatialviz_bench.md) : 8 modèles · hors score, archivé
- [MindCube](https://quelleia.com/benchmarks/mindcube.md) : 5 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
