Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

VisionFiche benchmark · Andon Labs · andonlabs.com

Blueprint-Bench 2

Dessiner le plan en 2D d'un appartement à partir d'une vingtaine de photos : pièces, portes, tailles relatives.

À quoi il sert

Sur Quelle IA, Blueprint-Bench 2 sert à noter la tâche Vision et multimodal : c'est l'un de ses 3 benchmarks. Il départage surtout les modèles dont le score IA approche 99.

Comment c'est noté

Ressemblance entre le plan produit et le vrai, ramenée de 0 (hasard) à 1 (plan parfait) ; calcul automatique, sans IA correctrice.

Ce qu'il ne dit pas

Une cinquantaine d'appartements seulement. Les humains testés obtiennent environ 0,59 et le meilleur modèle 0,50.

Comment lire le score

26 modèles mesurés

En tête : GPT-6 Astra, 49,7 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 99. Le meilleur, GPT-6 Astra, atteint 49,7 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
moins de 1 %
Score IA 76niveau de Claude Sonnet 4.5
7 %
Score IA 100niveau de Claude Opus 5.5
52 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,67 %du score général. Blueprint-Bench 2 porte 33 % de la tâche Vision et multimodal (5 % du score général), que se partagent 3 benchmarks.

En couleur, la tâche Vision et multimodal dans le score général. En noir, la part de Blueprint-Bench 2.

Le classement du benchmark

Scores relevés sur andonlabs.com · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-6 AstraOpenAINon précisée49,7 %99,0
2Claude Fable 5.1AnthropicNon précisée41,9 %96,2
3Claude Fable 5AnthropicNon précisée38,6 %95,0
3Gemini 3.8 FlashGoogle DeepMindNon précisée38,6 %95,0
5GPT-5.5OpenAINon précisée36,2 %94,1
6GPT-5.6 SolOpenAINon précisée33,6 %93,1
6Gemini 3.5 FlashGoogle DeepMindNon précisée33,6 %93,1
8Grok 4.6xAINon précisée33,2 %92,9
9Gemini 3.6 FlashGoogle DeepMindNon précisée31,2 %92,1
10GPT-5.6 TerraOpenAINon précisée30,8 %92,0
26 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 26 →Replier le classement ↑
11Claude Opus 5AnthropicNon précisée30,4 %91,8
12Kimi K3Moonshot · poids ouvertsNon précisée29,5 %91,4
13Grok 4.5xAINon précisée27,3 %90,5
14GPT-5.4OpenAINon précisée27,1 %90,4
15Gemini 3.1 ProGoogle DeepMindNon précisée26,5 %90,1
16Claude Sonnet 5AnthropicNon précisée24,9 %89,4
17Claude Opus 4.7AnthropicNon précisée24,5 %89,2
18GPT-5.6 LunaOpenAINon précisée22,6 %88,2
19Claude Opus 4.8AnthropicNon précisée14,5 %83,5
20Claude Sonnet 4.6AnthropicNon précisée6,7 %75,9
21Kimi K2.6Moonshot · poids ouvertsNon précisée3,9 %70,8
22Grok 4.20xAINon précisée0 %58,5
22Gemini 3 FlashGoogle DeepMindNon précisée0 %58,5
22Grok 4.3 BetaxAINon précisée0 %58,5
22Claude Haiku 4.5AnthropicNon précisée0 %58,5
22Gemini Robotics-ER 1.6Google DeepMindNon précisée0 %58,5

En bref

Que mesure Blueprint-Bench 2 ?
Dessiner le plan en 2D d'un appartement à partir d'une vingtaine de photos : pièces, portes, tailles relatives. Sur Quelle IA, il est rangé dans la tâche Vision et multimodal.
Comment Blueprint-Bench 2 est-il noté ?
Ressemblance entre le plan produit et le vrai, ramenée de 0 (hasard) à 1 (plan parfait) ; calcul automatique, sans IA correctrice. Un modèle qui obtient 50 % a un score IA d'environ 99.
Qui est en tête sur Blueprint-Bench 2 ?
GPT-6 Astra (OpenAI) est en tête de Blueprint-Bench 2 avec 49,7 %, dans l'édition du 28 septembre 2026. Suivent Claude Fable 5.1 (41,9 %) et Claude Fable 5 (38,6 %). 26 modèles y sont mesurés.
Quelles sont les limites de Blueprint-Bench 2 ?
Une cinquantaine d'appartements seulement. Les humains testés obtiennent environ 0,59 et le meilleur modèle 0,50. Au 28 septembre 2026, le benchmark est actif.
Combien pèse Blueprint-Bench 2 dans le score IA ?
Blueprint-Bench 2 compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 33 % de la tâche Vision et multimodal (5 % du score général), que se partagent 3 benchmarks.
Qui maintient Blueprint-Bench 2 ?
Andon Labs. Sa page de référence : andonlabs.com/evals/blueprint-bench-2.

Les autres benchmarks de la tâche Vision et multimodal

Tous les benchmarks →Comment le score IA est calculé →