# Furniture Assembly

> Fiche du benchmark Furniture Assembly sur Quelle IA, édition du 28 septembre 2026. Regarder la photo d'un meuble IKEA monté et dire, notice à l'appui, si le montage est correct et à quelle étape s'est glissée l'erreur. En tête au 28 septembre 2026 : Claude Opus 5.5 (83,3 %). Notation, limites et classement des 28 modèles mesurés.

Page : https://quelleia.com/benchmarks/furniture_assembly/
Source du benchmark : https://epoch.ai/benchmarks/furniture-assembly
Mainteneur : Epoch AI
Tâche : Vision et multimodal
État : actif

## À quoi il sert

Sur Quelle IA, Furniture Assembly sert à noter la tâche Vision et multimodal : c'est l'un de ses 3 benchmarks. Il départage surtout les modèles dont le score IA approche 97.

## Comment c'est noté

Part de bonnes réponses sur 60 photos de trois meubles ; la description de l'erreur est jugée avec indulgence par un modèle correcteur.

Pour le calcul, ce score est ramené entre 0 et 1 : 30 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

## Ce qu'il ne dit pas

Trois meubles et 60 photos seulement. Répondre au hasard donne déjà environ 30 %, et les modèles sans vision sont exclus.

## Qui le tient

Epoch AI.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 65 % a un score IA d'environ 97. Le meilleur, Claude Opus 5.5, atteint 83,3 %. Le benchmark sera dit saturé quand un modèle atteindra 96,5 %.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 30 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 30 %
- Score IA 100 (niveau de Claude Opus 5.5) : 83 %

## Son poids dans le score IA

1,67 % du score général. Furniture Assembly porte 33 % de la tâche Vision et multimodal (5 % du score général), que se partagent 3 benchmarks.

## Classement (28 modèles mesurés, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [Claude Opus 5.5](https://quelleia.com/modeles/claude-opus-5-5.md) | Anthropic | Maximale | 83,3 % | 100,1 | https://epoch.ai/benchmarks |
| 2 | [GPT-6 Astra](https://quelleia.com/modeles/gpt-6-astra.md) | OpenAI | Maximale | 80 % | 99,3 | https://epoch.ai/benchmarks |
| 3 | [Claude Sonnet 5.5](https://quelleia.com/modeles/claude-sonnet-5-5.md) | Anthropic | Maximale | 75 % | 98,3 | https://epoch.ai/benchmarks |
| 4 | [Claude Fable 5.1](https://quelleia.com/modeles/claude-fable-5-1.md) | Anthropic | Maximale | 70 % | 97,4 | https://epoch.ai/benchmarks |
| 5 | [Claude Opus 5](https://quelleia.com/modeles/claude-opus-5.md) | Anthropic | Maximale | 60,8 % | 95,8 | https://epoch.ai/benchmarks |
| 6 | [GPT-6 Sol](https://quelleia.com/modeles/gpt-6-sol.md) | OpenAI | Maximale | 58,3 % | 95,3 | https://epoch.ai/benchmarks |
| 7 | [GPT-5.6 Sol](https://quelleia.com/modeles/gpt-5-6-sol.md) | OpenAI | Maximale | 56,7 % | 95,0 | https://epoch.ai/benchmarks |
| 8 | [GPT-5.6 Terra](https://quelleia.com/modeles/gpt-5-6-terra.md) | OpenAI | Maximale | 54,2 % | 94,6 | https://epoch.ai/benchmarks |
| 9 | [GPT-5.5](https://quelleia.com/modeles/gpt-5-5.md) | OpenAI | Maximale | 44,2 % | 92,3 | https://epoch.ai/benchmarks |
| 9 | [GPT-6 Luna](https://quelleia.com/modeles/gpt-6-luna.md) | OpenAI | Maximale | 44,2 % | 92,3 | https://epoch.ai/benchmarks |
| 11 | [Claude Opus 4.8](https://quelleia.com/modeles/claude-opus-4-8.md) | Anthropic | Maximale | 42,5 % | 91,8 | https://epoch.ai/benchmarks |
| 11 | [GPT-5.6 Luna](https://quelleia.com/modeles/gpt-5-6-luna.md) | OpenAI | Maximale | 42,5 % | 91,8 | https://epoch.ai/benchmarks |
| 13 | [Grok 4.6](https://quelleia.com/modeles/grok-4-6.md) | xAI | Maximale | 40 % | 91,0 | https://epoch.ai/benchmarks |
| 14 | [GPT-5.2](https://quelleia.com/modeles/gpt-5-2.md) | OpenAI | Maximale | 38,3 % | 90,4 | https://epoch.ai/benchmarks |
| 15 | [GPT-5.4](https://quelleia.com/modeles/gpt-5-4.md) | OpenAI | Maximale | 37,5 % | 90,0 | https://epoch.ai/benchmarks |
| 16 | [Claude Fable 5](https://quelleia.com/modeles/claude-fable-5.md) | Anthropic | Maximale | 35,8 % | 89,1 | https://epoch.ai/benchmarks |
| 17 | [Kimi K3](https://quelleia.com/modeles/kimi-k3.md) | Moonshot | Maximale | 34,2 % | 88,0 | https://epoch.ai/benchmarks |
| 18 | [Claude Opus 4.7](https://quelleia.com/modeles/claude-opus-4-7.md) | Anthropic | Maximale | 33,3 % | 87,3 | https://epoch.ai/benchmarks |
| 19 | [Gemini 3.8 Flash](https://quelleia.com/modeles/gemini-3-8-flash.md) | Google DeepMind | Élevée | 31,7 % | 85,1 | https://epoch.ai/benchmarks |
| 20 | [Claude Opus 4.6](https://quelleia.com/modeles/claude-opus-4-6.md) | Anthropic | Maximale | 28,3 % | 82,4 | https://epoch.ai/benchmarks |
| 20 | [Claude Opus 4.5](https://quelleia.com/modeles/claude-opus-4-5.md) | Anthropic | Budget | 28,3 % | 82,4 | https://epoch.ai/benchmarks |
| 22 | [Gemini 3.7 Flash](https://quelleia.com/modeles/gemini-3-7-flash.md) | Google DeepMind | Élevée | 26,7 % | 82,4 | https://epoch.ai/benchmarks |
| 22 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | Élevée | 26,7 % | 82,4 | https://epoch.ai/benchmarks |
| 24 | [Gemini 3.6 Flash](https://quelleia.com/modeles/gemini-3-6-flash.md) | Google DeepMind | Élevée | 23,3 % | 82,4 | https://epoch.ai/benchmarks |
| 25 | [Grok 4.5](https://quelleia.com/modeles/grok-4-5.md) | xAI | Élevée | 22,5 % | 82,4 | https://epoch.ai/benchmarks |
| 26 | [Kimi K2.6](https://quelleia.com/modeles/kimi-k2-6.md) | Moonshot | non précisée | 21,7 % | 82,4 | https://epoch.ai/benchmarks |
| 27 | [Grok 4.7](https://quelleia.com/modeles/grok-4-7.md) | xAI | Maximale | 20,8 % | 82,4 | https://epoch.ai/benchmarks |
| 28 | [Qwen3.8 Max (0902)](https://quelleia.com/modeles/qwen3-8-max-0902.md) | Alibaba | Maximale | 20 % | 82,4 | https://epoch.ai/benchmarks |

## En bref

**Que mesure Furniture Assembly ?** Regarder la photo d'un meuble IKEA monté et dire, notice à l'appui, si le montage est correct et à quelle étape s'est glissée l'erreur. Sur Quelle IA, il est rangé dans la tâche Vision et multimodal.

**Comment Furniture Assembly est-il noté ?** Part de bonnes réponses sur 60 photos de trois meubles ; la description de l'erreur est jugée avec indulgence par un modèle correcteur. Un modèle qui obtient 65 % a un score IA d'environ 97.

**Qui est en tête sur Furniture Assembly ?** Claude Opus 5.5 (Anthropic) est en tête de Furniture Assembly avec 83,3 %, dans l'édition du 28 septembre 2026. Suivent GPT-6 Astra (80 %) et Claude Sonnet 5.5 (75 %). 28 modèles y sont mesurés.

**Quelles sont les limites de Furniture Assembly ?** Trois meubles et 60 photos seulement. Répondre au hasard donne déjà environ 30 %, et les modèles sans vision sont exclus. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse Furniture Assembly dans le score IA ?** Furniture Assembly compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 33 % de la tâche Vision et multimodal (5 % du score général), que se partagent 3 benchmarks.

**Qui maintient Furniture Assembly ?** Epoch AI. Sa page de référence : epoch.ai/benchmarks/furniture-assembly.

## Les autres benchmarks de la tâche Vision et multimodal

- [Arena, vision](https://quelleia.com/benchmarks/arena_vision.md) : 121 modèles · 1,67 % du score
- [Blueprint-Bench 2](https://quelleia.com/benchmarks/blueprint_bench_2.md) : 26 modèles · 1,67 % du score
- [Video-MME](https://quelleia.com/benchmarks/videomme.md) : 50 modèles · hors score, archivé
- [VPCT (Visual Physics Comprehension Test)](https://quelleia.com/benchmarks/vpct.md) : 28 modèles · hors score, archivé
- [GeoBench](https://quelleia.com/benchmarks/geobench.md) : 27 modèles · hors score, archivé
- [CadEval](https://quelleia.com/benchmarks/cadeval.md) : 15 modèles · hors score, archivé
- [SpatialViz-Bench](https://quelleia.com/benchmarks/spatialviz_bench.md) : 8 modèles · hors score, archivé
- [MindCube](https://quelleia.com/benchmarks/mindcube.md) : 5 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
