Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

VisionFiche benchmark · Epoch AI · epoch.ai

Furniture Assembly

Regarder la photo d'un meuble IKEA monté et dire, notice à l'appui, si le montage est correct et à quelle étape s'est glissée l'erreur.

À quoi il sert

Sur Quelle IA, Furniture Assembly sert à noter la tâche Vision et multimodal : c'est l'un de ses 3 benchmarks. Il départage surtout les modèles dont le score IA approche 97.

Comment c'est noté

Part de bonnes réponses sur 60 photos de trois meubles ; la description de l'erreur est jugée avec indulgence par un modèle correcteur.

Pour le calcul, ce score est ramené entre 0 et 1 : 30 %, le niveau du hasard, vaut 0 et 100 % vaut 1.

Ce qu'il ne dit pas

Trois meubles et 60 photos seulement. Répondre au hasard donne déjà environ 30 %, et les modèles sans vision sont exclus.

Comment lire le score

28 modèles mesurés

En tête : Claude Opus 5.5, 83,3 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 65 % a un score IA d'environ 97. Le meilleur, Claude Opus 5.5, atteint 83,3 %. Le benchmark sera dit saturé quand un modèle atteindra 96,5 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
30 %
Score IA 76niveau de Claude Sonnet 4.5
30 %
Score IA 100niveau de Claude Opus 5.5
83 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,67 %du score général. Furniture Assembly porte 33 % de la tâche Vision et multimodal (5 % du score général), que se partagent 3 benchmarks.

En couleur, la tâche Vision et multimodal dans le score général. En noir, la part de Furniture Assembly.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Claude Opus 5.5AnthropicMaximale83,3 %100,1
2GPT-6 AstraOpenAIMaximale80 %99,3
3Claude Sonnet 5.5AnthropicMaximale75 %98,3
4Claude Fable 5.1AnthropicMaximale70 %97,4
5Claude Opus 5AnthropicMaximale60,8 %95,8
6GPT-6 SolOpenAIMaximale58,3 %95,3
7GPT-5.6 SolOpenAIMaximale56,7 %95,0
8GPT-5.6 TerraOpenAIMaximale54,2 %94,6
9GPT-5.5OpenAIMaximale44,2 %92,3
9GPT-6 LunaOpenAIMaximale44,2 %92,3
28 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 28 →Replier le classement ↑
11Claude Opus 4.8AnthropicMaximale42,5 %91,8
11GPT-5.6 LunaOpenAIMaximale42,5 %91,8
13Grok 4.6xAIMaximale40 %91,0
14GPT-5.2OpenAIMaximale38,3 %90,4
15GPT-5.4OpenAIMaximale37,5 %90,0
16Claude Fable 5AnthropicMaximale35,8 %89,1
17Kimi K3Moonshot · poids ouvertsMaximale34,2 %88,0
18Claude Opus 4.7AnthropicMaximale33,3 %87,3
19Gemini 3.8 FlashGoogle DeepMindÉlevée31,7 %85,1
20Claude Opus 4.6AnthropicMaximale28,3 %82,4
20Claude Opus 4.5AnthropicBudget28,3 %82,4
22Gemini 3.7 FlashGoogle DeepMindÉlevée26,7 %82,4
22Gemini 3.1 ProGoogle DeepMindÉlevée26,7 %82,4
24Gemini 3.6 FlashGoogle DeepMindÉlevée23,3 %82,4
25Grok 4.5xAIÉlevée22,5 %82,4
26Kimi K2.6Moonshot · poids ouvertsNon précisée21,7 %82,4
27Grok 4.7xAIMaximale20,8 %82,4
28Qwen3.8 Max (0902)AlibabaMaximale20 %82,4

En bref

Que mesure Furniture Assembly ?
Regarder la photo d'un meuble IKEA monté et dire, notice à l'appui, si le montage est correct et à quelle étape s'est glissée l'erreur. Sur Quelle IA, il est rangé dans la tâche Vision et multimodal.
Comment Furniture Assembly est-il noté ?
Part de bonnes réponses sur 60 photos de trois meubles ; la description de l'erreur est jugée avec indulgence par un modèle correcteur. Un modèle qui obtient 65 % a un score IA d'environ 97.
Qui est en tête sur Furniture Assembly ?
Claude Opus 5.5 (Anthropic) est en tête de Furniture Assembly avec 83,3 %, dans l'édition du 28 septembre 2026. Suivent GPT-6 Astra (80 %) et Claude Sonnet 5.5 (75 %). 28 modèles y sont mesurés.
Quelles sont les limites de Furniture Assembly ?
Trois meubles et 60 photos seulement. Répondre au hasard donne déjà environ 30 %, et les modèles sans vision sont exclus. Au 28 septembre 2026, le benchmark est actif.
Combien pèse Furniture Assembly dans le score IA ?
Furniture Assembly compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 33 % de la tâche Vision et multimodal (5 % du score général), que se partagent 3 benchmarks.
Qui maintient Furniture Assembly ?
Epoch AI. Sa page de référence : epoch.ai/benchmarks/furniture-assembly.

Les autres benchmarks de la tâche Vision et multimodal

Tous les benchmarks →Comment le score IA est calculé →