À quoi il sert
Sur Quelle IA, Furniture Assembly sert à noter la tâche Vision et multimodal : c'est l'un de ses 3 benchmarks. Il départage surtout les modèles dont le score IA approche 97.
Sur Quelle IA, Furniture Assembly sert à noter la tâche Vision et multimodal : c'est l'un de ses 3 benchmarks. Il départage surtout les modèles dont le score IA approche 97.
Part de bonnes réponses sur 60 photos de trois meubles ; la description de l'erreur est jugée avec indulgence par un modèle correcteur.
Pour le calcul, ce score est ramené entre 0 et 1 : 30 %, le niveau du hasard, vaut 0 et 100 % vaut 1.
Trois meubles et 60 photos seulement. Répondre au hasard donne déjà environ 30 %, et les modèles sans vision sont exclus.
Epoch AI.
epoch.ai/benchmarks/furniture-assembly · tâche Vision · 28 modèles mesurés
En tête : Claude Opus 5.5, 83,3 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 65 % a un score IA d'environ 97. Le meilleur, Claude Opus 5.5, atteint 83,3 %. Le benchmark sera dit saturé quand un modèle atteindra 96,5 %.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
1,67 %du score général. Furniture Assembly porte 33 % de la tâche Vision et multimodal (5 % du score général), que se partagent 3 benchmarks.
En couleur, la tâche Vision et multimodal dans le score général. En noir, la part de Furniture Assembly.