À quoi il sert
CadEval servait à noter la tâche Vision et multimodal. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.
VisionFiche benchmark · Will Patrick · willpatrick.xyz
Écrire le code OpenSCAD d'une pièce en 3D décrite en texte, de la plus simple à celle qui enchaîne cinq opérations.
CadEval servait à noter la tâche Vision et multimodal. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.
Part de pièces dont le rendu 3D colle au modèle de référence : volume, dimensions et écart de surface inférieur à 1 mm.
Petit jeu de tâches tenu par une seule personne et figé en avril 2025. L'auteur estime qu'environ 5 % des pièces justes sont refusées à tort.
Will Patrick.
willpatrick.xyz/technology/2025/04/23/teaching-llms-how-to-solid-model.html · tâche Vision · 15 modèles mesurés
En tête : o3, 74 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 67. Le meilleur, o3, atteint 74 %. Le benchmark est archivé, faute de modèle récent mesuré.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
0 %du score général. CadEval est archivé et ne compte plus : la tâche Vision et multimodal (5 % du score général) repose sur 3 autres benchmarks.
En couleur, la tâche Vision et multimodal dans le score général. CadEval n'y a plus de part.