Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

VisionFiche benchmark · Will Patrick · willpatrick.xyz

CadEval

Écrire le code OpenSCAD d'une pièce en 3D décrite en texte, de la plus simple à celle qui enchaîne cinq opérations.

ARCHIVÉ

À quoi il sert

CadEval servait à noter la tâche Vision et multimodal. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.

Comment c'est noté

Part de pièces dont le rendu 3D colle au modèle de référence : volume, dimensions et écart de surface inférieur à 1 mm.

Ce qu'il ne dit pas

Petit jeu de tâches tenu par une seule personne et figé en avril 2025. L'auteur estime qu'environ 5 % des pièces justes sont refusées à tort.

Comment lire le score

15 modèles mesurés

En tête : o3, 74 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 67. Le meilleur, o3, atteint 74 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
26 %
Score IA 76niveau de Claude Sonnet 4.5
66 %
Score IA 100niveau de Claude Opus 5.5
90 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. CadEval est archivé et ne compte plus : la tâche Vision et multimodal (5 % du score général) repose sur 3 autres benchmarks.

En couleur, la tâche Vision et multimodal dans le score général. CadEval n'y a plus de part.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1o3OpenAIMoyenne74 %82,1
2Gemini 2.5 Pro (Mar 2025)Google DeepMindNon précisée64 %75,1
3o4-miniOpenAIMoyenne62 %73,8
4o1OpenAIMoyenne56 %70,1
5Claude 3.7 SonnetAnthropicNon précisée54 %68,9
5o3-miniOpenAIMoyenne54 %68,9
7Claude 3.5 Sonnet (October 2024)AnthropicNon précisée48 %65,3
8GPT-4.1OpenAINon précisée42 %61,7
9Gemini 1.5 Pro (Sept 2024)Google DeepMindNon précisée34 %56,6
10Claude 3.5 HaikuAnthropicNon précisée32 %55,3
15 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 15 →Replier le classement ↑
11Gemini 2.0 Flash (Feb 2025)Google DeepMindNon précisée30 %53,9
12GPT-4o (Aug 2024)OpenAINon précisée26 %50,9
13ml-elephantNon précisée20 %45,9
14GPT-4.1 miniOpenAINon précisée16 %41,8
15Claude 3 HaikuAnthropicNon précisée12 %36,8

En bref

Que mesure CadEval ?
Écrire le code OpenSCAD d'une pièce en 3D décrite en texte, de la plus simple à celle qui enchaîne cinq opérations. Sur Quelle IA, il est rangé dans la tâche Vision et multimodal.
Comment CadEval est-il noté ?
Part de pièces dont le rendu 3D colle au modèle de référence : volume, dimensions et écart de surface inférieur à 1 mm. Un modèle qui obtient 50 % a un score IA d'environ 67.
Qui est en tête sur CadEval ?
o3 (OpenAI) est en tête de CadEval avec 74 %, dans l'édition du 28 septembre 2026. Suivent Gemini 2.5 Pro (Mar 2025) (64 %) et o4-mini (62 %). 15 modèles y sont mesurés.
Quelles sont les limites de CadEval ?
Petit jeu de tâches tenu par une seule personne et figé en avril 2025. L'auteur estime qu'environ 5 % des pièces justes sont refusées à tort. Au 28 septembre 2026, le benchmark est archivé.
Combien pèse CadEval dans le score IA ?
CadEval compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est archivé et ne compte plus : la tâche Vision et multimodal (5 % du score général) repose sur 3 autres benchmarks.
Qui maintient CadEval ?
Will Patrick. Sa page de référence : willpatrick.xyz/technology/2025/04/23/teaching-llms-how-to-solid-model.html.

Les autres benchmarks de la tâche Vision et multimodal

Tous les benchmarks →Comment le score IA est calculé →