# CadEval

> Fiche du benchmark CadEval sur Quelle IA, édition du 28 septembre 2026. Écrire le code OpenSCAD d'une pièce en 3D décrite en texte, de la plus simple à celle qui enchaîne cinq opérations. En tête au 28 septembre 2026 : o3 (74 %). Notation, limites et classement des 15 modèles mesurés.

Page : https://quelleia.com/benchmarks/cadeval/
Source du benchmark : https://willpatrick.xyz/technology/2025/04/23/teaching-llms-how-to-solid-model.html
Mainteneur : Will Patrick
Tâche : Vision et multimodal
État : archivé

## À quoi il sert

CadEval servait à noter la tâche Vision et multimodal. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.

## Comment c'est noté

Part de pièces dont le rendu 3D colle au modèle de référence : volume, dimensions et écart de surface inférieur à 1 mm.

## Ce qu'il ne dit pas

Petit jeu de tâches tenu par une seule personne et figé en avril 2025. L'auteur estime qu'environ 5 % des pièces justes sont refusées à tort.

## Qui le tient

Will Patrick.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 67. Le meilleur, o3, atteint 74 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 26 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 66 %
- Score IA 100 (niveau de Claude Opus 5.5) : 90 %

## Son poids dans le score IA

0 % du score général. CadEval est archivé et ne compte plus : la tâche Vision et multimodal (5 % du score général) repose sur 3 autres benchmarks.

## Classement (15 modèles mesurés, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [o3](https://quelleia.com/modeles/o3.md) | OpenAI | Moyenne | 74 % | 82,1 | https://epoch.ai/benchmarks |
| 2 | [Gemini 2.5 Pro (Mar 2025)](https://quelleia.com/modeles/gemini-2-5-pro-mar-2025.md) | Google DeepMind | non précisée | 64 % | 75,1 | https://epoch.ai/benchmarks |
| 3 | [o4-mini](https://quelleia.com/modeles/o4-mini.md) | OpenAI | Moyenne | 62 % | 73,8 | https://epoch.ai/benchmarks |
| 4 | [o1](https://quelleia.com/modeles/o1.md) | OpenAI | Moyenne | 56 % | 70,1 | https://epoch.ai/benchmarks |
| 5 | [Claude 3.7 Sonnet](https://quelleia.com/modeles/claude-3-7-sonnet.md) | Anthropic | non précisée | 54 % | 68,9 | https://epoch.ai/benchmarks |
| 5 | [o3-mini](https://quelleia.com/modeles/o3-mini.md) | OpenAI | Moyenne | 54 % | 68,9 | https://epoch.ai/benchmarks |
| 7 | [Claude 3.5 Sonnet (October 2024)](https://quelleia.com/modeles/claude-3-5-sonnet-october-2024.md) | Anthropic | non précisée | 48 % | 65,3 | https://epoch.ai/benchmarks |
| 8 | [GPT-4.1](https://quelleia.com/modeles/gpt-4-1.md) | OpenAI | non précisée | 42 % | 61,7 | https://epoch.ai/benchmarks |
| 9 | [Gemini 1.5 Pro (Sept 2024)](https://quelleia.com/modeles/gemini-1-5-pro-sept-2024.md) | Google DeepMind | non précisée | 34 % | 56,6 | https://epoch.ai/benchmarks |
| 10 | [Claude 3.5 Haiku](https://quelleia.com/modeles/claude-3-5-haiku.md) | Anthropic | non précisée | 32 % | 55,3 | https://epoch.ai/benchmarks |
| 11 | [Gemini 2.0 Flash (Feb 2025)](https://quelleia.com/modeles/gemini-2-0-flash-feb-2025.md) | Google DeepMind | non précisée | 30 % | 53,9 | https://epoch.ai/benchmarks |
| 12 | [GPT-4o (Aug 2024)](https://quelleia.com/modeles/gpt-4o-aug-2024.md) | OpenAI | non précisée | 26 % | 50,9 | https://epoch.ai/benchmarks |
| 13 | [ml-elephant](https://quelleia.com/modeles/ml-elephant.md) |  | non précisée | 20 % | 45,9 | https://epoch.ai/benchmarks |
| 14 | [GPT-4.1 mini](https://quelleia.com/modeles/gpt-4-1-mini.md) | OpenAI | non précisée | 16 % | 41,8 | https://epoch.ai/benchmarks |
| 15 | [Claude 3 Haiku](https://quelleia.com/modeles/claude-3-haiku.md) | Anthropic | non précisée | 12 % | 36,8 | https://epoch.ai/benchmarks |

## En bref

**Que mesure CadEval ?** Écrire le code OpenSCAD d'une pièce en 3D décrite en texte, de la plus simple à celle qui enchaîne cinq opérations. Sur Quelle IA, il est rangé dans la tâche Vision et multimodal.

**Comment CadEval est-il noté ?** Part de pièces dont le rendu 3D colle au modèle de référence : volume, dimensions et écart de surface inférieur à 1 mm. Un modèle qui obtient 50 % a un score IA d'environ 67.

**Qui est en tête sur CadEval ?** o3 (OpenAI) est en tête de CadEval avec 74 %, dans l'édition du 28 septembre 2026. Suivent Gemini 2.5 Pro (Mar 2025) (64 %) et o4-mini (62 %). 15 modèles y sont mesurés.

**Quelles sont les limites de CadEval ?** Petit jeu de tâches tenu par une seule personne et figé en avril 2025. L'auteur estime qu'environ 5 % des pièces justes sont refusées à tort. Au 28 septembre 2026, le benchmark est archivé.

**Combien pèse CadEval dans le score IA ?** CadEval compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est archivé et ne compte plus : la tâche Vision et multimodal (5 % du score général) repose sur 3 autres benchmarks.

**Qui maintient CadEval ?** Will Patrick. Sa page de référence : willpatrick.xyz/technology/2025/04/23/teaching-llms-how-to-solid-model.html.

## Les autres benchmarks de la tâche Vision et multimodal

- [Arena, vision](https://quelleia.com/benchmarks/arena_vision.md) : 121 modèles · 1,67 % du score
- [Furniture Assembly](https://quelleia.com/benchmarks/furniture_assembly.md) : 28 modèles · 1,67 % du score
- [Blueprint-Bench 2](https://quelleia.com/benchmarks/blueprint_bench_2.md) : 26 modèles · 1,67 % du score
- [Video-MME](https://quelleia.com/benchmarks/videomme.md) : 50 modèles · hors score, archivé
- [VPCT (Visual Physics Comprehension Test)](https://quelleia.com/benchmarks/vpct.md) : 28 modèles · hors score, archivé
- [GeoBench](https://quelleia.com/benchmarks/geobench.md) : 27 modèles · hors score, archivé
- [SpatialViz-Bench](https://quelleia.com/benchmarks/spatialviz_bench.md) : 8 modèles · hors score, archivé
- [MindCube](https://quelleia.com/benchmarks/mindcube.md) : 5 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
