# CursorBench

> Fiche du benchmark CursorBench sur Quelle IA, édition du 28 septembre 2026. Des tâches tirées de vraies sessions de l'éditeur Cursor : comprendre un dépôt, trouver un bug, modifier plusieurs fichiers, relire du code. En tête au 28 septembre 2026 : Claude Opus 5.5 (57,8 %). Notation, limites et classement des 13 modèles mesurés.

Page : https://quelleia.com/benchmarks/cursorbench/
Source du benchmark : https://cursor.com/cursorbench
Mainteneur : Cursor
Tâche : Code
État : actif

## À quoi il sert

Sur Quelle IA, CursorBench sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 96.

## Comment c'est noté

Score de justesse de 0 à 1, publié avec le coût, les jetons et le nombre d'étapes par tâche.

## Ce qu'il ne dit pas

Jeu privé tenu par Cursor, qui vend l'éditeur : personne d'autre ne peut refaire la mesure. Les scores de la version 4.0 ne se comparent pas aux précédentes.

## Qui le tient

Cursor.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 96. Le meilleur, Claude Opus 5.5, atteint 57,8 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 6 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 23 %
- Score IA 100 (niveau de Claude Opus 5.5) : 55 %

## Son poids dans le score IA

1,15 % du score général. CursorBench porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.

## Classement (13 modèles mesurés · 54 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [Claude Opus 5.5](https://quelleia.com/modeles/claude-opus-5-5.md) | Anthropic | Maximale | 57,8 % | 101,5 | https://cursor.com/cursorbench |
| 2 | [Claude Sonnet 5.5](https://quelleia.com/modeles/claude-sonnet-5-5.md) | Anthropic | Maximale | 55,5 % | 99,9 | https://cursor.com/cursorbench |
| 3 | [Claude Fable 5.1](https://quelleia.com/modeles/claude-fable-5-1.md) | Anthropic | Maximale | 51,8 % | 97,5 | https://cursor.com/cursorbench |
| 4 | [Claude Opus 5](https://quelleia.com/modeles/claude-opus-5.md) | Anthropic | Maximale | 46,6 % | 94,1 | https://cursor.com/cursorbench |
| 5 | [Grok 4.7](https://quelleia.com/modeles/grok-4-7.md) | xAI | Maximale | 46,3 % | 93,9 | https://cursor.com/cursorbench |
| 6 | [GPT-5.6 Sol](https://quelleia.com/modeles/gpt-5-6-sol.md) | OpenAI | Maximale | 41,7 % | 90,8 | https://cursor.com/cursorbench |
| 7 | [Muse Spark 1.3](https://quelleia.com/modeles/muse-spark-1-3.md) | Meta AI | Maximale | 41,6 % | 90,7 | https://cursor.com/cursorbench |
| 8 | [Grok 4.6](https://quelleia.com/modeles/grok-4-6.md) | xAI | Maximale | 41,4 % | 90,6 | https://cursor.com/cursorbench |
| 9 | [GPT-5.6 Terra](https://quelleia.com/modeles/gpt-5-6-terra.md) | OpenAI | Maximale | 41,3 % | 90,5 | https://cursor.com/cursorbench |
| 10 | [Gemini 3.8 Flash](https://quelleia.com/modeles/gemini-3-8-flash.md) | Google DeepMind | Élevée | 39,6 % | 89,4 | https://cursor.com/cursorbench |
| 11 | [GPT-5.6 Luna](https://quelleia.com/modeles/gpt-5-6-luna.md) | OpenAI | Maximale | 35,9 % | 86,8 | https://cursor.com/cursorbench |
| 12 | [Claude Sonnet 5](https://quelleia.com/modeles/claude-sonnet-5.md) | Anthropic | Maximale | 34,1 % | 85,5 | https://cursor.com/cursorbench |
| 13 | [Composer 2.5](https://quelleia.com/modeles/composer-2-5.md) | Cursor | non précisée | 27,7 % | 80,5 | https://cursor.com/cursorbench |

## En bref

**Que mesure CursorBench ?** Des tâches tirées de vraies sessions de l'éditeur Cursor : comprendre un dépôt, trouver un bug, modifier plusieurs fichiers, relire du code. Sur Quelle IA, il est rangé dans la tâche Code.

**Comment CursorBench est-il noté ?** Score de justesse de 0 à 1, publié avec le coût, les jetons et le nombre d'étapes par tâche. Un modèle qui obtient 50 % a un score IA d'environ 96.

**Qui est en tête sur CursorBench ?** Claude Opus 5.5 (Anthropic) est en tête de CursorBench avec 57,8 %, dans l'édition du 28 septembre 2026. Suivent Claude Sonnet 5.5 (55,5 %) et Claude Fable 5.1 (51,8 %). 13 modèles y sont mesurés.

**Quelles sont les limites de CursorBench ?** Jeu privé tenu par Cursor, qui vend l'éditeur : personne d'autre ne peut refaire la mesure. Les scores de la version 4.0 ne se comparent pas aux précédentes. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse CursorBench dans le score IA ?** CursorBench compte pour 1,15 % du score général, dans l'édition du 28 septembre 2026. Il porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.

**Qui maintient CursorBench ?** Cursor. Sa page de référence : cursor.com/cursorbench.

## Les autres benchmarks de la tâche Code

- [Arena, questions de code](https://quelleia.com/benchmarks/arena_code.md) : 275 modèles · 1,15 % du score
- [WeirdML (v2)](https://quelleia.com/benchmarks/weirdml.md) : 129 modèles · 1,15 % du score
- [SciCode](https://quelleia.com/benchmarks/scicode.md) : 120 modèles · 1,15 % du score
- [Terminal-Bench 2.0](https://quelleia.com/benchmarks/terminal_bench.md) : 45 modèles · 1,15 % du score
- [FrontierCode](https://quelleia.com/benchmarks/frontiercode.md) : 37 modèles · 1,15 % du score
- [SWE-bench Verified](https://quelleia.com/benchmarks/swe_bench_verified.md) : 32 modèles · 1,15 % du score
- [DeepSWE](https://quelleia.com/benchmarks/deepswe.md) : 26 modèles · 1,15 % du score
- [GSO](https://quelleia.com/benchmarks/gso_bench.md) : 26 modèles · 1,15 % du score
- [GBAEval](https://quelleia.com/benchmarks/gbaeval.md) : 23 modèles · 1,15 % du score
- [FrontierSWE](https://quelleia.com/benchmarks/frontierswe.md) : 16 modèles · 1,15 % du score
- [WeirdML v3](https://quelleia.com/benchmarks/weirdml_v3.md) : 11 modèles · 1,15 % du score
- [MirrorCode](https://quelleia.com/benchmarks/mirrorcode.md) : 9 modèles · 1,15 % du score
- [Aider Polyglot](https://quelleia.com/benchmarks/aider_polyglot.md) : 54 modèles · hors score, archivé
- [LiveBench, code](https://quelleia.com/benchmarks/livebench_code.md) : 48 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
