Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

CodeFiche benchmark · Cursor · cursor.com

CursorBench

Des tâches tirées de vraies sessions de l'éditeur Cursor : comprendre un dépôt, trouver un bug, modifier plusieurs fichiers, relire du code.

À quoi il sert

Sur Quelle IA, CursorBench sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 96.

Comment c'est noté

Score de justesse de 0 à 1, publié avec le coût, les jetons et le nombre d'étapes par tâche.

Ce qu'il ne dit pas

Jeu privé tenu par Cursor, qui vend l'éditeur : personne d'autre ne peut refaire la mesure. Les scores de la version 4.0 ne se comparent pas aux précédentes.

Comment lire le score

13 modèles mesurés · 54 mesures

En tête : Claude Opus 5.5, 57,8 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 96. Le meilleur, Claude Opus 5.5, atteint 57,8 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
6 %
Score IA 76niveau de Claude Sonnet 4.5
23 %
Score IA 100niveau de Claude Opus 5.5
55 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,15 %du score général. CursorBench porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.

En couleur, la tâche Code dans le score général. En noir, la part de CursorBench.

Le classement du benchmark

Scores relevés sur cursor.com · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Claude Opus 5.5Anthropic · 2 configurationsMaximale57,8 %101,5
2Claude Sonnet 5.5Anthropic · 5 configurationsMaximale55,5 %99,9
3Claude Fable 5.1Anthropic · 5 configurationsMaximale51,8 %97,5
4Claude Opus 5Anthropic · 5 configurationsMaximale46,6 %94,1
5Grok 4.7xAI · 4 configurationsMaximale46,3 %93,9
6GPT-5.6 SolOpenAI · 5 configurationsMaximale41,7 %90,8
7Muse Spark 1.3Meta AI · 6 configurationsMaximale41,6 %90,7
8Grok 4.6xAI · 4 configurationsMaximale41,4 %90,6
9GPT-5.6 TerraOpenAI · 5 configurationsMaximale41,3 %90,5
10Gemini 3.8 FlashGoogle DeepMind · 2 configurationsÉlevée39,6 %89,4
13 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 13 →Replier le classement ↑
11GPT-5.6 LunaOpenAI · 5 configurationsMaximale35,9 %86,8
12Claude Sonnet 5Anthropic · 5 configurationsMaximale34,1 %85,5
13Composer 2.5CursorNon précisée27,7 %80,5

En bref

Que mesure CursorBench ?
Des tâches tirées de vraies sessions de l'éditeur Cursor : comprendre un dépôt, trouver un bug, modifier plusieurs fichiers, relire du code. Sur Quelle IA, il est rangé dans la tâche Code.
Comment CursorBench est-il noté ?
Score de justesse de 0 à 1, publié avec le coût, les jetons et le nombre d'étapes par tâche. Un modèle qui obtient 50 % a un score IA d'environ 96.
Qui est en tête sur CursorBench ?
Claude Opus 5.5 (Anthropic) est en tête de CursorBench avec 57,8 %, dans l'édition du 28 septembre 2026. Suivent Claude Sonnet 5.5 (55,5 %) et Claude Fable 5.1 (51,8 %). 13 modèles y sont mesurés.
Quelles sont les limites de CursorBench ?
Jeu privé tenu par Cursor, qui vend l'éditeur : personne d'autre ne peut refaire la mesure. Les scores de la version 4.0 ne se comparent pas aux précédentes. Au 28 septembre 2026, le benchmark est actif.
Combien pèse CursorBench dans le score IA ?
CursorBench compte pour 1,15 % du score général, dans l'édition du 28 septembre 2026. Il porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.
Qui maintient CursorBench ?
Cursor. Sa page de référence : cursor.com/cursorbench.

Les autres benchmarks de la tâche Code

Tous les benchmarks →Comment le score IA est calculé →