À quoi il sert
Sur Quelle IA, CursorBench sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 96.
CodeFiche benchmark · Cursor · cursor.com
Des tâches tirées de vraies sessions de l'éditeur Cursor : comprendre un dépôt, trouver un bug, modifier plusieurs fichiers, relire du code.
Sur Quelle IA, CursorBench sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 96.
Score de justesse de 0 à 1, publié avec le coût, les jetons et le nombre d'étapes par tâche.
Jeu privé tenu par Cursor, qui vend l'éditeur : personne d'autre ne peut refaire la mesure. Les scores de la version 4.0 ne se comparent pas aux précédentes.
Cursor.
cursor.com/cursorbench · tâche Code · 13 modèles mesurés
En tête : Claude Opus 5.5, 57,8 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 96. Le meilleur, Claude Opus 5.5, atteint 57,8 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
1,15 %du score général. CursorBench porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.
En couleur, la tâche Code dans le score général. En noir, la part de CursorBench.