À quoi il sert
Sur Quelle IA, FrontierCode sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 95.
CodeFiche benchmark · Cognition · cognition.com
Produire, pour un vrai ticket d'un projet open source, un correctif assez propre pour être accepté par les responsables du projet.
Sur Quelle IA, FrontierCode sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 95.
Note moyenne sur cinq essais selon une grille pondérée, sur les 100 tâches les plus dures ; un seul critère bloquant manqué donne zéro.
Classement tenu par Cognition, éditeur de l'agent Devin, qui y figure. Le score retenu est celui du meilleur réglage de chaque modèle, avec des harnais différents.
Cognition.
cognition.com/frontiercode · tâche Code · 37 modèles mesurés
En tête : Claude Fable 5, 53,5 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 95. Le meilleur, Claude Fable 5, atteint 53,5 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
1,15 %du score général. FrontierCode porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.
En couleur, la tâche Code dans le score général. En noir, la part de FrontierCode.