Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

CodeFiche benchmark · Cognition · cognition.com

FrontierCode

Produire, pour un vrai ticket d'un projet open source, un correctif assez propre pour être accepté par les responsables du projet.

À quoi il sert

Sur Quelle IA, FrontierCode sert à noter la tâche Code : c'est l'un de ses 13 benchmarks. Il départage surtout les modèles dont le score IA approche 95.

Comment c'est noté

Note moyenne sur cinq essais selon une grille pondérée, sur les 100 tâches les plus dures ; un seul critère bloquant manqué donne zéro.

Ce qu'il ne dit pas

Classement tenu par Cognition, éditeur de l'agent Devin, qui y figure. Le score retenu est celui du meilleur réglage de chaque modèle, avec des harnais différents.

Comment lire le score

37 modèles mesurés

En tête : Claude Fable 5, 53,5 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 95. Le meilleur, Claude Fable 5, atteint 53,5 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
2 %
Score IA 76niveau de Claude Sonnet 4.5
16 %
Score IA 100niveau de Claude Opus 5.5
62 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,15 %du score général. FrontierCode porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.

En couleur, la tâche Code dans le score général. En noir, la part de FrontierCode.

Le classement du benchmark

Scores relevés sur cognition.com · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Claude Fable 5AnthropicNon précisée · Claude Code53,5 %96,2
2Claude Opus 5AnthropicMaximale · Claude Code53,4 %96,2
3GPT-6 AstraOpenAIMaximale · Codex CLI53,3 %96,1
4Claude Sonnet 5.5AnthropicMaximale · Claude Code52,1 %95,6
5Claude Fable 5.1AnthropicMoyenne · Claude Code50,9 %95,1
6SWE-2CognitionMaximale · devin50 %94,7
7Grok 4.6xAINon précisée · grok-build48 %93,8
8GPT-5.6 SolOpenAINon précisée · Codex CLI47,5 %93,6
9Claude Opus 4.8AnthropicNon précisée · Claude Code46,5 %93,1
10Kimi K3Moonshot · poids ouvertsNon précisée · mini-SWE-agent44,2 %92,1
37 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 37 →Replier le classement ↑
11Gemini 3.7 FlashGoogle DeepMindNon précisée · chisel43,6 %91,8
12GPT-5.5OpenAINon précisée · Codex CLI43 %91,5
13Claude Sonnet 5AnthropicNon précisée · Claude Code42,7 %91,4
14Grok 4.5xAINon précisée · grok-build42,4 %91,3
15SWE-1.7CognitionNon précisée · chisel42 %91,1
16GPT-5.6 TerraOpenAINon précisée · Codex CLI41,3 %90,8
17Gemini 3.8 FlashGoogle DeepMindMoyenne · chisel41,2 %90,7
18GLM-5.3Z.ai (Zhipu AI) · poids ouvertsMaximale · chisel40,1 %90,3
19GPT-5.6 LunaOpenAINon précisée · Codex CLI39,8 %90,1
20Claude Opus 4.7AnthropicNon précisée · Claude Code38,5 %89,5
21Gemini 3.6 FlashGoogle DeepMindNon précisée · chisel34,4 %87,5
22GLM-5.3-FlashZ.ai (Zhipu AI) · poids ouvertsMaximale · chisel31,8 %86,3
23Kimi K2.7 CodeMoonshot · poids ouvertsNon précisée · mini-SWE-agent30,1 %85,3
24DeepSeek V4 Pro 0813DeepSeek · poids ouvertsÉlevée · chisel28,5 %84,5
25GPT-5.4 MiniOpenAINon précisée · Codex CLI27 %83,7
26Claude Opus 4.6AnthropicNon précisée · Claude Code26,6 %83,5
27Composer 2.5CursorNon précisée · cursor-cli25,6 %82,9
28GLM-5.2Z.ai (Zhipu AI) · poids ouvertsSans · mini-SWE-agent24,5 %82,2
29Claude Sonnet 4.6AnthropicNon précisée · Claude Code24,3 %82,1
30DeepSeek V4 Flash 0731DeepSeek · poids ouvertsNon précisée · chisel18,8 %78,5
31DeepSeek-V4-ProDeepSeek · poids ouvertsSans · mini-SWE-agent17,6 %77,6
32MiniMax-M3MiniMax · poids ouvertsNon précisée · mini-SWE-agent14,7 %75,2
33InklingThinking Machines · poids ouvertsNon précisée · mini-SWE-agent14 %74,6
34Nemotron 3 UltraNVIDIA · poids ouvertsNon précisée · chisel13,6 %74,2
35Qwen3.7-PlusAlibabaNon précisée · mini-SWE-agent10,2 %70,6
36SWE-1.6CognitionNon précisée · chisel9,4 %69,6
37Mistral Medium 3.5Mistral AI · poids ouvertsNon précisée · chisel8 %67,6

En bref

Que mesure FrontierCode ?
Produire, pour un vrai ticket d'un projet open source, un correctif assez propre pour être accepté par les responsables du projet. Sur Quelle IA, il est rangé dans la tâche Code.
Comment FrontierCode est-il noté ?
Note moyenne sur cinq essais selon une grille pondérée, sur les 100 tâches les plus dures ; un seul critère bloquant manqué donne zéro. Un modèle qui obtient 50 % a un score IA d'environ 95.
Qui est en tête sur FrontierCode ?
Claude Fable 5 (Anthropic) est en tête de FrontierCode avec 53,5 %, dans l'édition du 28 septembre 2026. Suivent Claude Opus 5 (53,4 %) et GPT-6 Astra (53,3 %). 37 modèles y sont mesurés.
Quelles sont les limites de FrontierCode ?
Classement tenu par Cognition, éditeur de l'agent Devin, qui y figure. Le score retenu est celui du meilleur réglage de chaque modèle, avec des harnais différents. Au 28 septembre 2026, le benchmark est actif.
Combien pèse FrontierCode dans le score IA ?
FrontierCode compte pour 1,15 % du score général, dans l'édition du 28 septembre 2026. Il porte 8 % de la tâche Code (15 % du score général), que se partagent 13 benchmarks.
Qui maintient FrontierCode ?
Cognition. Sa page de référence : cognition.com/frontiercode.

Les autres benchmarks de la tâche Code

Tous les benchmarks →Comment le score IA est calculé →