Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

CodeFiche benchmark · Aider (Paul Gauthier) · aider.chat

Aider Polyglot

225 exercices de programmation difficiles d'Exercism, en six langages, à résoudre en modifiant directement les fichiers.

ARCHIVÉ

À quoi il sert

Aider Polyglot servait à noter la tâche Code. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.

Comment c'est noté

Pourcentage d'exercices dont tous les tests passent après deux tentatives, la seconde avec le retour des tests.

Ce qu'il ne dit pas

Exercices publics et courts, loin d'un vrai projet. Les meilleurs scores approchent 90 % et les données d'Epoch s'arrêtent fin 2025.

Comment lire le score

54 modèles mesurés · 72 mesures

En tête : GPT-5, 88 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 65. Le meilleur, GPT-5, atteint 88 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
15 %
Score IA 76niveau de Claude Sonnet 4.5
80 %
Score IA 100niveau de Claude Opus 5.5
99 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. Aider Polyglot est archivé et ne compte plus : la tâche Code (15 % du score général) repose sur 13 autres benchmarks.

En couleur, la tâche Code dans le score général. Aider Polyglot n'y a plus de part.

Le classement du benchmark

Scores relevés auprès de 2 sources · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-5OpenAI · 3 configurationsÉlevée88 %81,1
2o3-proOpenAIÉlevée84,9 %78,9
3Gemini 2.5 Pro (Jun 2025)Google DeepMind · 2 configurationsBudget83,1 %77,8
4o3OpenAI · 3 configurationsÉlevée81,3 %76,8
5Grok 4xAI · 2 configurationsÉlevée79,6 %76,0
6Gemini 2.5 Pro (May 2025)Google DeepMindNon précisée76,9 %74,7
7DeepSeek-V3.2DeepSeek · poids ouverts · 2 configurationsNon précisée74,2 %73,5
7DeepSeek-V3.2-ExpDeepSeek · 2 configurationsÉlevée74,2 %73,5
9Gemini 2.5 Pro (Mar 2025)Google DeepMind · 2 configurationsNon précisée72,9 %73,0
10o4-miniOpenAIÉlevée72 %72,6
54 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 54 →Replier le classement ↑
10Claude Opus 4Anthropic · 2 configurationsBudget72 %72,6
12DeepSeek-R1 (May 2025)DeepSeek · poids ouvertsNon précisée71,4 %72,3
13Claude 3.7 SonnetAnthropic · 2 configurationsBudget64,9 %69,9
14o1OpenAIÉlevée61,7 %68,8
15Claude Sonnet 4Anthropic · 2 configurationsBudget61,3 %68,7
16o3-miniOpenAI · 2 configurationsÉlevée60,4 %68,4
17Qwen3-235B-A22B-Instruct (Jul 2025)Alibaba · poids ouvertsNon précisée59,6 %68,1
17Qwen3-235B-A22BAlibaba · poids ouvertsNon précisée59,6 %68,1
19Kimi K2 (Sep 2025)MoonshotNon précisée59,1 %67,9
19Kimi K2 (Jul 2025)MoonshotNon précisée59,1 %67,9
21DeepSeek-R1DeepSeek · poids ouvertsNon précisée56,9 %67,2
22Gemini 2.5 Flash (May 2025)Google DeepMind · 2 configurationsBudget55,1 %66,6
22DeepSeek-V3 (Mar 2025)DeepSeek · poids ouvertsNon précisée55,1 %66,6
24Grok 3xAINon précisée53,3 %66,0
25GPT-4.1OpenAINon précisée52,4 %65,7
26Claude 3.5 Sonnet (October 2024)AnthropicNon précisée51,6 %65,5
27Grok-3 minixAI · 2 configurationsÉlevée49,3 %64,7
28DeepSeek-V3DeepSeek · poids ouvertsNon précisée48,4 %64,4
29Gemini 2.5 Flash (Apr 2025)Google DeepMindNon précisée47,1 %64,0
30GPT-4o (Mar 2025)OpenAINon précisée45,3 %63,4
31GPT-4.5OpenAINon précisée44,9 %63,3
32gpt-oss-120bOpenAI · poids ouverts · 2 configurationsÉlevée41,8 %62,3
33Qwen3-32BAlibaba · poids ouvertsNon précisée40 %61,7
34Gemini 2.0 Flash (Dec 2024)Google DeepMind · 2 configurationsNon précisée38,2 %61,1
35Gemini 2.0 ProGoogle DeepMindNon précisée35,6 %60,2
36o1-miniOpenAINon précisée32,9 %59,2
37GPT-4.1 miniOpenAINon précisée32,4 %59,0
38Claude 3.5 HaikuAnthropicNon précisée28 %57,3
39GPT-4o (Jan 2025)OpenAINon précisée27,1 %57,0
40GPT-4o (Aug 2024)OpenAINon précisée23,1 %55,2
41Qwen2.5-MaxAlibabaNon précisée21,8 %54,6
42QwQ-32BAlibaba · poids ouvertsNon précisée20,9 %54,2
43Gemini 2.0 Flash Thinking (Jan 2025)Google DeepMindNon précisée18,2 %52,8
43GPT-4o (Nov 2024)OpenAINon précisée18,2 %52,8
45DeepSeek-V2.5 (Sep 2024)DeepSeek · poids ouvertsNon précisée17,8 %52,6
46Qwen2.5-Coder-32B-InstructAlibaba · poids ouverts · 2 configurationsNon précisée16,4 %51,8
47Llama 4 MaverickMeta AI · poids ouvertsNon précisée15,6 %51,3
48Yi-Lightning01.AINon précisée12,9 %49,5
49Cohere Command ACohere · poids ouvertsNon précisée12 %48,9
50CodestralMistral AI · poids ouvertsNon précisée11,1 %48,1
51openhands-lm-32b-v0.1All Hands AINon précisée10,2 %47,4
52GPT-4.1 nanoOpenAINon précisée8,9 %46,2
53Gemma 3 27BGoogle DeepMind · poids ouvertsNon précisée4,9 %41,0
54GPT-4o miniOpenAINon précisée3,6 %38,4

En bref

Que mesure Aider Polyglot ?
225 exercices de programmation difficiles d'Exercism, en six langages, à résoudre en modifiant directement les fichiers. Sur Quelle IA, il est rangé dans la tâche Code.
Comment Aider Polyglot est-il noté ?
Pourcentage d'exercices dont tous les tests passent après deux tentatives, la seconde avec le retour des tests. Un modèle qui obtient 50 % a un score IA d'environ 65.
Qui est en tête sur Aider Polyglot ?
GPT-5 (OpenAI) est en tête d'Aider Polyglot avec 88 %, dans l'édition du 28 septembre 2026. Suivent o3-pro (84,9 %) et Gemini 2.5 Pro (Jun 2025) (83,1 %). 54 modèles y sont mesurés.
Quelles sont les limites d'Aider Polyglot ?
Exercices publics et courts, loin d'un vrai projet. Les meilleurs scores approchent 90 % et les données d'Epoch s'arrêtent fin 2025. Au 28 septembre 2026, le benchmark est archivé.
Combien pèse Aider Polyglot dans le score IA ?
Aider Polyglot compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est archivé et ne compte plus : la tâche Code (15 % du score général) repose sur 13 autres benchmarks.
Qui maintient Aider Polyglot ?
Aider (Paul Gauthier). Sa page de référence : aider.chat/docs/leaderboards.

Les autres benchmarks de la tâche Code

Tous les benchmarks →Comment le score IA est calculé →