# Aider Polyglot

> Fiche du benchmark Aider Polyglot sur Quelle IA, édition du 28 septembre 2026. 225 exercices de programmation difficiles d'Exercism, en six langages, à résoudre en modifiant directement les fichiers. En tête au 28 septembre 2026 : GPT-5 (88 %). Notation, limites et classement des 54 modèles mesurés.

Page : https://quelleia.com/benchmarks/aider_polyglot/
Source du benchmark : https://aider.chat/docs/leaderboards/
Mainteneur : Aider (Paul Gauthier)
Tâche : Code
État : archivé

## À quoi il sert

Aider Polyglot servait à noter la tâche Code. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.

## Comment c'est noté

Pourcentage d'exercices dont tous les tests passent après deux tentatives, la seconde avec le retour des tests.

## Ce qu'il ne dit pas

Exercices publics et courts, loin d'un vrai projet. Les meilleurs scores approchent 90 % et les données d'Epoch s'arrêtent fin 2025.

## Qui le tient

Aider (Paul Gauthier).

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 65. Le meilleur, GPT-5, atteint 88 %. Le benchmark est archivé, faute de modèle récent mesuré.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 15 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 80 %
- Score IA 100 (niveau de Claude Opus 5.5) : 99 %

## Son poids dans le score IA

0 % du score général. Aider Polyglot est archivé et ne compte plus : la tâche Code (15 % du score général) repose sur 13 autres benchmarks.

## Classement (54 modèles mesurés · 72 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [GPT-5](https://quelleia.com/modeles/gpt-5.md) | OpenAI | Élevée | 88 % | 81,1 | https://aider.chat/docs/leaderboards/ |
| 2 | [o3-pro](https://quelleia.com/modeles/o3-pro.md) | OpenAI | Élevée | 84,9 % | 78,9 | https://aider.chat/docs/leaderboards/ |
| 3 | [Gemini 2.5 Pro (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-pro-jun-2025.md) | Google DeepMind | Budget | 83,1 % | 77,8 | https://aider.chat/docs/leaderboards/ |
| 4 | [o3](https://quelleia.com/modeles/o3.md) | OpenAI | Élevée | 81,3 % | 76,8 | https://aider.chat/docs/leaderboards/ |
| 5 | [Grok 4](https://quelleia.com/modeles/grok-4.md) | xAI | Élevée | 79,6 % | 76,0 | https://aider.chat/docs/leaderboards/ |
| 6 | [Gemini 2.5 Pro (May 2025)](https://quelleia.com/modeles/gemini-2-5-pro-may-2025.md) | Google DeepMind | non précisée | 76,9 % | 74,7 | https://aider.chat/docs/leaderboards/ |
| 7 | [DeepSeek-V3.2](https://quelleia.com/modeles/deepseek-v3-2.md) | DeepSeek | non précisée | 74,2 % | 73,5 | https://aider.chat/docs/leaderboards/ |
| 7 | [DeepSeek-V3.2-Exp](https://quelleia.com/modeles/deepseek-v3-2-exp.md) | DeepSeek | Élevée | 74,2 % | 73,5 | https://epoch.ai/benchmarks |
| 9 | [Gemini 2.5 Pro (Mar 2025)](https://quelleia.com/modeles/gemini-2-5-pro-mar-2025.md) | Google DeepMind | non précisée | 72,9 % | 73,0 | https://epoch.ai/benchmarks |
| 10 | [o4-mini](https://quelleia.com/modeles/o4-mini.md) | OpenAI | Élevée | 72 % | 72,6 | https://aider.chat/docs/leaderboards/ |
| 10 | [Claude Opus 4](https://quelleia.com/modeles/claude-opus-4.md) | Anthropic | Budget | 72 % | 72,6 | https://aider.chat/docs/leaderboards/ |
| 12 | [DeepSeek-R1 (May 2025)](https://quelleia.com/modeles/deepseek-r1-may-2025.md) | DeepSeek | non précisée | 71,4 % | 72,3 | https://aider.chat/docs/leaderboards/ |
| 13 | [Claude 3.7 Sonnet](https://quelleia.com/modeles/claude-3-7-sonnet.md) | Anthropic | Budget | 64,9 % | 69,9 | https://aider.chat/docs/leaderboards/ |
| 14 | [o1](https://quelleia.com/modeles/o1.md) | OpenAI | Élevée | 61,7 % | 68,8 | https://aider.chat/docs/leaderboards/ |
| 15 | [Claude Sonnet 4](https://quelleia.com/modeles/claude-sonnet-4.md) | Anthropic | Budget | 61,3 % | 68,7 | https://aider.chat/docs/leaderboards/ |
| 16 | [o3-mini](https://quelleia.com/modeles/o3-mini.md) | OpenAI | Élevée | 60,4 % | 68,4 | https://aider.chat/docs/leaderboards/ |
| 17 | [Qwen3-235B-A22B-Instruct (Jul 2025)](https://quelleia.com/modeles/qwen3-235b-a22b-instruct-jul-2025.md) | Alibaba | non précisée | 59,6 % | 68,1 | https://aider.chat/docs/leaderboards/ |
| 17 | [Qwen3-235B-A22B](https://quelleia.com/modeles/qwen3-235b-a22b.md) | Alibaba | non précisée | 59,6 % | 68,1 | https://epoch.ai/benchmarks |
| 19 | [Kimi K2 (Sep 2025)](https://quelleia.com/modeles/kimi-k2-sep-2025.md) | Moonshot | non précisée | 59,1 % | 67,9 | https://aider.chat/docs/leaderboards/ |
| 19 | [Kimi K2 (Jul 2025)](https://quelleia.com/modeles/kimi-k2-jul-2025.md) | Moonshot | non précisée | 59,1 % | 67,9 | https://epoch.ai/benchmarks |
| 21 | [DeepSeek-R1](https://quelleia.com/modeles/deepseek-r1.md) | DeepSeek | non précisée | 56,9 % | 67,2 | https://aider.chat/docs/leaderboards/ |
| 22 | [Gemini 2.5 Flash (May 2025)](https://quelleia.com/modeles/gemini-2-5-flash-may-2025.md) | Google DeepMind | Budget | 55,1 % | 66,6 | https://aider.chat/docs/leaderboards/ |
| 22 | [DeepSeek-V3 (Mar 2025)](https://quelleia.com/modeles/deepseek-v3-mar-2025.md) | DeepSeek | non précisée | 55,1 % | 66,6 | https://aider.chat/docs/leaderboards/ |
| 24 | [Grok 3](https://quelleia.com/modeles/grok-3.md) | xAI | non précisée | 53,3 % | 66,0 | https://aider.chat/docs/leaderboards/ |
| 25 | [GPT-4.1](https://quelleia.com/modeles/gpt-4-1.md) | OpenAI | non précisée | 52,4 % | 65,7 | https://aider.chat/docs/leaderboards/ |
| 26 | [Claude 3.5 Sonnet (October 2024)](https://quelleia.com/modeles/claude-3-5-sonnet-october-2024.md) | Anthropic | non précisée | 51,6 % | 65,5 | https://aider.chat/docs/leaderboards/ |
| 27 | [Grok-3 mini](https://quelleia.com/modeles/grok-3-mini.md) | xAI | Élevée | 49,3 % | 64,7 | https://aider.chat/docs/leaderboards/ |
| 28 | [DeepSeek-V3](https://quelleia.com/modeles/deepseek-v3.md) | DeepSeek | non précisée | 48,4 % | 64,4 | https://epoch.ai/benchmarks |
| 29 | [Gemini 2.5 Flash (Apr 2025)](https://quelleia.com/modeles/gemini-2-5-flash-apr-2025.md) | Google DeepMind | non précisée | 47,1 % | 64,0 | https://aider.chat/docs/leaderboards/ |
| 30 | [GPT-4o (Mar 2025)](https://quelleia.com/modeles/gpt-4o-mar-2025.md) | OpenAI | non précisée | 45,3 % | 63,4 | https://aider.chat/docs/leaderboards/ |
| 31 | [GPT-4.5](https://quelleia.com/modeles/gpt-4-5.md) | OpenAI | non précisée | 44,9 % | 63,3 | https://aider.chat/docs/leaderboards/ |
| 32 | [gpt-oss-120b](https://quelleia.com/modeles/gpt-oss-120b.md) | OpenAI | Élevée | 41,8 % | 62,3 | https://aider.chat/docs/leaderboards/ |
| 33 | [Qwen3-32B](https://quelleia.com/modeles/qwen3-32b.md) | Alibaba | non précisée | 40 % | 61,7 | https://aider.chat/docs/leaderboards/ |
| 34 | [Gemini 2.0 Flash (Dec 2024)](https://quelleia.com/modeles/gemini-2-0-flash-dec-2024.md) | Google DeepMind | non précisée | 38,2 % | 61,1 | https://aider.chat/docs/leaderboards/ |
| 35 | [Gemini 2.0 Pro](https://quelleia.com/modeles/gemini-2-0-pro.md) | Google DeepMind | non précisée | 35,6 % | 60,2 | https://aider.chat/docs/leaderboards/ |
| 36 | [o1-mini](https://quelleia.com/modeles/o1-mini.md) | OpenAI | non précisée | 32,9 % | 59,2 | https://aider.chat/docs/leaderboards/ |
| 37 | [GPT-4.1 mini](https://quelleia.com/modeles/gpt-4-1-mini.md) | OpenAI | non précisée | 32,4 % | 59,0 | https://aider.chat/docs/leaderboards/ |
| 38 | [Claude 3.5 Haiku](https://quelleia.com/modeles/claude-3-5-haiku.md) | Anthropic | non précisée | 28 % | 57,3 | https://aider.chat/docs/leaderboards/ |
| 39 | [GPT-4o (Jan 2025)](https://quelleia.com/modeles/gpt-4o-jan-2025.md) | OpenAI | non précisée | 27,1 % | 57,0 | https://aider.chat/docs/leaderboards/ |
| 40 | [GPT-4o (Aug 2024)](https://quelleia.com/modeles/gpt-4o-aug-2024.md) | OpenAI | non précisée | 23,1 % | 55,2 | https://aider.chat/docs/leaderboards/ |
| 41 | [Qwen2.5-Max](https://quelleia.com/modeles/qwen2-5-max.md) | Alibaba | non précisée | 21,8 % | 54,6 | https://aider.chat/docs/leaderboards/ |
| 42 | [QwQ-32B](https://quelleia.com/modeles/qwq-32b.md) | Alibaba | non précisée | 20,9 % | 54,2 | https://aider.chat/docs/leaderboards/ |
| 43 | [Gemini 2.0 Flash Thinking (Jan 2025)](https://quelleia.com/modeles/gemini-2-0-flash-thinking-jan-2025.md) | Google DeepMind | non précisée | 18,2 % | 52,8 | https://aider.chat/docs/leaderboards/ |
| 43 | [GPT-4o (Nov 2024)](https://quelleia.com/modeles/gpt-4o-nov-2024.md) | OpenAI | non précisée | 18,2 % | 52,8 | https://aider.chat/docs/leaderboards/ |
| 45 | [DeepSeek-V2.5 (Sep 2024)](https://quelleia.com/modeles/deepseek-v2-5-sep-2024.md) | DeepSeek | non précisée | 17,8 % | 52,6 | https://aider.chat/docs/leaderboards/ |
| 46 | [Qwen2.5-Coder-32B-Instruct](https://quelleia.com/modeles/qwen2-5-coder-32b-instruct.md) | Alibaba | non précisée | 16,4 % | 51,8 | https://epoch.ai/benchmarks |
| 47 | [Llama 4 Maverick](https://quelleia.com/modeles/llama-4-maverick.md) | Meta AI | non précisée | 15,6 % | 51,3 | https://aider.chat/docs/leaderboards/ |
| 48 | [Yi-Lightning](https://quelleia.com/modeles/yi-lightning.md) | 01.AI | non précisée | 12,9 % | 49,5 | https://aider.chat/docs/leaderboards/ |
| 49 | [Cohere Command A](https://quelleia.com/modeles/cohere-command-a.md) | Cohere | non précisée | 12 % | 48,9 | https://aider.chat/docs/leaderboards/ |
| 50 | [Codestral](https://quelleia.com/modeles/codestral.md) | Mistral AI | non précisée | 11,1 % | 48,1 | https://aider.chat/docs/leaderboards/ |
| 51 | [openhands-lm-32b-v0.1](https://quelleia.com/modeles/openhands-lm-32b-v0-1.md) | All Hands AI | non précisée | 10,2 % | 47,4 | https://aider.chat/docs/leaderboards/ |
| 52 | [GPT-4.1 nano](https://quelleia.com/modeles/gpt-4-1-nano.md) | OpenAI | non précisée | 8,9 % | 46,2 | https://aider.chat/docs/leaderboards/ |
| 53 | [Gemma 3 27B](https://quelleia.com/modeles/gemma-3-27b.md) | Google DeepMind | non précisée | 4,9 % | 41,0 | https://aider.chat/docs/leaderboards/ |
| 54 | [GPT-4o mini](https://quelleia.com/modeles/gpt-4o-mini.md) | OpenAI | non précisée | 3,6 % | 38,4 | https://aider.chat/docs/leaderboards/ |

## En bref

**Que mesure Aider Polyglot ?** 225 exercices de programmation difficiles d'Exercism, en six langages, à résoudre en modifiant directement les fichiers. Sur Quelle IA, il est rangé dans la tâche Code.

**Comment Aider Polyglot est-il noté ?** Pourcentage d'exercices dont tous les tests passent après deux tentatives, la seconde avec le retour des tests. Un modèle qui obtient 50 % a un score IA d'environ 65.

**Qui est en tête sur Aider Polyglot ?** GPT-5 (OpenAI) est en tête d'Aider Polyglot avec 88 %, dans l'édition du 28 septembre 2026. Suivent o3-pro (84,9 %) et Gemini 2.5 Pro (Jun 2025) (83,1 %). 54 modèles y sont mesurés.

**Quelles sont les limites d'Aider Polyglot ?** Exercices publics et courts, loin d'un vrai projet. Les meilleurs scores approchent 90 % et les données d'Epoch s'arrêtent fin 2025. Au 28 septembre 2026, le benchmark est archivé.

**Combien pèse Aider Polyglot dans le score IA ?** Aider Polyglot compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est archivé et ne compte plus : la tâche Code (15 % du score général) repose sur 13 autres benchmarks.

**Qui maintient Aider Polyglot ?** Aider (Paul Gauthier). Sa page de référence : aider.chat/docs/leaderboards.

## Les autres benchmarks de la tâche Code

- [Arena, questions de code](https://quelleia.com/benchmarks/arena_code.md) : 275 modèles · 1,15 % du score
- [WeirdML (v2)](https://quelleia.com/benchmarks/weirdml.md) : 129 modèles · 1,15 % du score
- [SciCode](https://quelleia.com/benchmarks/scicode.md) : 120 modèles · 1,15 % du score
- [Terminal-Bench 2.0](https://quelleia.com/benchmarks/terminal_bench.md) : 45 modèles · 1,15 % du score
- [FrontierCode](https://quelleia.com/benchmarks/frontiercode.md) : 37 modèles · 1,15 % du score
- [SWE-bench Verified](https://quelleia.com/benchmarks/swe_bench_verified.md) : 32 modèles · 1,15 % du score
- [DeepSWE](https://quelleia.com/benchmarks/deepswe.md) : 26 modèles · 1,15 % du score
- [GSO](https://quelleia.com/benchmarks/gso_bench.md) : 26 modèles · 1,15 % du score
- [GBAEval](https://quelleia.com/benchmarks/gbaeval.md) : 23 modèles · 1,15 % du score
- [FrontierSWE](https://quelleia.com/benchmarks/frontierswe.md) : 16 modèles · 1,15 % du score
- [CursorBench](https://quelleia.com/benchmarks/cursorbench.md) : 13 modèles · 1,15 % du score
- [WeirdML v3](https://quelleia.com/benchmarks/weirdml_v3.md) : 11 modèles · 1,15 % du score
- [MirrorCode](https://quelleia.com/benchmarks/mirrorcode.md) : 9 modèles · 1,15 % du score
- [LiveBench, code](https://quelleia.com/benchmarks/livebench_code.md) : 48 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
