À quoi il sert
Aider Polyglot servait à noter la tâche Code. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.
CodeFiche benchmark · Aider (Paul Gauthier) · aider.chat
225 exercices de programmation difficiles d'Exercism, en six langages, à résoudre en modifiant directement les fichiers.
Aider Polyglot servait à noter la tâche Code. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.
Pourcentage d'exercices dont tous les tests passent après deux tentatives, la seconde avec le retour des tests.
Exercices publics et courts, loin d'un vrai projet. Les meilleurs scores approchent 90 % et les données d'Epoch s'arrêtent fin 2025.
Aider (Paul Gauthier).
aider.chat/docs/leaderboards · tâche Code · 54 modèles mesurés
En tête : GPT-5, 88 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 65. Le meilleur, GPT-5, atteint 88 %. Le benchmark est archivé, faute de modèle récent mesuré.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
0 %du score général. Aider Polyglot est archivé et ne compte plus : la tâche Code (15 % du score général) repose sur 13 autres benchmarks.
En couleur, la tâche Code dans le score général. Aider Polyglot n'y a plus de part.