À quoi il sert
LiveBench, code servait à noter la tâche Code. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.
CodeFiche benchmark · LiveBench (Abacus.AI, NYU et coauteurs) · livebench.ai
Des exercices de programmation récents, tirés de concours publiés après la sortie des modèles.
LiveBench, code servait à noter la tâche Code. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.
La part d'exercices dont le code passe les tests.
Des exercices courts, éloignés du travail sur un vrai projet. Dernière édition en juin 2026.
LiveBench (Abacus.AI, NYU et coauteurs).
livebench.ai · tâche Code · 48 modèles mesurés
En tête : Gemini 2.5 Pro (Mar 2025), 85,9 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 54. Le meilleur, Gemini 2.5 Pro (Mar 2025), atteint 85,9 %. Le benchmark est archivé, faute de modèle récent mesuré.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
0 %du score général. LiveBench, code est archivé et ne compte plus : la tâche Code (15 % du score général) repose sur 13 autres benchmarks.
En couleur, la tâche Code dans le score général. LiveBench, code n'y a plus de part.