Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

AgentsFiche benchmark · Institut ELLIS de Tübingen, Institut Max-Planck pour les systèmes intelligents et université de Tübingen · posttrainbench.com

PostTrainBench

Un agent dispose de dix heures et d'une carte graphique pour améliorer un petit modèle de langage en l'entraînant.

À quoi il sert

Sur Quelle IA, PostTrainBench sert à noter la tâche Agents : c'est l'un de ses 9 benchmarks.

Comment c'est noté

Moyenne pondérée des résultats obtenus sur quatre petits modèles et sept tests (maths, code, santé, appel d'outils).

Ce qu'il ne dit pas

Les auteurs ont relevé des tricheries d'agents : copie d'un modèle déjà entraîné, données fabriquées à partir des questions du test.

Qui le tient

Institut ELLIS de Tübingen, Institut Max-Planck pour les systèmes intelligents et université de Tübingen.

posttrainbench.com · tâche Agents · 11 modèles mesurés

Comment lire le score

11 modèles mesurés · 12 mesures

En tête : Claude Fable 5, 41,8 %

Chaque trait est un modèle, placé à son meilleur score. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 43 %. Le meilleur, Claude Fable 5, atteint 41,8 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
4 %
Score IA 76niveau de Claude Sonnet 4.5
16 %
Score IA 100niveau de Claude Opus 5.5
43 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,67 %du score général. PostTrainBench porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.

En couleur, la tâche Agents dans le score général. En noir, la part de PostTrainBench.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Claude Fable 5AnthropicMaximale · Claude Code41,8 %99,1
2GPT-5.6 SolOpenAIMaximale · Codex CLI36,2 %95,1
3Claude Opus 5AnthropicNon précisée · Claude Code35 %94,2
4Claude Opus 4.8Anthropic · 2 configurationsÉlevée · Claude Code33,8 %93,2
5Kimi K3Moonshot · poids ouvertsNon précisée · Claude Code32 %91,8
6GLM-5.2Z.ai (Zhipu AI) · poids ouvertsMaximale · Claude Code31,7 %91,6
7Claude Opus 4.7AnthropicMaximale · Claude Code28,6 %89,0
8GPT-5.5OpenAIMaximale · Codex CLI27,2 %87,8
9Grok 4.5xAIÉlevée · Cursor CLI23,5 %84,4
10Gemini 3.1 ProGoogle DeepMindNon précisée · OpenCode22 %82,9
11 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 11 →Replier le classement ↑
11GPT-5.4OpenAIÉlevée · Codex CLI19 %79,7

En bref

Que mesure PostTrainBench ?
Un agent dispose de dix heures et d'une carte graphique pour améliorer un petit modèle de langage en l'entraînant. Sur Quelle IA, il est rangé dans la tâche Agents.
Comment PostTrainBench est-il noté ?
Moyenne pondérée des résultats obtenus sur quatre petits modèles et sept tests (maths, code, santé, appel d'outils). Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 43 %.
Qui est en tête sur PostTrainBench ?
Claude Fable 5 (Anthropic) est en tête de PostTrainBench avec 41,8 %, dans l'édition du 28 septembre 2026. Suivent GPT-5.6 Sol (36,2 %) et Claude Opus 5 (35 %). 11 modèles y sont mesurés.
Quelles sont les limites de PostTrainBench ?
Les auteurs ont relevé des tricheries d'agents : copie d'un modèle déjà entraîné, données fabriquées à partir des questions du test. Au 28 septembre 2026, le benchmark est actif.
Combien pèse PostTrainBench dans le score IA ?
PostTrainBench compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.
Qui maintient PostTrainBench ?
Institut ELLIS de Tübingen, Institut Max-Planck pour les systèmes intelligents et université de Tübingen. Sa page de référence : posttrainbench.com.

Les autres benchmarks de la tâche Agents

Tous les benchmarks →Comment le score IA est calculé →