# PostTrainBench

> Fiche du benchmark PostTrainBench sur Quelle IA, édition du 28 septembre 2026. Un agent dispose de dix heures et d'une carte graphique pour améliorer un petit modèle de langage en l'entraînant. En tête au 28 septembre 2026 : Claude Fable 5 (41,8 %). Notation, limites et classement des 11 modèles mesurés.

Page : https://quelleia.com/benchmarks/posttrainbench/
Source du benchmark : https://posttrainbench.com/
Mainteneur : Institut ELLIS de Tübingen, Institut Max-Planck pour les systèmes intelligents et université de Tübingen
Tâche : Agents
État : actif

## À quoi il sert

Sur Quelle IA, PostTrainBench sert à noter la tâche Agents : c'est l'un de ses 9 benchmarks.

## Comment c'est noté

Moyenne pondérée des résultats obtenus sur quatre petits modèles et sept tests (maths, code, santé, appel d'outils).

## Ce qu'il ne dit pas

Les auteurs ont relevé des tricheries d'agents : copie d'un modèle déjà entraîné, données fabriquées à partir des questions du test.

## Qui le tient

Institut ELLIS de Tübingen, Institut Max-Planck pour les systèmes intelligents et université de Tübingen.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 43 %. Le meilleur, Claude Fable 5, atteint 41,8 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 4 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 16 %
- Score IA 100 (niveau de Claude Opus 5.5) : 43 %

## Son poids dans le score IA

1,67 % du score général. PostTrainBench porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.

## Classement (11 modèles mesurés · 12 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [Claude Fable 5](https://quelleia.com/modeles/claude-fable-5.md) | Anthropic | Maximale | 41,8 % | 99,1 | https://epoch.ai/benchmarks |
| 2 | [GPT-5.6 Sol](https://quelleia.com/modeles/gpt-5-6-sol.md) | OpenAI | Maximale | 36,2 % | 95,1 | https://epoch.ai/benchmarks |
| 3 | [Claude Opus 5](https://quelleia.com/modeles/claude-opus-5.md) | Anthropic | non précisée | 35 % | 94,2 | https://epoch.ai/benchmarks |
| 4 | [Claude Opus 4.8](https://quelleia.com/modeles/claude-opus-4-8.md) | Anthropic | Élevée | 33,8 % | 93,2 | https://epoch.ai/benchmarks |
| 5 | [Kimi K3](https://quelleia.com/modeles/kimi-k3.md) | Moonshot | non précisée | 32 % | 91,8 | https://epoch.ai/benchmarks |
| 6 | [GLM-5.2](https://quelleia.com/modeles/glm-5-2.md) | Z.ai (Zhipu AI) | Maximale | 31,7 % | 91,6 | https://epoch.ai/benchmarks |
| 7 | [Claude Opus 4.7](https://quelleia.com/modeles/claude-opus-4-7.md) | Anthropic | Maximale | 28,6 % | 89,0 | https://epoch.ai/benchmarks |
| 8 | [GPT-5.5](https://quelleia.com/modeles/gpt-5-5.md) | OpenAI | Maximale | 27,2 % | 87,8 | https://epoch.ai/benchmarks |
| 9 | [Grok 4.5](https://quelleia.com/modeles/grok-4-5.md) | xAI | Élevée | 23,5 % | 84,4 | https://epoch.ai/benchmarks |
| 10 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | non précisée | 22 % | 82,9 | https://epoch.ai/benchmarks |
| 11 | [GPT-5.4](https://quelleia.com/modeles/gpt-5-4.md) | OpenAI | Élevée | 19 % | 79,7 | https://epoch.ai/benchmarks |

## En bref

**Que mesure PostTrainBench ?** Un agent dispose de dix heures et d'une carte graphique pour améliorer un petit modèle de langage en l'entraînant. Sur Quelle IA, il est rangé dans la tâche Agents.

**Comment PostTrainBench est-il noté ?** Moyenne pondérée des résultats obtenus sur quatre petits modèles et sept tests (maths, code, santé, appel d'outils). Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 43 %.

**Qui est en tête sur PostTrainBench ?** Claude Fable 5 (Anthropic) est en tête de PostTrainBench avec 41,8 %, dans l'édition du 28 septembre 2026. Suivent GPT-5.6 Sol (36,2 %) et Claude Opus 5 (35 %). 11 modèles y sont mesurés.

**Quelles sont les limites de PostTrainBench ?** Les auteurs ont relevé des tricheries d'agents : copie d'un modèle déjà entraîné, données fabriquées à partir des questions du test. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse PostTrainBench dans le score IA ?** PostTrainBench compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.

**Qui maintient PostTrainBench ?** Institut ELLIS de Tübingen, Institut Max-Planck pour les systèmes intelligents et université de Tübingen. Sa page de référence : posttrainbench.com.

## Les autres benchmarks de la tâche Agents

- [Vending-Bench 2](https://quelleia.com/benchmarks/vending_bench_2.md) : 56 modèles · 1,67 % du score
- [METR Time Horizons (taux de réussite)](https://quelleia.com/benchmarks/metr_time_horizons.md) : 41 modèles · 1,67 % du score
- [BALROG](https://quelleia.com/benchmarks/balrog.md) : 37 modèles · 1,67 % du score
- [APEX-Agents](https://quelleia.com/benchmarks/apex_agents.md) : 34 modèles · 1,67 % du score
- [DeepResearch Bench](https://quelleia.com/benchmarks/deepresearch_bench.md) : 24 modèles · 1,67 % du score
- [EBR-bench (Earthborne Rangers)](https://quelleia.com/benchmarks/ebr_bench.md) : 23 modèles · 1,67 % du score
- [Remote Labor Index](https://quelleia.com/benchmarks/remote_labor_index.md) : 13 modèles · 1,67 % du score
- [OSWorld 2.0](https://quelleia.com/benchmarks/osworld_2.md) : 9 modèles · 1,67 % du score
- [TheAgentCompany](https://quelleia.com/benchmarks/the_agent_company.md) : 14 modèles · hors score, archivé
- [GDPval](https://quelleia.com/benchmarks/gdpval.md) : 11 modèles · hors score, archivé
- [OSWorld](https://quelleia.com/benchmarks/osworld.md) : 9 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
