# METR Time Horizons (taux de réussite)

> Fiche du benchmark METR Time Horizons (taux de réussite) sur Quelle IA, édition du 28 septembre 2026. Des tâches de logiciel, d'apprentissage automatique et de cybersécurité, dont on connaît la durée pour un professionnel humain. En tête au 28 septembre 2026 : Claude Mythos Preview (85,2 %). Notation, limites et classement des 41 modèles mesurés.

Page : https://quelleia.com/benchmarks/metr_time_horizons/
Source du benchmark : https://metr.org/time-horizons/
Mainteneur : METR
Tâche : Agents
État : actif

## À quoi il sert

Sur Quelle IA, METR Time Horizons (taux de réussite) sert à noter la tâche Agents : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 62.

## Comment c'est noté

Score moyen de réussite, de 0 à 1, sur l'ensemble des tâches de METR ; c'est la valeur qu'Epoch retient pour son indice.

## Ce qu'il ne dit pas

Ce score moyen est moins parlant que l'horizon en minutes publié par METR. Les tâches sont propres et bien définies, loin du désordre d'un vrai poste.

## Qui le tient

METR.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 62. Le meilleur, Claude Mythos Preview, atteint 85,2 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 38 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 66 %
- Score IA 100 (niveau de Claude Opus 5.5) : 85 %

## Son poids dans le score IA

1,67 % du score général. METR Time Horizons (taux de réussite) porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.

## Classement (41 modèles mesurés · 50 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [Claude Mythos Preview](https://quelleia.com/modeles/claude-mythos-preview.md) | Anthropic | non précisée | 85,2 % | 101,1 | https://metr.org/blog/2025-03-19-measuring-ai-ability-to-complete-long-tasks/ |
| 2 | [Claude Opus 4.6](https://quelleia.com/modeles/claude-opus-4-6.md) | Anthropic | non précisée | 78,9 % | 91,4 | https://epoch.ai/benchmarks |
| 3 | [Gemini 3.1 Pro](https://quelleia.com/modeles/gemini-3-1-pro.md) | Google DeepMind | non précisée | 77 % | 89,1 | https://metr.org/blog/2025-03-19-measuring-ai-ability-to-complete-long-tasks/ |
| 4 | [GPT-5.2](https://quelleia.com/modeles/gpt-5-2.md) | OpenAI | Élevée | 75,3 % | 86,9 | https://epoch.ai/benchmarks |
| 5 | [Claude Opus 4.5](https://quelleia.com/modeles/claude-opus-4-5.md) | Anthropic | Budget | 75 % | 86,5 | https://epoch.ai/benchmarks |
| 6 | [GPT-5.3 Codex](https://quelleia.com/modeles/gpt-5-3-codex.md) | OpenAI | non précisée | 74,5 % | 86,0 | https://epoch.ai/benchmarks |
| 7 | [GPT-5.4](https://quelleia.com/modeles/gpt-5-4.md) | OpenAI | non précisée | 74,3 % | 85,8 | https://epoch.ai/benchmarks |
| 8 | [Gemini 3 Pro](https://quelleia.com/modeles/gemini-3-pro.md) | Google DeepMind | non précisée | 71 % | 82,0 | https://epoch.ai/benchmarks |
| 9 | [GPT-5.1-Codex-Max](https://quelleia.com/modeles/gpt-5-1-codex-max.md) | OpenAI | non précisée | 70,8 % | 81,8 | https://metr.org/blog/2025-03-19-measuring-ai-ability-to-complete-long-tasks/ |
| 10 | [GPT-5](https://quelleia.com/modeles/gpt-5.md) | OpenAI | Moyenne | 69,6 % | 80,5 | https://epoch.ai/benchmarks |
| 11 | [Claude Sonnet 4.5](https://quelleia.com/modeles/claude-sonnet-4-5.md) | Anthropic | Budget | 67,4 % | 78,2 | https://epoch.ai/benchmarks |
| 12 | [Claude Opus 4.1](https://quelleia.com/modeles/claude-opus-4-1.md) | Anthropic | Budget | 66,8 % | 77,6 | https://epoch.ai/benchmarks |
| 13 | [Grok 4](https://quelleia.com/modeles/grok-4.md) | xAI | non précisée | 66,6 % | 77,4 | https://epoch.ai/benchmarks |
| 14 | [o3](https://quelleia.com/modeles/o3.md) | OpenAI | Moyenne | 65,4 % | 76,3 | https://epoch.ai/benchmarks |
| 15 | [Claude Opus 4](https://quelleia.com/modeles/claude-opus-4.md) | Anthropic | Budget | 63,9 % | 74,8 | https://epoch.ai/benchmarks |
| 16 | [o4-mini](https://quelleia.com/modeles/o4-mini.md) | OpenAI | Moyenne | 63,9 % | 74,8 | https://epoch.ai/benchmarks |
| 17 | [Claude Sonnet 4](https://quelleia.com/modeles/claude-sonnet-4.md) | Anthropic | Budget | 62 % | 72,9 | https://epoch.ai/benchmarks |
| 18 | [Claude 3.7 Sonnet](https://quelleia.com/modeles/claude-3-7-sonnet.md) | Anthropic | Budget | 60 % | 71,0 | https://epoch.ai/benchmarks |
| 19 | [Kimi K2 Thinking](https://quelleia.com/modeles/kimi-k2-thinking.md) | Moonshot | non précisée | 59,2 % | 70,3 | https://epoch.ai/benchmarks |
| 20 | [gpt-oss-120b](https://quelleia.com/modeles/gpt-oss-120b.md) | OpenAI | non précisée | 56,6 % | 68,0 | https://epoch.ai/benchmarks |
| 21 | [Gemini 2.5 Pro (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-pro-jun-2025.md) | Google DeepMind | non précisée | 55,4 % | 66,9 | https://epoch.ai/benchmarks |
| 22 | [DeepSeek-R1 (May 2025)](https://quelleia.com/modeles/deepseek-r1-may-2025.md) | DeepSeek | non précisée | 53,8 % | 65,4 | https://epoch.ai/benchmarks |
| 23 | [DeepSeek-R1](https://quelleia.com/modeles/deepseek-r1.md) | DeepSeek | non précisée | 51,9 % | 63,7 | https://epoch.ai/benchmarks |
| 24 | [o1](https://quelleia.com/modeles/o1.md) | OpenAI | Moyenne | 51,1 % | 63,0 | https://metr.org/blog/2025-03-19-measuring-ai-ability-to-complete-long-tasks/ |
| 25 | [DeepSeek-V3 (Mar 2025)](https://quelleia.com/modeles/deepseek-v3-mar-2025.md) | DeepSeek | non précisée | 49,6 % | 61,6 | https://epoch.ai/benchmarks |
| 26 | [DeepSeek-V3](https://quelleia.com/modeles/deepseek-v3.md) | DeepSeek | non précisée | 47,4 % | 59,7 | https://epoch.ai/benchmarks |
| 27 | [Claude 3.5 Sonnet (October 2024)](https://quelleia.com/modeles/claude-3-5-sonnet-october-2024.md) | Anthropic | non précisée | 45,2 % | 57,7 | https://metr.org/blog/2025-03-19-measuring-ai-ability-to-complete-long-tasks/ |
| 28 | [o1-preview](https://quelleia.com/modeles/o1-preview.md) | OpenAI | non précisée | 45,1 % | 57,7 | https://metr.org/blog/2025-03-19-measuring-ai-ability-to-complete-long-tasks/ |
| 29 | [GPT-4o (Nov 2024)](https://quelleia.com/modeles/gpt-4o-nov-2024.md) | OpenAI | non précisée | 40,8 % | 53,7 | https://epoch.ai/benchmarks |
| 30 | [Claude 3.5 Sonnet](https://quelleia.com/modeles/claude-3-5-sonnet.md) | Anthropic | non précisée | 40,2 % | 53,1 | https://metr.org/blog/2025-03-19-measuring-ai-ability-to-complete-long-tasks/ |
| 31 | [GPT-4 Turbo (Apr 2024)](https://quelleia.com/modeles/gpt-4-turbo-apr-2024.md) | OpenAI | non précisée | 36,7 % | 49,9 | https://epoch.ai/benchmarks |
| 32 | [GPT-4 (Mar 2023)](https://quelleia.com/modeles/gpt-4-mar-2023.md) | OpenAI | non précisée | 36,1 % | 49,3 | https://epoch.ai/benchmarks |
| 33 | [Qwen2.5-72B](https://quelleia.com/modeles/qwen2-5-72b.md) | Alibaba | non précisée | 35,8 % | 48,9 | https://epoch.ai/benchmarks |
| 34 | [GPT-4 Turbo (Nov 2023)](https://quelleia.com/modeles/gpt-4-turbo-nov-2023.md) | OpenAI | non précisée | 35,2 % | 48,4 | https://epoch.ai/benchmarks |
| 35 | [GPT-4o (Aug 2024)](https://quelleia.com/modeles/gpt-4o-aug-2024.md) | OpenAI | non précisée | 33,8 % | 47,0 | https://epoch.ai/benchmarks |
| 36 | [Qwen2-72B](https://quelleia.com/modeles/qwen2-72b.md) | Alibaba | non précisée | 29,9 % | 43,0 | https://epoch.ai/benchmarks |
| 37 | [Claude 3 Opus](https://quelleia.com/modeles/claude-3-opus.md) | Anthropic | non précisée | 29,5 % | 42,5 | https://metr.org/blog/2025-03-19-measuring-ai-ability-to-complete-long-tasks/ |
| 38 | [GPT-4 (Jun 2023)](https://quelleia.com/modeles/gpt-4-jun-2023.md) | OpenAI | non précisée | 29,3 % | 42,3 | https://epoch.ai/benchmarks |
| 39 | [GPT-3.5 Turbo Instruct](https://quelleia.com/modeles/gpt-3-5-turbo-instruct.md) | OpenAI | non précisée | 21,5 % | 33,0 | https://metr.org/blog/2025-03-19-measuring-ai-ability-to-complete-long-tasks/ |
| 40 | [GPT-3 175B (davinci)](https://quelleia.com/modeles/gpt-3-175b-davinci.md) | OpenAI | non précisée | 16,2 % | 25,3 | https://metr.org/blog/2025-03-19-measuring-ai-ability-to-complete-long-tasks/ |
| 41 | [GPT-2 (1.5B)](https://quelleia.com/modeles/gpt-2-1-5b.md) | OpenAI | non précisée | 10,1 % | 13,2 | https://metr.org/blog/2025-03-19-measuring-ai-ability-to-complete-long-tasks/ |

## En bref

**Que mesure METR Time Horizons (taux de réussite) ?** Des tâches de logiciel, d'apprentissage automatique et de cybersécurité, dont on connaît la durée pour un professionnel humain. Sur Quelle IA, il est rangé dans la tâche Agents.

**Comment METR Time Horizons (taux de réussite) est-il noté ?** Score moyen de réussite, de 0 à 1, sur l'ensemble des tâches de METR ; c'est la valeur qu'Epoch retient pour son indice. Un modèle qui obtient 50 % a un score IA d'environ 62.

**Qui est en tête sur METR Time Horizons (taux de réussite) ?** Claude Mythos Preview (Anthropic) est en tête de METR Time Horizons (taux de réussite) avec 85,2 %, dans l'édition du 28 septembre 2026. Suivent Claude Opus 4.6 (78,9 %) et Gemini 3.1 Pro (77 %). 41 modèles y sont mesurés.

**Quelles sont les limites de METR Time Horizons (taux de réussite) ?** Ce score moyen est moins parlant que l'horizon en minutes publié par METR. Les tâches sont propres et bien définies, loin du désordre d'un vrai poste. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse METR Time Horizons (taux de réussite) dans le score IA ?** METR Time Horizons (taux de réussite) compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.

**Qui maintient METR Time Horizons (taux de réussite) ?** METR. Sa page de référence : metr.org/time-horizons.

## Les autres benchmarks de la tâche Agents

- [Vending-Bench 2](https://quelleia.com/benchmarks/vending_bench_2.md) : 56 modèles · 1,67 % du score
- [BALROG](https://quelleia.com/benchmarks/balrog.md) : 37 modèles · 1,67 % du score
- [APEX-Agents](https://quelleia.com/benchmarks/apex_agents.md) : 34 modèles · 1,67 % du score
- [DeepResearch Bench](https://quelleia.com/benchmarks/deepresearch_bench.md) : 24 modèles · 1,67 % du score
- [EBR-bench (Earthborne Rangers)](https://quelleia.com/benchmarks/ebr_bench.md) : 23 modèles · 1,67 % du score
- [Remote Labor Index](https://quelleia.com/benchmarks/remote_labor_index.md) : 13 modèles · 1,67 % du score
- [PostTrainBench](https://quelleia.com/benchmarks/posttrainbench.md) : 11 modèles · 1,67 % du score
- [OSWorld 2.0](https://quelleia.com/benchmarks/osworld_2.md) : 9 modèles · 1,67 % du score
- [TheAgentCompany](https://quelleia.com/benchmarks/the_agent_company.md) : 14 modèles · hors score, archivé
- [GDPval](https://quelleia.com/benchmarks/gdpval.md) : 11 modèles · hors score, archivé
- [OSWorld](https://quelleia.com/benchmarks/osworld.md) : 9 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
