Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

AgentsFiche benchmark · METR · metr.org

METR Time Horizons (taux de réussite)

Des tâches de logiciel, d'apprentissage automatique et de cybersécurité, dont on connaît la durée pour un professionnel humain.

À quoi il sert

Sur Quelle IA, METR Time Horizons (taux de réussite) sert à noter la tâche Agents : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 62.

Comment c'est noté

Score moyen de réussite, de 0 à 1, sur l'ensemble des tâches de METR ; c'est la valeur qu'Epoch retient pour son indice.

Ce qu'il ne dit pas

Ce score moyen est moins parlant que l'horizon en minutes publié par METR. Les tâches sont propres et bien définies, loin du désordre d'un vrai poste.

Comment lire le score

41 modèles mesurés · 50 mesures

En tête : Claude Mythos Preview, 85,2 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 62. Le meilleur, Claude Mythos Preview, atteint 85,2 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
38 %
Score IA 76niveau de Claude Sonnet 4.5
66 %
Score IA 100niveau de Claude Opus 5.5
85 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,67 %du score général. METR Time Horizons (taux de réussite) porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.

En couleur, la tâche Agents dans le score général. En noir, la part de METR Time Horizons (taux de réussite).

Le classement du benchmark

Scores relevés auprès de 2 sources · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Claude Mythos PreviewAnthropicNon précisée85,2 %101,1
2Claude Opus 4.6AnthropicNon précisée78,9 %91,4
3Gemini 3.1 ProGoogle DeepMindNon précisée77 %89,1
4GPT-5.2OpenAIÉlevée75,3 %86,9
5Claude Opus 4.5Anthropic · 2 configurationsBudget75 %86,5
6GPT-5.3 CodexOpenAINon précisée74,5 %86,0
7GPT-5.4OpenAI · 2 configurationsNon précisée74,3 %85,8
8Gemini 3 ProGoogle DeepMindNon précisée71 %82,0
9GPT-5.1-Codex-MaxOpenAINon précisée70,8 %81,8
10GPT-5OpenAI · 2 configurationsMoyenne69,6 %80,5
41 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 41 →Replier le classement ↑
11Claude Sonnet 4.5AnthropicBudget67,4 %78,2
12Claude Opus 4.1Anthropic · 2 configurationsBudget66,8 %77,6
13Grok 4xAINon précisée66,6 %77,4
14o3OpenAI · 2 configurationsMoyenne65,4 %76,3
15Claude Opus 4Anthropic · 2 configurationsBudget63,9 %74,8
16o4-miniOpenAIMoyenne63,9 %74,8
17Claude Sonnet 4AnthropicBudget62 %72,9
18Claude 3.7 SonnetAnthropic · 2 configurationsBudget60 %71,0
19Kimi K2 ThinkingMoonshot · poids ouvertsNon précisée59,2 %70,3
20gpt-oss-120bOpenAI · poids ouvertsNon précisée56,6 %68,0
21Gemini 2.5 Pro (Jun 2025)Google DeepMindNon précisée55,4 %66,9
22DeepSeek-R1 (May 2025)DeepSeek · poids ouvertsNon précisée53,8 %65,4
23DeepSeek-R1DeepSeek · poids ouvertsNon précisée51,9 %63,7
24o1OpenAIMoyenne51,1 %63,0
25DeepSeek-V3 (Mar 2025)DeepSeek · poids ouvertsNon précisée49,6 %61,6
26DeepSeek-V3DeepSeek · poids ouvertsNon précisée47,4 %59,7
27Claude 3.5 Sonnet (October 2024)AnthropicNon précisée45,2 %57,7
28o1-previewOpenAINon précisée45,1 %57,7
29GPT-4o (Nov 2024)OpenAINon précisée40,8 %53,7
30Claude 3.5 SonnetAnthropicNon précisée40,2 %53,1
31GPT-4 Turbo (Apr 2024)OpenAINon précisée36,7 %49,9
32GPT-4 (Mar 2023)OpenAINon précisée36,1 %49,3
33Qwen2.5-72BAlibaba · poids ouvertsNon précisée35,8 %48,9
34GPT-4 Turbo (Nov 2023)OpenAI · 3 configurationsNon précisée35,2 %48,4
35GPT-4o (Aug 2024)OpenAINon précisée33,8 %47,0
36Qwen2-72BAlibaba · poids ouvertsNon précisée29,9 %43,0
37Claude 3 OpusAnthropicNon précisée29,5 %42,5
38GPT-4 (Jun 2023)OpenAINon précisée29,3 %42,3
39GPT-3.5 Turbo InstructOpenAINon précisée21,5 %33,0
40GPT-3 175B (davinci)OpenAINon précisée16,2 %25,3
41GPT-2 (1.5B)OpenAI · poids ouvertsNon précisée10,1 %13,2

En bref

Que mesure METR Time Horizons (taux de réussite) ?
Des tâches de logiciel, d'apprentissage automatique et de cybersécurité, dont on connaît la durée pour un professionnel humain. Sur Quelle IA, il est rangé dans la tâche Agents.
Comment METR Time Horizons (taux de réussite) est-il noté ?
Score moyen de réussite, de 0 à 1, sur l'ensemble des tâches de METR ; c'est la valeur qu'Epoch retient pour son indice. Un modèle qui obtient 50 % a un score IA d'environ 62.
Qui est en tête sur METR Time Horizons (taux de réussite) ?
Claude Mythos Preview (Anthropic) est en tête de METR Time Horizons (taux de réussite) avec 85,2 %, dans l'édition du 28 septembre 2026. Suivent Claude Opus 4.6 (78,9 %) et Gemini 3.1 Pro (77 %). 41 modèles y sont mesurés.
Quelles sont les limites de METR Time Horizons (taux de réussite) ?
Ce score moyen est moins parlant que l'horizon en minutes publié par METR. Les tâches sont propres et bien définies, loin du désordre d'un vrai poste. Au 28 septembre 2026, le benchmark est actif.
Combien pèse METR Time Horizons (taux de réussite) dans le score IA ?
METR Time Horizons (taux de réussite) compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.
Qui maintient METR Time Horizons (taux de réussite) ?
METR. Sa page de référence : metr.org/time-horizons.

Les autres benchmarks de la tâche Agents

Tous les benchmarks →Comment le score IA est calculé →