À quoi il sert
Sur Quelle IA, METR Time Horizons (taux de réussite) sert à noter la tâche Agents : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 62.
Sur Quelle IA, METR Time Horizons (taux de réussite) sert à noter la tâche Agents : c'est l'un de ses 9 benchmarks. Il départage surtout les modèles dont le score IA approche 62.
Score moyen de réussite, de 0 à 1, sur l'ensemble des tâches de METR ; c'est la valeur qu'Epoch retient pour son indice.
Ce score moyen est moins parlant que l'horizon en minutes publié par METR. Les tâches sont propres et bien définies, loin du désordre d'un vrai poste.
METR.
metr.org/time-horizons · tâche Agents · 41 modèles mesurés
En tête : Claude Mythos Preview, 85,2 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 62. Le meilleur, Claude Mythos Preview, atteint 85,2 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
1,67 %du score général. METR Time Horizons (taux de réussite) porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.
En couleur, la tâche Agents dans le score général. En noir, la part de METR Time Horizons (taux de réussite).