Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

AgentsFiche benchmark · Center for AI Safety et Scale AI · remotelabor.ai

Remote Labor Index

240 vraies missions de freelance (développement, design, architecture, analyse de données, animation vidéo) à livrer de bout en bout.

À quoi il sert

Sur Quelle IA, Remote Labor Index sert à noter la tâche Agents : c'est l'un de ses 9 benchmarks.

Comment c'est noté

Part de missions dont le livrable serait accepté par un client, au niveau attendu d'un professionnel payé.

Ce qu'il ne dit pas

Scores très bas, 21 % au mieux, donc peu de nuances entre modèles. Une quinzaine de modèles seulement.

Qui le tient

Center for AI Safety et Scale AI.

remotelabor.ai · tâche Agents · 13 modèles mesurés

Comment lire le score

13 modèles mesurés · 15 mesures

En tête : GPT-6 Astra, 20,8 %

Chaque trait est un modèle, placé à son meilleur score. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 23 %. Le meilleur, GPT-6 Astra, atteint 20,8 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
moins de 1 %
Score IA 76niveau de Claude Sonnet 4.5
moins de 1 %
Score IA 100niveau de Claude Opus 5.5
23 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,67 %du score général. Remote Labor Index porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.

En couleur, la tâche Agents dans le score général. En noir, la part de Remote Labor Index.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1GPT-6 AstraOpenAINon précisée20,8 %98,8
2Claude Fable 5.1AnthropicNon précisée17,9 %97,6
3Claude Fable 5Anthropic · 2 configurationsNon précisée16,1 %96,7
4Claude Opus 4.8AnthropicNon précisée8,3 %91,7
5GPT-5.5OpenAINon précisée6,3 %89,6
6Gemini 3.7 FlashGoogle DeepMindNon précisée5 %88,0
7Claude Opus 4.6AnthropicNon précisée4,2 %86,7
8Claude Opus 4.5AnthropicNon précisée3,8 %85,9
9GPT-5.2OpenAI · 2 configurationsMoyenne2,5 %83,1
10Claude Sonnet 4.5AnthropicNon précisée2,1 %81,8
13 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.Voir les 13 →Replier le classement ↑
11GPT-5OpenAINon précisée1,7 %80,3
12Gemini 3 ProGoogle DeepMindNon précisée1,3 %78,3
13Gemini 2.5 Pro (Jun 2025)Google DeepMindNon précisée0,8 %76,8

En bref

Que mesure Remote Labor Index ?
240 vraies missions de freelance (développement, design, architecture, analyse de données, animation vidéo) à livrer de bout en bout. Sur Quelle IA, il est rangé dans la tâche Agents.
Comment Remote Labor Index est-il noté ?
Part de missions dont le livrable serait accepté par un client, au niveau attendu d'un professionnel payé. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 23 %.
Qui est en tête sur Remote Labor Index ?
GPT-6 Astra (OpenAI) est en tête de Remote Labor Index avec 20,8 %, dans l'édition du 28 septembre 2026. Suivent Claude Fable 5.1 (17,9 %) et Claude Fable 5 (16,1 %). 13 modèles y sont mesurés.
Quelles sont les limites de Remote Labor Index ?
Scores très bas, 21 % au mieux, donc peu de nuances entre modèles. Une quinzaine de modèles seulement. Au 28 septembre 2026, le benchmark est actif.
Combien pèse Remote Labor Index dans le score IA ?
Remote Labor Index compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.
Qui maintient Remote Labor Index ?
Center for AI Safety et Scale AI. Sa page de référence : remotelabor.ai.

Les autres benchmarks de la tâche Agents

Tous les benchmarks →Comment le score IA est calculé →