# Remote Labor Index

> Fiche du benchmark Remote Labor Index sur Quelle IA, édition du 28 septembre 2026. 240 vraies missions de freelance (développement, design, architecture, analyse de données, animation vidéo) à livrer de bout en bout. En tête au 28 septembre 2026 : GPT-6 Astra (20,8 %). Notation, limites et classement des 13 modèles mesurés.

Page : https://quelleia.com/benchmarks/remote_labor_index/
Source du benchmark : https://www.remotelabor.ai/
Mainteneur : Center for AI Safety et Scale AI
Tâche : Agents
État : actif

## À quoi il sert

Sur Quelle IA, Remote Labor Index sert à noter la tâche Agents : c'est l'un de ses 9 benchmarks.

## Comment c'est noté

Part de missions dont le livrable serait accepté par un client, au niveau attendu d'un professionnel payé.

## Ce qu'il ne dit pas

Scores très bas, 21 % au mieux, donc peu de nuances entre modèles. Une quinzaine de modèles seulement.

## Qui le tient

Center for AI Safety et Scale AI.

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 23 %. Le meilleur, GPT-6 Astra, atteint 20,8 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : moins de 1 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : moins de 1 %
- Score IA 100 (niveau de Claude Opus 5.5) : 23 %

## Son poids dans le score IA

1,67 % du score général. Remote Labor Index porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.

## Classement (13 modèles mesurés · 15 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [GPT-6 Astra](https://quelleia.com/modeles/gpt-6-astra.md) | OpenAI | non précisée | 20,8 % | 98,8 | https://epoch.ai/benchmarks |
| 2 | [Claude Fable 5.1](https://quelleia.com/modeles/claude-fable-5-1.md) | Anthropic | non précisée | 17,9 % | 97,6 | https://epoch.ai/benchmarks |
| 3 | [Claude Fable 5](https://quelleia.com/modeles/claude-fable-5.md) | Anthropic | non précisée | 16,1 % | 96,7 | https://epoch.ai/benchmarks |
| 4 | [Claude Opus 4.8](https://quelleia.com/modeles/claude-opus-4-8.md) | Anthropic | non précisée | 8,3 % | 91,7 | https://epoch.ai/benchmarks |
| 5 | [GPT-5.5](https://quelleia.com/modeles/gpt-5-5.md) | OpenAI | non précisée | 6,3 % | 89,6 | https://epoch.ai/benchmarks |
| 6 | [Gemini 3.7 Flash](https://quelleia.com/modeles/gemini-3-7-flash.md) | Google DeepMind | non précisée | 5 % | 88,0 | https://epoch.ai/benchmarks |
| 7 | [Claude Opus 4.6](https://quelleia.com/modeles/claude-opus-4-6.md) | Anthropic | non précisée | 4,2 % | 86,7 | https://epoch.ai/benchmarks |
| 8 | [Claude Opus 4.5](https://quelleia.com/modeles/claude-opus-4-5.md) | Anthropic | non précisée | 3,8 % | 85,9 | https://epoch.ai/benchmarks |
| 9 | [GPT-5.2](https://quelleia.com/modeles/gpt-5-2.md) | OpenAI | Moyenne | 2,5 % | 83,1 | https://epoch.ai/benchmarks |
| 10 | [Claude Sonnet 4.5](https://quelleia.com/modeles/claude-sonnet-4-5.md) | Anthropic | non précisée | 2,1 % | 81,8 | https://epoch.ai/benchmarks |
| 11 | [GPT-5](https://quelleia.com/modeles/gpt-5.md) | OpenAI | non précisée | 1,7 % | 80,3 | https://epoch.ai/benchmarks |
| 12 | [Gemini 3 Pro](https://quelleia.com/modeles/gemini-3-pro.md) | Google DeepMind | non précisée | 1,3 % | 78,3 | https://epoch.ai/benchmarks |
| 13 | [Gemini 2.5 Pro (Jun 2025)](https://quelleia.com/modeles/gemini-2-5-pro-jun-2025.md) | Google DeepMind | non précisée | 0,8 % | 76,8 | https://epoch.ai/benchmarks |

## En bref

**Que mesure Remote Labor Index ?** 240 vraies missions de freelance (développement, design, architecture, analyse de données, animation vidéo) à livrer de bout en bout. Sur Quelle IA, il est rangé dans la tâche Agents.

**Comment Remote Labor Index est-il noté ?** Part de missions dont le livrable serait accepté par un client, au niveau attendu d'un professionnel payé. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 23 %.

**Qui est en tête sur Remote Labor Index ?** GPT-6 Astra (OpenAI) est en tête de Remote Labor Index avec 20,8 %, dans l'édition du 28 septembre 2026. Suivent Claude Fable 5.1 (17,9 %) et Claude Fable 5 (16,1 %). 13 modèles y sont mesurés.

**Quelles sont les limites de Remote Labor Index ?** Scores très bas, 21 % au mieux, donc peu de nuances entre modèles. Une quinzaine de modèles seulement. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse Remote Labor Index dans le score IA ?** Remote Labor Index compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.

**Qui maintient Remote Labor Index ?** Center for AI Safety et Scale AI. Sa page de référence : remotelabor.ai.

## Les autres benchmarks de la tâche Agents

- [Vending-Bench 2](https://quelleia.com/benchmarks/vending_bench_2.md) : 56 modèles · 1,67 % du score
- [METR Time Horizons (taux de réussite)](https://quelleia.com/benchmarks/metr_time_horizons.md) : 41 modèles · 1,67 % du score
- [BALROG](https://quelleia.com/benchmarks/balrog.md) : 37 modèles · 1,67 % du score
- [APEX-Agents](https://quelleia.com/benchmarks/apex_agents.md) : 34 modèles · 1,67 % du score
- [DeepResearch Bench](https://quelleia.com/benchmarks/deepresearch_bench.md) : 24 modèles · 1,67 % du score
- [EBR-bench (Earthborne Rangers)](https://quelleia.com/benchmarks/ebr_bench.md) : 23 modèles · 1,67 % du score
- [PostTrainBench](https://quelleia.com/benchmarks/posttrainbench.md) : 11 modèles · 1,67 % du score
- [OSWorld 2.0](https://quelleia.com/benchmarks/osworld_2.md) : 9 modèles · 1,67 % du score
- [TheAgentCompany](https://quelleia.com/benchmarks/the_agent_company.md) : 14 modèles · hors score, archivé
- [GDPval](https://quelleia.com/benchmarks/gdpval.md) : 11 modèles · hors score, archivé
- [OSWorld](https://quelleia.com/benchmarks/osworld.md) : 9 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
