À quoi il sert
Sur Quelle IA, Remote Labor Index sert à noter la tâche Agents : c'est l'un de ses 9 benchmarks.
AgentsFiche benchmark · Center for AI Safety et Scale AI · remotelabor.ai
240 vraies missions de freelance (développement, design, architecture, analyse de données, animation vidéo) à livrer de bout en bout.
Sur Quelle IA, Remote Labor Index sert à noter la tâche Agents : c'est l'un de ses 9 benchmarks.
Part de missions dont le livrable serait accepté par un client, au niveau attendu d'un professionnel payé.
Scores très bas, 21 % au mieux, donc peu de nuances entre modèles. Une quinzaine de modèles seulement.
Center for AI Safety et Scale AI.
remotelabor.ai · tâche Agents · 13 modèles mesurés
En tête : GPT-6 Astra, 20,8 %
Chaque trait est un modèle, placé à son meilleur score. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 23 %. Le meilleur, GPT-6 Astra, atteint 20,8 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
1,67 %du score général. Remote Labor Index porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.
En couleur, la tâche Agents dans le score général. En noir, la part de Remote Labor Index.