À quoi il sert
OSWorld servait à noter la tâche Agents. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.
AgentsFiche benchmark · XLANG Lab (université de Hong Kong) · os-world.github.io
Accomplir des tâches sur un vrai ordinateur : manipuler des fichiers, régler une application, enchaîner plusieurs logiciels.
OSWorld servait à noter la tâche Agents. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.
Pourcentage des 369 tâches réussies, vérifié par script sur l'état final de la machine.
Le score dépend beaucoup du harnais et du nombre d'étapes autorisées. Les meilleurs agents rejoignent le niveau humain mesuré, environ 72 %.
XLANG Lab (université de Hong Kong).
os-world.github.io · tâche Agents · 9 modèles mesurés
En tête : Claude Sonnet 4.6, 72,1 %
Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 75. Le meilleur, Claude Sonnet 4.6, atteint 72,1 %. Le benchmark est archivé, faute de modèle récent mesuré. Avec 9 modèles mesurés seulement, cet étalonnage reste fragile.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
0 %du score général. OSWorld est archivé et ne compte plus : la tâche Agents (15 % du score général) repose sur 9 autres benchmarks.
En couleur, la tâche Agents dans le score général. OSWorld n'y a plus de part.
9 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.