À quoi il sert
Sur Quelle IA, OSWorld 2.0 sert à noter la tâche Agents : c'est l'un de ses 9 benchmarks.
AgentsFiche benchmark · XLANG Lab (université de Hong Kong) · osworld-v2.xlang.ai
108 longues tâches sur un vrai ordinateur, dans des logiciels professionnels, qui prennent environ une heure et demie à une personne compétente.
Sur Quelle IA, OSWorld 2.0 sert à noter la tâche Agents : c'est l'un de ses 9 benchmarks.
Part de tâches entièrement réussies avec un budget de 500 étapes ; un score partiel compte les points de contrôle validés.
Scores bas en tout ou rien, 31 % au mieux. Les résultats dépendent du réglage des outils et du niveau de réflexion choisi.
XLANG Lab (université de Hong Kong).
osworld-v2.xlang.ai · tâche Agents · 9 modèles mesurés
En tête : Claude Opus 5, 31,4 %
Chaque trait est un modèle, placé à son meilleur score. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 46 %. Le meilleur, Claude Opus 5, atteint 31,4 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %. Avec 9 modèles mesurés seulement, cet étalonnage reste fragile.
Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche
1,67 %du score général. OSWorld 2.0 porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.
En couleur, la tâche Agents dans le score général. En noir, la part d'OSWorld 2.0.
9 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.