Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

AgentsFiche benchmark · XLANG Lab (université de Hong Kong) · osworld-v2.xlang.ai

OSWorld 2.0

108 longues tâches sur un vrai ordinateur, dans des logiciels professionnels, qui prennent environ une heure et demie à une personne compétente.

À quoi il sert

Sur Quelle IA, OSWorld 2.0 sert à noter la tâche Agents : c'est l'un de ses 9 benchmarks.

Comment c'est noté

Part de tâches entièrement réussies avec un budget de 500 étapes ; un score partiel compte les points de contrôle validés.

Ce qu'il ne dit pas

Scores bas en tout ou rien, 31 % au mieux. Les résultats dépendent du réglage des outils et du niveau de réflexion choisi.

Comment lire le score

9 modèles mesurés · 16 mesures

En tête : Claude Opus 5, 31,4 %

Chaque trait est un modèle, placé à son meilleur score. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 46 %. Le meilleur, Claude Opus 5, atteint 31,4 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %. Avec 9 modèles mesurés seulement, cet étalonnage reste fragile.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
moins de 1 %
Score IA 76niveau de Claude Sonnet 4.5
3 %
Score IA 100niveau de Claude Opus 5.5
46 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

1,67 %du score général. OSWorld 2.0 porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.

En couleur, la tâche Agents dans le score général. En noir, la part d'OSWorld 2.0.

Le classement du benchmark

Scores relevés sur osworld-v2.xlang.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Claude Opus 5Anthropic · 5 configurationsMaximale31,4 %95,6
2GPT-5.6 SolOpenAIMaximale27,3 %94,3
3Claude Opus 4.8Anthropic · 2 configurationsMaximale20,6 %91,7
4Claude Opus 4.7Anthropic · 2 configurationsMaximale18,2 %90,7
5GPT-5.5OpenAIMaximale13 %87,9
6Claude Sonnet 4.6Anthropic · 2 configurationsMoyenne9,3 %85,3
7Kimi K2.6Moonshot · poids ouvertsNon précisée4,6 %80,2
7MiniMax-M3MiniMax · poids ouvertsNon précisée4,6 %80,2
9Qwen3.7-PlusAlibabaNon précisée2,8 %76,6

9 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

En bref

Que mesure OSWorld 2.0 ?
108 longues tâches sur un vrai ordinateur, dans des logiciels professionnels, qui prennent environ une heure et demie à une personne compétente. Sur Quelle IA, il est rangé dans la tâche Agents.
Comment OSWorld 2.0 est-il noté ?
Part de tâches entièrement réussies avec un budget de 500 étapes ; un score partiel compte les points de contrôle validés. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 46 %.
Qui est en tête sur OSWorld 2.0 ?
Claude Opus 5 (Anthropic) est en tête d'OSWorld 2.0 avec 31,4 %, dans l'édition du 28 septembre 2026. Suivent GPT-5.6 Sol (27,3 %) et Claude Opus 4.8 (20,6 %). 9 modèles y sont mesurés.
Quelles sont les limites d'OSWorld 2.0 ?
Scores bas en tout ou rien, 31 % au mieux. Les résultats dépendent du réglage des outils et du niveau de réflexion choisi. Au 28 septembre 2026, le benchmark est actif.
Combien pèse OSWorld 2.0 dans le score IA ?
OSWorld 2.0 compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.
Qui maintient OSWorld 2.0 ?
XLANG Lab (université de Hong Kong). Sa page de référence : osworld-v2.xlang.ai.

Les autres benchmarks de la tâche Agents

Tous les benchmarks →Comment le score IA est calculé →