Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

AgentsFiche benchmark · XLANG Lab (université de Hong Kong) · os-world.github.io

OSWorld

Accomplir des tâches sur un vrai ordinateur : manipuler des fichiers, régler une application, enchaîner plusieurs logiciels.

ARCHIVÉ

À quoi il sert

OSWorld servait à noter la tâche Agents. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.

Comment c'est noté

Pourcentage des 369 tâches réussies, vérifié par script sur l'état final de la machine.

Ce qu'il ne dit pas

Le score dépend beaucoup du harnais et du nombre d'étapes autorisées. Les meilleurs agents rejoignent le niveau humain mesuré, environ 72 %.

Comment lire le score

9 modèles mesurés · 20 mesures

En tête : Claude Sonnet 4.6, 72,1 %

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 75. Le meilleur, Claude Sonnet 4.6, atteint 72,1 %. Le benchmark est archivé, faute de modèle récent mesuré. Avec 9 modèles mesurés seulement, cet étalonnage reste fragile.

Ce que ce benchmark attend à chaque niveau

Score IA 51niveau de GPT-4o (Nov 2024)
8 %
Score IA 76niveau de Claude Sonnet 4.5
52 %
Score IA 100niveau de Claude Opus 5.5
92 %

Valeurs lues sur la courbe d'étalonnage du benchmark, qui relie le score publié au score IA. La démarche

Son poids chez nous

0 %du score général. OSWorld est archivé et ne compte plus : la tâche Agents (15 % du score général) repose sur 9 autres benchmarks.

En couleur, la tâche Agents dans le score général. OSWorld n'y a plus de part.

Le classement du benchmark

Scores relevés sur epoch.ai · édition du
RangModèleRéflexionScore publiéSuggèreSource
1Claude Sonnet 4.6AnthropicNon précisée · claude-sonnet-4-6 (100 steps)72,1 %85,0
2Claude Opus 4.5AnthropicNon précisée · Claude Opus 4.566,3 %82,2
3Kimi K2.5Moonshot · poids ouvertsNon précisée · Kimi-K2.563,3 %80,9
4Claude Sonnet 4.5Anthropic · 3 configurationsNon précisée · claude-sonnet-4-5-20250929 (100 steps)62,9 %80,7
5Claude Sonnet 4Anthropic · 3 configurationsNon précisée · claude-4-sonnet-20250514 (50 steps)43,9 %72,9
6Claude 3.7 SonnetAnthropic · 3 configurationsNon précisée · claude-3-7-sonnet-20250219 (50 steps)35,8 %69,5
7computer-use-preview-2025-03-11OpenAI · 3 configurationsNon précisée · computer-use-preview (50 steps)31,3 %67,4
8o3OpenAI · 3 configurationsMoyenne · o3 (100 steps)23 %63,2
9Qwen2.5-72BAlibaba · poids ouverts · 2 configurationsNon précisée · qwen2.5-vl-72b-instruct (100 steps)5 %45,6

9 modèles mesurés, chacun à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

En bref

Que mesure OSWorld ?
Accomplir des tâches sur un vrai ordinateur : manipuler des fichiers, régler une application, enchaîner plusieurs logiciels. Sur Quelle IA, il est rangé dans la tâche Agents.
Comment OSWorld est-il noté ?
Pourcentage des 369 tâches réussies, vérifié par script sur l'état final de la machine. Un modèle qui obtient 50 % a un score IA d'environ 75.
Qui est en tête sur OSWorld ?
Claude Sonnet 4.6 (Anthropic) est en tête d'OSWorld avec 72,1 %, dans l'édition du 28 septembre 2026. Suivent Claude Opus 4.5 (66,3 %) et Kimi K2.5 (63,3 %). 9 modèles y sont mesurés.
Quelles sont les limites d'OSWorld ?
Le score dépend beaucoup du harnais et du nombre d'étapes autorisées. Les meilleurs agents rejoignent le niveau humain mesuré, environ 72 %. Au 28 septembre 2026, le benchmark est archivé.
Combien pèse OSWorld dans le score IA ?
OSWorld compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est archivé et ne compte plus : la tâche Agents (15 % du score général) repose sur 9 autres benchmarks.
Qui maintient OSWorld ?
XLANG Lab (université de Hong Kong). Sa page de référence : os-world.github.io.

Les autres benchmarks de la tâche Agents

Tous les benchmarks →Comment le score IA est calculé →