# OSWorld

> Fiche du benchmark OSWorld sur Quelle IA, édition du 28 septembre 2026. Accomplir des tâches sur un vrai ordinateur : manipuler des fichiers, régler une application, enchaîner plusieurs logiciels. En tête au 28 septembre 2026 : Claude Sonnet 4.6 (72,1 %). Notation, limites et classement des 9 modèles mesurés.

Page : https://quelleia.com/benchmarks/osworld/
Source du benchmark : https://os-world.github.io/
Mainteneur : XLANG Lab (université de Hong Kong)
Tâche : Agents
État : archivé

## À quoi il sert

OSWorld servait à noter la tâche Agents. Archivé faute de modèle récent mesuré, il ne sert plus qu'à situer les modèles plus anciens sur l'échelle commune.

## Comment c'est noté

Pourcentage des 369 tâches réussies, vérifié par script sur l'état final de la machine.

## Ce qu'il ne dit pas

Le score dépend beaucoup du harnais et du nombre d'étapes autorisées. Les meilleurs agents rejoignent le niveau humain mesuré, environ 72 %.

## Qui le tient

XLANG Lab (université de Hong Kong).

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Un modèle qui obtient 50 % a un score IA d'environ 75. Le meilleur, Claude Sonnet 4.6, atteint 72,1 %. Le benchmark est archivé, faute de modèle récent mesuré. Avec 9 modèles mesurés seulement, cet étalonnage reste fragile.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : 8 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 52 %
- Score IA 100 (niveau de Claude Opus 5.5) : 92 %

## Son poids dans le score IA

0 % du score général. OSWorld est archivé et ne compte plus : la tâche Agents (15 % du score général) repose sur 9 autres benchmarks.

## Classement (9 modèles mesurés · 20 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [Claude Sonnet 4.6](https://quelleia.com/modeles/claude-sonnet-4-6.md) | Anthropic | non précisée | 72,1 % | 85,0 | https://epoch.ai/benchmarks |
| 2 | [Claude Opus 4.5](https://quelleia.com/modeles/claude-opus-4-5.md) | Anthropic | non précisée | 66,3 % | 82,2 | https://epoch.ai/benchmarks |
| 3 | [Kimi K2.5](https://quelleia.com/modeles/kimi-k2-5.md) | Moonshot | non précisée | 63,3 % | 80,9 | https://epoch.ai/benchmarks |
| 4 | [Claude Sonnet 4.5](https://quelleia.com/modeles/claude-sonnet-4-5.md) | Anthropic | non précisée | 62,9 % | 80,7 | https://epoch.ai/benchmarks |
| 5 | [Claude Sonnet 4](https://quelleia.com/modeles/claude-sonnet-4.md) | Anthropic | non précisée | 43,9 % | 72,9 | https://epoch.ai/benchmarks |
| 6 | [Claude 3.7 Sonnet](https://quelleia.com/modeles/claude-3-7-sonnet.md) | Anthropic | non précisée | 35,8 % | 69,5 | https://epoch.ai/benchmarks |
| 7 | [computer-use-preview-2025-03-11](https://quelleia.com/modeles/computer-use-preview-2025-03-11.md) | OpenAI | non précisée | 31,3 % | 67,4 | https://epoch.ai/benchmarks |
| 8 | [o3](https://quelleia.com/modeles/o3.md) | OpenAI | Moyenne | 23 % | 63,2 | https://epoch.ai/benchmarks |
| 9 | [Qwen2.5-72B](https://quelleia.com/modeles/qwen2-5-72b.md) | Alibaba | non précisée | 5 % | 45,6 | https://epoch.ai/benchmarks |

## En bref

**Que mesure OSWorld ?** Accomplir des tâches sur un vrai ordinateur : manipuler des fichiers, régler une application, enchaîner plusieurs logiciels. Sur Quelle IA, il est rangé dans la tâche Agents.

**Comment OSWorld est-il noté ?** Pourcentage des 369 tâches réussies, vérifié par script sur l'état final de la machine. Un modèle qui obtient 50 % a un score IA d'environ 75.

**Qui est en tête sur OSWorld ?** Claude Sonnet 4.6 (Anthropic) est en tête d'OSWorld avec 72,1 %, dans l'édition du 28 septembre 2026. Suivent Claude Opus 4.5 (66,3 %) et Kimi K2.5 (63,3 %). 9 modèles y sont mesurés.

**Quelles sont les limites d'OSWorld ?** Le score dépend beaucoup du harnais et du nombre d'étapes autorisées. Les meilleurs agents rejoignent le niveau humain mesuré, environ 72 %. Au 28 septembre 2026, le benchmark est archivé.

**Combien pèse OSWorld dans le score IA ?** OSWorld compte pour 0 % du score général, dans l'édition du 28 septembre 2026. Il est archivé et ne compte plus : la tâche Agents (15 % du score général) repose sur 9 autres benchmarks.

**Qui maintient OSWorld ?** XLANG Lab (université de Hong Kong). Sa page de référence : os-world.github.io.

## Les autres benchmarks de la tâche Agents

- [Vending-Bench 2](https://quelleia.com/benchmarks/vending_bench_2.md) : 56 modèles · 1,67 % du score
- [METR Time Horizons (taux de réussite)](https://quelleia.com/benchmarks/metr_time_horizons.md) : 41 modèles · 1,67 % du score
- [BALROG](https://quelleia.com/benchmarks/balrog.md) : 37 modèles · 1,67 % du score
- [APEX-Agents](https://quelleia.com/benchmarks/apex_agents.md) : 34 modèles · 1,67 % du score
- [DeepResearch Bench](https://quelleia.com/benchmarks/deepresearch_bench.md) : 24 modèles · 1,67 % du score
- [EBR-bench (Earthborne Rangers)](https://quelleia.com/benchmarks/ebr_bench.md) : 23 modèles · 1,67 % du score
- [Remote Labor Index](https://quelleia.com/benchmarks/remote_labor_index.md) : 13 modèles · 1,67 % du score
- [PostTrainBench](https://quelleia.com/benchmarks/posttrainbench.md) : 11 modèles · 1,67 % du score
- [OSWorld 2.0](https://quelleia.com/benchmarks/osworld_2.md) : 9 modèles · 1,67 % du score
- [TheAgentCompany](https://quelleia.com/benchmarks/the_agent_company.md) : 14 modèles · hors score, archivé
- [GDPval](https://quelleia.com/benchmarks/gdpval.md) : 11 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
