# OSWorld 2.0

> Fiche du benchmark OSWorld 2.0 sur Quelle IA, édition du 28 septembre 2026. 108 longues tâches sur un vrai ordinateur, dans des logiciels professionnels, qui prennent environ une heure et demie à une personne compétente. En tête au 28 septembre 2026 : Claude Opus 5 (31,4 %). Notation, limites et classement des 9 modèles mesurés.

Page : https://quelleia.com/benchmarks/osworld_2/
Source du benchmark : https://osworld-v2.xlang.ai/
Mainteneur : XLANG Lab (université de Hong Kong)
Tâche : Agents
État : actif

## À quoi il sert

Sur Quelle IA, OSWorld 2.0 sert à noter la tâche Agents : c'est l'un de ses 9 benchmarks.

## Comment c'est noté

Part de tâches entièrement réussies avec un budget de 500 étapes ; un score partiel compte les points de contrôle validés.

## Ce qu'il ne dit pas

Scores bas en tout ou rien, 31 % au mieux. Les résultats dépendent du réglage des outils et du niveau de réflexion choisi.

## Qui le tient

XLANG Lab (université de Hong Kong).

## Comment lire le score

Chaque trait est un modèle, placé à son meilleur score. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 46 %. Le meilleur, Claude Opus 5, atteint 31,4 %. Le benchmark sera dit saturé quand un modèle atteindra 95 %. Avec 9 modèles mesurés seulement, cet étalonnage reste fragile.

Ce que le benchmark attend à chaque niveau, d'après sa courbe d'étalonnage :

- Score IA 51 (niveau de GPT-4o (Nov 2024)) : moins de 1 %
- Score IA 76 (niveau de Claude Sonnet 4.5) : 3 %
- Score IA 100 (niveau de Claude Opus 5.5) : 46 %

## Son poids dans le score IA

1,67 % du score général. OSWorld 2.0 porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.

## Classement (9 modèles mesurés · 16 mesures, édition du 28 septembre 2026)

Un modèle par ligne, à sa meilleure configuration. « Suggère » : le score IA que cette seule mesure indique.

| Rang | Modèle | Éditeur | Réflexion | Score publié | Suggère | Source |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | [Claude Opus 5](https://quelleia.com/modeles/claude-opus-5.md) | Anthropic | Maximale | 31,4 % | 95,6 | https://osworld-v2.xlang.ai/ |
| 2 | [GPT-5.6 Sol](https://quelleia.com/modeles/gpt-5-6-sol.md) | OpenAI | Maximale | 27,3 % | 94,3 | https://osworld-v2.xlang.ai/ |
| 3 | [Claude Opus 4.8](https://quelleia.com/modeles/claude-opus-4-8.md) | Anthropic | Maximale | 20,6 % | 91,7 | https://osworld-v2.xlang.ai/ |
| 4 | [Claude Opus 4.7](https://quelleia.com/modeles/claude-opus-4-7.md) | Anthropic | Maximale | 18,2 % | 90,7 | https://osworld-v2.xlang.ai/ |
| 5 | [GPT-5.5](https://quelleia.com/modeles/gpt-5-5.md) | OpenAI | Maximale | 13 % | 87,9 | https://osworld-v2.xlang.ai/ |
| 6 | [Claude Sonnet 4.6](https://quelleia.com/modeles/claude-sonnet-4-6.md) | Anthropic | Moyenne | 9,3 % | 85,3 | https://osworld-v2.xlang.ai/ |
| 7 | [Kimi K2.6](https://quelleia.com/modeles/kimi-k2-6.md) | Moonshot | non précisée | 4,6 % | 80,2 | https://osworld-v2.xlang.ai/ |
| 7 | [MiniMax-M3](https://quelleia.com/modeles/minimax-m3.md) | MiniMax | non précisée | 4,6 % | 80,2 | https://osworld-v2.xlang.ai/ |
| 9 | [Qwen3.7-Plus](https://quelleia.com/modeles/qwen3-7-plus.md) | Alibaba | non précisée | 2,8 % | 76,6 | https://osworld-v2.xlang.ai/ |

## En bref

**Que mesure OSWorld 2.0 ?** 108 longues tâches sur un vrai ordinateur, dans des logiciels professionnels, qui prennent environ une heure et demie à une personne compétente. Sur Quelle IA, il est rangé dans la tâche Agents.

**Comment OSWorld 2.0 est-il noté ?** Part de tâches entièrement réussies avec un budget de 500 étapes ; un score partiel compte les points de contrôle validés. Le test reste très dur : d'après sa courbe d'étalonnage, même un modèle de score IA 100 n'y obtient qu'environ 46 %.

**Qui est en tête sur OSWorld 2.0 ?** Claude Opus 5 (Anthropic) est en tête d'OSWorld 2.0 avec 31,4 %, dans l'édition du 28 septembre 2026. Suivent GPT-5.6 Sol (27,3 %) et Claude Opus 4.8 (20,6 %). 9 modèles y sont mesurés.

**Quelles sont les limites d'OSWorld 2.0 ?** Scores bas en tout ou rien, 31 % au mieux. Les résultats dépendent du réglage des outils et du niveau de réflexion choisi. Au 28 septembre 2026, le benchmark est actif.

**Combien pèse OSWorld 2.0 dans le score IA ?** OSWorld 2.0 compte pour 1,67 % du score général, dans l'édition du 28 septembre 2026. Il porte 11 % de la tâche Agents (15 % du score général), que se partagent 9 benchmarks.

**Qui maintient OSWorld 2.0 ?** XLANG Lab (université de Hong Kong). Sa page de référence : osworld-v2.xlang.ai.

## Les autres benchmarks de la tâche Agents

- [Vending-Bench 2](https://quelleia.com/benchmarks/vending_bench_2.md) : 56 modèles · 1,67 % du score
- [METR Time Horizons (taux de réussite)](https://quelleia.com/benchmarks/metr_time_horizons.md) : 41 modèles · 1,67 % du score
- [BALROG](https://quelleia.com/benchmarks/balrog.md) : 37 modèles · 1,67 % du score
- [APEX-Agents](https://quelleia.com/benchmarks/apex_agents.md) : 34 modèles · 1,67 % du score
- [DeepResearch Bench](https://quelleia.com/benchmarks/deepresearch_bench.md) : 24 modèles · 1,67 % du score
- [EBR-bench (Earthborne Rangers)](https://quelleia.com/benchmarks/ebr_bench.md) : 23 modèles · 1,67 % du score
- [Remote Labor Index](https://quelleia.com/benchmarks/remote_labor_index.md) : 13 modèles · 1,67 % du score
- [PostTrainBench](https://quelleia.com/benchmarks/posttrainbench.md) : 11 modèles · 1,67 % du score
- [TheAgentCompany](https://quelleia.com/benchmarks/the_agent_company.md) : 14 modèles · hors score, archivé
- [GDPval](https://quelleia.com/benchmarks/gdpval.md) : 11 modèles · hors score, archivé
- [OSWorld](https://quelleia.com/benchmarks/osworld.md) : 9 modèles · hors score, archivé

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
