# gpt-oss-120b

> Fiche du modèle de langage gpt-oss-120b sur Quelle IA, édition du 28 septembre 2026. gpt-oss-120b (OpenAI) : score IA de 66,2, 130e sur 246. Scores par tâche, prix, exécution locale et liens pour le télécharger ou l'essayer.

Page : https://quelleia.com/modeles/gpt-oss-120b/
Origine : OpenAI · États-Unis · sorti le 5 août 2025

## Score général

- Score IA : 66,2 (marge à 90 % : de 61,6 à 70,8)
- Rang : 130 (Groupe 10, ex æquo)
- Couverture : 90 % du poids des tâches, 30 mesures
- Échelle : 100 pour le meilleur modèle au lancement du site, 50 pour GPT-4o de novembre 2024.

## Scores par tâche

| Tâche | Score | Détail |
| --- | --- | --- |
| Raisonnement | 64,1 | Rang 86 · 56 % |
| Code | 67,8 | Rang 61 · 31 % |
| Agents | 57,6 | Provisoire · 33 % |
| Usage | 62,5 | Rang 157 · 100 % |
| Maths | 74,0 | Provisoire · 25 % |
| Sciences | 69,3 | Rang 72 · 80 % |
| Français | 58,9 | Rang 96 · 100 % |
| Vision | non mesuré | Non mesuré |
| Écriture | 58,6 | Rang 170 · 100 % |
| Web | non mesuré | Non mesuré |

## Artificial Analysis (hors du score)

Artificial Analysis évalue les modèles de son côté et publie son propre indice, l'Artificial Analysis Intelligence Index v4.3. C'est un autre indice, qui ne compte pas dans le score IA de Quelle IA et ne se compare pas directement à lui.

| Version évaluée | Indice v4.3 | Rang chez eux | Vitesse | Premier jeton | Prix par million de jetons (entrée / sortie) |
| --- | --- | --- | --- | --- | --- |
| [gpt-oss-120b (High)](https://artificialanalysis.ai/models/gpt-oss-120b) | 11,6 | 165e sur 193 | 171,8 jetons/s | 0,85 s | 0,15 $ / 0,595 $ |
| [gpt-oss-120b (Low)](https://artificialanalysis.ai/models/gpt-oss-120b-low) | 10,2 (estimé) | hors classement | 169,6 jetons/s | 0,86 s | 0,15 $ / 0,545 $ |

Médianes de leurs mesures : vitesse en jetons produits par seconde, délai avant le premier jeton en secondes. Prix en dollars par million de jetons, en entrée puis en sortie. Rang parmi les 193 modèles que leur indice classe ; un indice qu'ils estiment reste hors de ce classement. Relevé le 1er octobre 2026 sur leur site, reproduit avec leur accord.

Source : Artificial Analysis, https://artificialanalysis.ai/models/gpt-oss-120b

## Exécution locale

Tient à partir d'une carte graphique de 96 Go (94 Go utiles), en version allégée à 4 bits, par exemple une RTX PRO 6000 Blackwell. Mémoire estimée : 80,7 Go.

- Allégée, 4 bits : 80,7 Go
- Allégée, 8 bits : 141,3 Go
- Complète, 16 bits : 269,1 Go

- Plus petite machine : [Carte graphique 96 Go](https://quelleia.com/local/#carte_graphique_96_go), version allégée à 4 bits
- Carte graphique : [Carte graphique 96 Go](https://quelleia.com/local/#carte_graphique_96_go), version allégée à 4 bits ; par exemple [RTX PRO 6000 Blackwell](https://quelleia.com/local/rtx-pro-6000-blackwell/)
- PC portable RTX : Trop juste
- PC portable Intel : Trop juste
- PC portable Snapdragon : Trop juste
- Mac : [Mac 128 Go](https://quelleia.com/local/#mac_128_go), version allégée à 4 bits ; par exemple [Mac Studio M5 Max, 128 Go](https://quelleia.com/local/mac-studio-m5-max-128go/)
- Ryzen AI Max : [Ryzen AI Max 128 Go](https://quelleia.com/local/#ryzen_ai_max_128_go), version allégée à 4 bits ; par exemple [Ryzen AI Max+ 395, 128 Go](https://quelleia.com/local/ryzen-ai-max-plus-395-128go/)
- Nvidia DGX : [DGX Spark 128 Go](https://quelleia.com/local/#dgx_spark), version allégée à 4 bits ; par exemple [Nvidia DGX Spark](https://quelleia.com/local/dgx-spark/)
- Sans carte graphique : Trop juste
- Serveur : Oui

## Fiche technique

- Prix : 0,03 € / 0,16 € (entrée / sortie, par million de jetons)
- Fenêtre de contexte : 131 072 jetons (environ 98 000 mots)
- Entrées : Texte
- Réflexion : Faible, moyenne, élevée (trois niveaux réglables)
- Paramètres : 117 milliards
- Licence : Apache 2.0 (poids ouverts, téléchargeables)
- Classe énergétique : C (sur une échelle de A à G)
- Hébergement en Europe : Possible
- Connaissances jusqu'à : Non communiqué

## Où le trouver

- Télécharger : [Hugging Face](https://huggingface.co/openai/gpt-oss-120b)
- Sur votre machine : [Ollama](https://ollama.com/search?q=gpt-oss-120b)
- Sur votre machine : [LM Studio](https://lmstudio.ai)
- Par API : [OpenRouter](https://openrouter.ai/openai/gpt-oss-120b)
- Par API : [API OpenAI](https://platform.openai.com/docs)
- L'essayer : [ChatGPT](https://chatgpt.com)

## Dans les outils de code

- Disponible dans : [Devin Desktop (ex-Windsurf)](https://quelleia.com/outils/#devin-desktop) (à l'usage), [Google Antigravity](https://quelleia.com/outils/#antigravity) (inclus)
- Relevé du 30 septembre 2026 sur la page publique de chaque outil. Un modèle proposé par un outil figure dans la liste que son éditeur publie. Rien n'y est mesuré.

## Mesures

| Benchmark | Tâche | Publié | Niveau suggéré | État | Source |
| --- | --- | --- | --- | --- | --- |
| EuroEval, Allociné (sentiment) | Français | 95,8 % | 67,1 | saturé | https://euroeval.com/leaderboards/Monolingual/french/ |
| OTIS Mock AIME 2024-2025 | Maths | 88,9 % | 76,6 | saturé | https://epoch.ai/benchmarks |
| Lech Mazur Writing | Écriture | 7,71 | 65,1 | archivé | https://epoch.ai/benchmarks |
| EuroEval, ELTeC (noms propres) | Français | 73,7 % | 93,5 | actif | https://euroeval.com/leaderboards/Monolingual/french/ |
| EuroEval, INCLUDE (connaissances) | Français | 71,3 % | 73,9 | actif | https://euroeval.com/leaderboards/Monolingual/french/ |
| GPQA Diamond | Sciences | 75,8 % | 69,5 | actif | https://epoch.ai/benchmarks |
| EuroEval, FQuAD (compréhension) | Français | 63,1 % | 32,5 | actif | https://euroeval.com/leaderboards/Monolingual/french/ |
| EuroEval, HellaSwag (bon sens) | Français | 60,7 % | 52,2 | actif | https://euroeval.com/leaderboards/Monolingual/french/ |
| DTBench | Raisonnement | 76,3 % | 68,1 | saturé | https://conceptualreasoning.ai/dtbench |
| METR Time Horizons (taux de réussite) | Agents | 56,6 % | 68,0 | actif | https://epoch.ai/benchmarks |
| WeirdML (v2) | Code | 48,2 % | 73,3 | actif | https://epoch.ai/benchmarks |
| WeirdML (v2) | Code | 48,2 % | 73,3 | actif | https://epoch.ai/benchmarks |
| Arena, questions de maths | Maths | 1 381,1 Elo | 65,6 | actif | https://arena.ai/leaderboard |
| Fiction.LiveBench | Données | 44,4 % | 56,3 | archivé | https://epoch.ai/benchmarks |
| Arena, texte | Usage | 1 351,7 Elo | 58,2 | actif | https://arena.ai/leaderboard |
| EuroEval, ScaLA (grammaire) | Français | 42 % | 49,8 | actif | https://euroeval.com/leaderboards/Monolingual/french/ |
| WeirdML (v2) | Code | 41,9 % | 69,0 | actif | https://htihle.github.io/weirdml.html |
| Aider Polyglot | Code | 41,8 % | 62,3 | archivé | https://aider.chat/docs/leaderboards/ |
| Aider Polyglot | Code | 41,8 % | 62,3 | archivé | https://epoch.ai/benchmarks |
| Arena, questions de code | Code | 1 389,7 Elo | 57,4 | actif | https://arena.ai/leaderboard |
| compar:IA | Français | 960,0 Elo | 45,1 | actif | https://arene.comparia.beta.gouv.fr/ranking |
| Arena, questions d'experts | Sciences | 1 356,9 Elo | 58,0 | actif | https://arena.ai/leaderboard |
| Arena, questions en français | Français | 1 357,2 Elo | 56,2 | actif | https://arena.ai/leaderboard |
| Arena, écriture créative | Écriture | 1 277,8 Elo | 49,0 | actif | https://arena.ai/leaderboard |
| Fiction.LiveBench | Données | 36,1 % | 52,2 | archivé | https://epoch.ai/benchmarks |
| SciCode | Code | 36 % | 66,3 | actif | https://artificialanalysis.ai/evaluations/scicode |
| EuroEval, OrangeSum (résumé) | Français | 34,6 % | -9,6 | actif | https://euroeval.com/leaderboards/Monolingual/french/ |
| SciCode | Code | 34 % | 63,8 | actif | https://artificialanalysis.ai/evaluations/scicode |
| LMCA | Raisonnement | 22,14 | 64,8 | actif | https://conceptualreasoning.ai/lmca |
| EuroEval, MultiLoKo (connaissances locales) | Français | 25,9 % | 61,0 | actif | https://euroeval.com/leaderboards/Monolingual/french/ |
| Surface Evolver Bench | Sciences | 25 % | 71,2 | saturé | https://yhenon.github.io/surface-evolver-llm-eval/ |
| Terminal-Bench 2.0 | Code | 18,7 % | 66,3 | actif | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| Terminal-Bench 2.0 | Code | 18,7 % | 66,3 | actif | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| Chess Puzzles | Raisonnement | 20 % | 77,5 | actif | https://epoch.ai/benchmarks |
| Terminal-Bench 2.0 | Code | 14,2 % | 63,6 | actif | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| Terminal-Bench 2.0 | Code | 14,2 % | 63,6 | actif | https://www.tbench.ai/leaderboard/terminal-bench/2.0 |
| SimpleBench | Raisonnement | 22,1 % | 44,9 | actif | https://epoch.ai/benchmarks |
| APEX-Agents | Agents | 4,4 % | 51,4 | actif | https://epoch.ai/benchmarks |
| Vending-Bench 2 | Agents | -22 $ | -15,5 | actif | https://epoch.ai/benchmarks |
| CritPt | Sciences | 1,1 % | 62,5 | actif | https://epoch.ai/benchmarks |
| Mystery Game Puzzles | Raisonnement | 0 % | 65,7 | actif | https://epoch.ai/benchmarks |
| Mystery Game Puzzles | Raisonnement | 2 % | 65,7 | actif | https://epoch.ai/benchmarks |
| CritPt | Sciences | 0 % | 61,2 | actif | https://epoch.ai/benchmarks |

## En bref

**Quel est le score de gpt-oss-120b ?** gpt-oss-120b obtient un score IA de 66,2, avec une marge de 61,6 à 70,8, dans l'édition du 28 septembre 2026. Il est classé 130e sur 246 modèles, à partir de 30 mesures.

**Dans quelles tâches gpt-oss-120b est-il le plus fort ?** Ses deux meilleures tâches sont maths (74,0) et sciences (69,3). Sa tâche la plus faible est agents (57,6).

**gpt-oss-120b peut-il tourner en local ?** Tient à partir d'une carte graphique de 96 Go (94 Go utiles), en version allégée à 4 bits, par exemple une RTX PRO 6000 Blackwell. Mémoire estimée : 80,7 Go.

**Combien coûte gpt-oss-120b ?** 0,03 € par million de jetons en entrée et 0,16 € en sortie, au tarif affiché par les fournisseurs. Le coût réel d'une tâche dépend du nombre de jetons que le modèle consomme.

**Qui édite gpt-oss-120b ?** gpt-oss-120b est édité par OpenAI (États-Unis), et il est sorti le 5 août 2025. Ses poids sont ouverts, sous licence Apache 2.0.

Source : Quelle IA, édition du 28 septembre 2026. https://quelleia.com
