{
 "source": "Quelle IA",
 "site": "https://quelleia.com/",
 "edition": "2026-W40",
 "date": "2026-09-28",
 "citation": "Source : Quelle IA, édition du 28 septembre 2026, quelleia.com",
 "methode": "0.1",
 "termes": [
  {
   "id": "benchmark",
   "nom": "Benchmark",
   "definition": "Une série d'épreuves identiques pour tous les modèles, qui donne un score comparable.",
   "exemple": "Le plus suivi des 98 benchmarks du site, Arena, texte, a mesuré 277 modèles.",
   "url": "https://quelleia.com/glossaire/#benchmark"
  },
  {
   "id": "score-ia",
   "nom": "Score IA",
   "definition": "L'estimation du niveau d'un modèle, calculée à partir de tous les benchmarks où il a été mesuré.",
   "exemple": "Il vaut 100 pour Claude Opus 5.5, le meilleur modèle au lancement du site, et 50 pour GPT-4o (Nov 2024). Une absence de mesure ne vaut jamais zéro.",
   "url": "https://quelleia.com/glossaire/#score-ia"
  },
  {
   "id": "marge",
   "nom": "Marge d'erreur",
   "definition": "L'intervalle où le vrai niveau du modèle a neuf chances sur dix de se trouver.",
   "exemple": "Claude Opus 5.5 obtient 99,9, avec une marge de 98,6 à 101,2.",
   "url": "https://quelleia.com/glossaire/#marge"
  },
  {
   "id": "couverture",
   "nom": "Couverture",
   "definition": "La part des tâches sur lesquelles le modèle a été mesuré.",
   "exemple": "Claude Sonnet 5.5 est mesuré sur 7 des 10 tâches, qui pèsent 75 % du score général.",
   "url": "https://quelleia.com/glossaire/#couverture"
  },
  {
   "id": "reflexion",
   "nom": "Réflexion",
   "definition": "Le temps de calcul que le modèle prend pour raisonner avant de répondre. Plus il réfléchit, mieux il répond et plus il coûte.",
   "exemple": "Claude Opus 5.5 se règle sur cinq niveaux de réflexion, de « faible » à « maximale ».",
   "url": "https://quelleia.com/glossaire/#reflexion"
  },
  {
   "id": "harnais",
   "nom": "Harnais",
   "definition": "L'outil qui entoure le modèle et lui donne des moyens d'agir, comme lire des fichiers ou lancer des commandes.",
   "exemple": "Les plus utilisés dans les mesures de cette édition : mini-SWE-agent, OpenHands et Terminus 2.",
   "url": "https://quelleia.com/glossaire/#harnais"
  },
  {
   "id": "poids-ouverts",
   "nom": "Poids ouverts",
   "definition": "Le modèle se télécharge et peut tourner sur votre propre machine. À poids fermés, il ne s'utilise que par le service de son éditeur.",
   "exemple": "120 des 246 modèles classés ont des poids ouverts. Le mieux classé est MiMo-V2.6-Pro, au rang 13.",
   "url": "https://quelleia.com/glossaire/#poids-ouverts"
  },
  {
   "id": "version-allegee",
   "nom": "Version allégée",
   "definition": "Une copie compressée du modèle, qui tient dans moins de mémoire au prix d'une légère perte de qualité.",
   "exemple": "DeepSeek V4.1 Flash pèse 1 269,6 Go en version complète et 380,9 Go en version allégée à 4 bits.",
   "url": "https://quelleia.com/glossaire/#version-allegee"
  },
  {
   "id": "memoire-utile",
   "nom": "Mémoire utile",
   "definition": "La part de la mémoire d'une machine qu'un modèle peut vraiment occuper, une fois servis le système et l'affichage. C'est elle qui décide de ce qui tient.",
   "exemple": "Sur une carte graphique de 16 Go, nous comptons 14,0 Go utiles ; sur un Mac de 24 Go, 17,8 Go.",
   "url": "https://quelleia.com/glossaire/#memoire-utile"
  },
  {
   "id": "memoire-unifiee",
   "nom": "Mémoire unifiée",
   "definition": "Une seule mémoire partagée par le processeur et le processeur graphique, comme sur un Mac ou un DGX Spark. Il y en a beaucoup, mais elle est plus lente que la mémoire d'une carte graphique.",
   "exemple": "Un Mac de 24 Go en compte 17,8 Go utiles, un DGX Spark 112,0 Go.",
   "url": "https://quelleia.com/glossaire/#memoire-unifiee"
  },
  {
   "id": "jeton",
   "nom": "Jeton",
   "definition": "Le morceau de mot que le modèle lit et écrit. Les prix se comptent par million de jetons.",
   "exemple": "Claude Opus 5.5 coûte 4,00 € par million de jetons lus et 20,0 € par million de jetons écrits.",
   "url": "https://quelleia.com/glossaire/#jeton"
  },
  {
   "id": "contexte",
   "nom": "Fenêtre de contexte",
   "definition": "La quantité de texte que le modèle peut garder en tête pendant une conversation.",
   "exemple": "Claude Opus 5.5 garde 1 000 000 jetons en tête, soit environ 750 000 mots.",
   "url": "https://quelleia.com/glossaire/#contexte"
  },
  {
   "id": "elo",
   "nom": "Elo",
   "definition": "Un score issu de duels, comme aux échecs. Battre un modèle fort rapporte plus que battre un modèle faible.",
   "exemple": "9 benchmarks du site notent en Elo, dont Arena, texte.",
   "url": "https://quelleia.com/glossaire/#elo"
  },
  {
   "id": "saturation",
   "nom": "Saturation",
   "definition": "Un benchmark est saturé quand les meilleurs modèles y obtiennent presque le maximum.",
   "exemple": "8 benchmarks sont saturés dans cette édition, dont OTIS Mock AIME 2024-2025, où le meilleur modèle atteint 100 %. Les meilleurs ne s'y départagent plus.",
   "url": "https://quelleia.com/glossaire/#saturation"
  },
  {
   "id": "contamination",
   "nom": "Contamination",
   "definition": "Les questions d'un test ont circulé, et un modèle a pu les apprendre par cœur.",
   "exemple": "Sur TriviaQA, la fiche du benchmark le signale : « Test de 2017, largement mémorisé par les modèles ».",
   "url": "https://quelleia.com/glossaire/#contamination"
  },
  {
   "id": "agent",
   "nom": "Agent",
   "definition": "Un modèle qui enchaîne seul plusieurs actions pour mener une tâche à bien.",
   "exemple": "La tâche Agents repose sur 9 benchmarks actifs, dont Vending-Bench 2.",
   "url": "https://quelleia.com/glossaire/#agent"
  },
  {
   "id": "etalonnage",
   "nom": "Étalonnage",
   "definition": "Le calcul de la difficulté de chaque benchmark, qui permet de comparer des tests différents.",
   "exemple": "Pour Claude Opus 5.5, 31,2 % sur WeirdML v3 suggère un niveau de 98,6, quand 100 % sur OTIS Mock AIME 2024-2025, plus facile, suggère 93,8.",
   "url": "https://quelleia.com/glossaire/#etalonnage"
  },
  {
   "id": "ex-aequo",
   "nom": "Ex æquo",
   "definition": "Deux modèles sont ex æquo quand leurs marges d'erreur se recouvrent. L'écart entre eux est trop petit pour les départager.",
   "exemple": "Claude Opus 5.5, GPT-6 Astra et Claude Sonnet 5.5 partagent la première place de cette édition.",
   "url": "https://quelleia.com/glossaire/#ex-aequo"
  },
  {
   "id": "provisoire",
   "nom": "Provisoire",
   "definition": "Un score est provisoire tant qu'il repose sur trop peu de mesures pour donner un rang : moins de 4 mesures, moins de 50 % du poids des tâches couvert, ou moins de 2 sources indépendantes.",
   "exemple": "194 des 592 modèles notés ont un score provisoire dans cette édition.",
   "url": "https://quelleia.com/glossaire/#provisoire"
  },
  {
   "id": "historique",
   "nom": "Score historique",
   "definition": "Le score d'un ancien modèle que plus aucun benchmark actif ne mesure. Il reste affiché pour mémoire, sans rang.",
   "exemple": "152 modèles ont un score historique dans cette édition, dont InstructGPT 175B.",
   "url": "https://quelleia.com/glossaire/#historique"
  },
  {
   "id": "archive",
   "nom": "Archivé",
   "definition": "Un benchmark est archivé quand il n'a plus mesuré de modèle récent depuis six mois. Il sort du calcul du score.",
   "exemple": "33 benchmarks sur 98 sont archivés, dont MMLU.",
   "url": "https://quelleia.com/glossaire/#archive"
  },
  {
   "id": "niveau-suggere",
   "nom": "Niveau suggéré",
   "definition": "Le score IA qu'une mesure donnerait au modèle si elle était seule, compte tenu de la difficulté du benchmark. Le score général fait la synthèse de tous ces niveaux.",
   "exemple": "Pour Claude Opus 5.5, 91,2 % sur FrontierMath, paliers 1 à 3 (v2) suggère un niveau de 99,7. Son score général est de 99,9.",
   "url": "https://quelleia.com/glossaire/#niveau-suggere"
  }
 ]
}
