Aller au contenu
EN 4 QUESTIONSTrouver mon modèle

Famille de modèlesVérifié le · 35 modèles · 3 bancs

Modèles de décision

Un modèle de décision répond par un choix parmi des options fixées d'avance, accompagné d'une probabilité. Il ne rédige aucun texte. Ce dossier présente Jev et sa famille sans les classer : les bancs publics ont moins de quinze jours et se contredisent.

Dossier sans score

En deux minutes

Ce qu'il fait

On lui donne un texte et une ou plusieurs questions fermées. Pour chacune, il rend un choix parmi les options proposées, une note sur une grille ou un oui/non, toujours avec une probabilité.

La réponse a une forme fixe, qu'un programme lit sans avoir à l'interpréter.

Face à un modèle de langage

Un modèle de langage rédige sa réponse mot après mot. Un modèle de décision choisit parmi des options et s'arrête là. Il n'écrit rien, n'explique rien et calcule mal.

Il est conçu pour répondre plus vite et pour moins cher. TypeSafe appelle cette famille « System One », d'après Daniel Kahneman. Le terme neutre, « modèle de décision », s'installe chez Liquid AI et dans les articles de recherche.

Entrée

Le texte à juger« Ma carte a été avalée par le distributeur. »

  • ChoixQuel service ?cartevirementcompte
  • NoteQuelle urgence ?faiblemoyenneforte
  • Oui ou nonEst-ce une fraude ?
Décision typée
Service
carte
Urgence
forte
Fraude
non
Exemple fictif, pour montrer la forme d'une réponse : chaque décision arrive avec la probabilité que le modèle lui accorde, dessinée ici en barres. Ces barres ne viennent d'aucune mesure.

À quoi il sert

  • Trier classer un message, une demande, un document
  • Router envoyer une requête vers le bon service ou le bon modèle
  • Valider juger la réponse d'un autre modèle, vérifier une règle
  • Extraire choisir la bonne valeur parmi des candidats
  • Modérer repérer un contenu interdit ou une tentative de contournement

Jev, de TypeSafe AI

Sorti le 15 septembre 2026 en accès anticipé, Jev est le modèle qui a fait connaître la famille. Voici ce que l'on sait de lui, puis ce que son éditeur annonce, et ce que d'autres ont mesuré.

Jev 1.13.0Poids fermés

Jev reçoit un texte et une liste de questions fermées, et rend pour chacune un choix, une note ou un oui/non avec sa probabilité. Il ne rédige aucun texte.

Éditeur
TypeSafe AIÉtats-Unis
Sortie
15 septembre 2026Accès anticipé, sur liste d'attente
Poids
FermésPoids non publiés, accès par API. SDK Python et JavaScript sous licence MIT.
Prix déclaré, en dollars
0,042 $ par million de jetons d'entréeSoit 42 $ le milliard. La sortie est gratuite.
Entrées
Texte seulUne chaîne, un objet JSON ou une liste de textes, sans image, audio ni vidéo.
Contexte
64 000 jetons par requêteDont 32 000 pour le texte à juger et la question la plus longue
Langues
L'anglais d'abordL'éditeur écrit que les autres langues sont « handled but not equally well » et ne cite pas le français.

À savoir

  • Trois formes de question : « Choice » (une option parmi une liste, jusqu'à 255), « Score » (une note sur une grille ordonnée) et « Noul » (oui ou non).
  • Taille non publiée : l'éditeur écrit seulement que Jev « is neither small nor an LLM ».
  • Les mêmes poids servent tous les comptes, sans ajustement possible par le client.
  • Limites reconnues par l'éditeur : lecture littérale, comptage et calcul, comparaison de dates, raisonnement indirect, texte long et bruité, contenu adverse, consignes contradictoires.

Les limites, sur docs.typesafe.ai ↗

Ce que dit l'éditeur, ce que disent les tiers

25 chiffres, chacun avec sa source
Jev 1.13.0 : les chiffres déclarés par TypeSafe AI et ceux mesurés par des tiers, thème par thème
ThèmeCe que dit l'éditeurDéclaréCe que disent les tiersMesuré par un tiers
Vitesse
  • 193,6 foisplus rapide qu'un modèle de langage, dit le slogan de la page d'accueil, « based on workflows for System One tasks ». Le modèle comparé n'est pas nommé.TypeSafe AI
  • 40 à 200 foisplus rapide « for the same levels of frontier intelligence », selon le billet de lancement.TypeSafe AI
  • 70 à 500 msde temps de réponse, de bout en bout.TypeSafe AI
Prix
  • 444,6 foismoins cher qu'un modèle de langage, dit le même slogan. Le modèle comparé n'est pas nommé.TypeSafe AI
  • 238 foismoins cher à l'entrée que Claude Fable 5.1, selon la page d'accueil.TypeSafe AI
  • 0,042 $par million de jetons d'entrée. La sortie est gratuite.TypeSafe AI
  • 0,029 $les 1 000 décisions oui/non sur PubMedQA, contre 0,80 $ pour Gemini 3.8 Flash, le modèle de langage le mieux noté de l'épreuve.Jevals
Exactitude

Jev atteint « similar levels of intelligence on System One tasks compared to existing LLMs », écrit le billet de lancement. TypeSafe refuse les bancs publics : « Put no weight on public benchmarks ». typesafe.ai

  • 67,8 %d'accord avec la référence sur le banc maison de l'éditeur, moyenne de ses quatre chaînes. La référence est faite des réponses de deux modèles de langage : aucune étiquette humaine.TypeSafe AI, Workflow evalsrecalculé par Quelle IA ·
  • 72,0sur l'axe d'exactitude (« Intelligence ») de JevBench. Les modèles de langage de référence y montent jusqu'à 96,2, pour GPT-6 Luna.JevBench v1.5.4
  • 72,1de score composite (exactitude, calibration, vitesse, coût), intervalle de 71,0 à 72,6 : troisième sur 106 systèmes, derrière deux reproductions ouvertes.JevBench v1.5.4
  • 57,91d'indice corrigé du hasard sur 38 bancs publics adaptés : premier sur 71 systèmes. Les reproductions n'y répondent qu'à 76 % des requêtes, ce qui avantage Jev.Jev Decision Index 0.2.1
  • 72,5 %d'exactitude sur 200 décisions (intervalle de 66,0 à 78,5), contre 84,0 % pour Claude Fable 5.1 et 79,0 % pour GPT-6 Astra.jev-frontier-bench (M. Janardhan)
  • 76,0 %d'exactitude moyenne sur 13 jeux à étiquettes humaines (3 880 cas), contre 74,8 % pour Nimble-9B. La mesure vient de Bespoke Labs, qui édite Nimble.Bespoke Labs
  • 69,0de « Decision Score » sur PubMedQA (oui ou non), contre 73,0 pour Gemini 3.8 Flash. Le tableau complet est plus bas.Jevals
  • 14 sur 15tâches de sciences sociales où le modèle de décision est derrière le meilleur modèle de langage, avec un écart médian de 11,6 points de macro-F1 (7 977 items, 19 modèles de langage).Ibrahim et Zaki, arXiv 2609.24574
  • 0,908de F1 sur des récits d'accidents (2 416 jugements humains). Un modèle de langage de pointe fait 0,059 de mieux.Rafe et Das, arXiv 2609.24052
Fiabilité
  • Zérohallucination, affiche la page d'accueil. Le billet précise : « Our number is not empirical ». La garantie porte sur la forme de la réponse, toujours conforme au schéma demandé. Elle ne dit rien de son exactitude.TypeSafe AI
  • 70,4 sur 100réponses changent quand on renomme les options 0/1 en no/yes, sur 1 200 décisions. L'aire sous la courbe tombe de 0,94 à 0,23.Sun et al., arXiv 2609.26758
  • 88,0sur l'axe de calibration de JevBench, qui vérifie que les probabilités annoncées correspondent aux taux de réussite.JevBench v1.5.4
  • 0,074d'erreur de calibration (ECE) : plus le chiffre est bas, plus les probabilités sont fiables.Jev Decision Index 0.2.1
Langues

L'anglais est la langue principale d'entraînement, « where accuracy is currently best ». Les autres langues sont « handled but not equally well ». Le français n'est pas cité. docs.typesafe.ai

  • 86,9 %en allemand, contre 87,4 % en anglais, sur les mêmes 350 requêtes du jeu MASSIVE. C'est la seule mesure hors de l'anglais trouvée. Aucune mesure en français n'existe.Bespoke Labs

Ce que compare le « 193,6 fois »

Le slogan de TypeSafe : « 193.6x Faster, 444.6x Cheaper »
  1. Un banc maison, sans vérité humaine

    Le chiffre vient des « Workflow evals » de TypeSafe, quatre chaînes de décision écrites par l'éditeur : facturation (150 cas), service client (204), observabilité d'agents (111) et incidents de sécurité (240), soit 705 cas. La bonne réponse y est la moyenne des réponses de GPT-6 Astra et de Claude Fable 5.1, tous deux en réflexion élevée. Le pourcentage affiché mesure donc l'accord de Jev avec deux modèles de langage.

  2. Deux rapports, deux modèles

    Le slogan réunit deux rapports pris sur deux modèles différents. Celui de vitesse correspond à « sonnet 5 », l'un des plus lents du banc. Celui de prix correspond à « opus 5 », le plus cher. L'éditeur ne nomme ni l'un ni l'autre.

    ×195 en temps, face à « sonnet 5 »×440 en coût, face à « opus 5 »

  3. Face au modèle comparable le moins cher

    Le modèle « luna » (OpenAI) obtient 66,8 % d'accord, Jev 67,8 %. Entre ces deux-là, l'écart tombe très loin du slogan. Et sur ce même banc, Jev reste derrière « sol » (OpenAI), à 74,1 %, et « opus 5 », à 73,1 %.

    ×32 en temps, face à « luna » (OpenAI)×8 en coût, face à « luna » (OpenAI)

L'éditeur le dit lui-même

  • Les chaînes ont été écrites par l'équipe de TypeSafe : « some bias could exist ».
  • Les modèles de langage passent par un adaptateur de TypeSafe qui, selon l'éditeur, « tends to be slower and more expensive ».
  • Les temps sont mesurés « from our laptops on the West Coast », là où le service est hébergé.
  • L'éditeur écrit lui-même que ces multiplicateurs sont « on the higher end of real world gains ».

Rapports recalculés par Quelle IA le 30 septembre 2026 à partir des valeurs arrondies que publie l'éditeur, moyenne des quatre chaînes : d'où ×195 et ×440 au lieu de 193,6 et 444,6. Le banc de l'éditeur, evals.typesafe.aiLe billet de lancement, typesafe.aiLe slogan, typesafe.ai

Les concurrents, groupe par groupe

35 modèles en quatre groupes, qui ne se comparent pas d'un groupe à l'autre. Sur chaque fiche, un tampon dit d'où vient le chiffre :Déclaré par l'éditeur du modèle, ou Mesuré par un tiers. Un fait qui n'a pas pu être vérifié n'est pas affiché.

Les modèles de décision fermés

4 fiches

Le même contrat que Jev : un texte, des questions fermées, des probabilités en retour. Leurs poids ne sont pas publiés, on y accède par une API. Jev, présenté plus haut, appartient à ce groupe.

  • Liquid AI

    d1

    États-UnisPoids fermés

    Le modèle de la gamme « Decision Models » de Liquid AI reprend les trois mêmes formes de question que Jev : choix, note, oui ou non.

    La page de l'éditeur ne donne ni prix ni résultat de banc, et sa date de sortie n'a pas été vérifiée.

    • 0,742Mesuré par un tiersd'exactitude sur 2 000 décisions, contre 0,727 pour Jev. La référence de ce banc est synthétique : elle vient d'un modèle d'environ 4 milliards de paramètres.typed-decisions (LocalLLaMA)

    Documentation Liquid AI

  • meraGPT

    Decider 1 (sd-1)

    Poids fermés

    Un modèle de décision accessible par API, vu seulement dans le tableau du banc communautaire typed-decisions.

    Sa ligne, en tête de ce tableau, porte un lien de campagne publicitaire : son chiffre n'est pas repris ici. La page de l'éditeur n'a pas été consultée.

    Vu sur huggingface.co

  • milliseconds.ai

    decision-machine-1

    Poids fermés

    Un modèle de décision fermé, servi par une API au format de celle de TypeSafe.

    • 3,2Mesuré par un tiersde score composite : 71e sur 106 systèmes.JevBench v1.5.4

    Vu sur benchmarkheaven.com

  • ZooWork

    Instinct Dual 4B

    Poids fermés

    Un modèle de décision fermé, connu par sa seule ligne dans JevBench.

    • 47,0Mesuré par un tiersde score composite : 27e sur 106 systèmes.JevBench v1.5.4

    Vu sur benchmarkheaven.com

Les reproductions ouvertes

14 fiches

En quinze jours, des dizaines de reproductions de Jev sont apparues : JevBench recense 112 systèmes, le Jev Decision Index 70 reproductions. La plupart partent d'un petit modèle ouvert (Qwen3.5 de 2 à 9 milliards de paramètres, Gemma 4) dont on lit les probabilités sur les options, avec ou sans adaptateur LoRA.

  • blockbrain

    Cygnet

    Poids ouverts

    Cygnet est une recette : elle lit, dans un Gemma 4 laissé tel quel, la probabilité du jeton de chaque option.

    Licence
    MIT pour le code ; Apache-2.0 et politique d'usage de Gemma pour les poids
    Base
    Gemma-4-12B-it, sans entraînement
    • 73,7Mesuré par un tiersde score composite (intervalle de 72,4 à 74,5) : premier sur 106 systèmes, devant Jev. Les intervalles des dix premiers se recouvrent presque tous.JevBench v1.5.4

    GitHub

  • EldanRing

    Winnow-12B

    Poids ouverts

    Une reproduction ouverte de Jev bâtie sur Gemma 4, présente dans les deux bancs tiers.

    Sortie
    Licence
    Apache-2.0
    Base
    google/gemma-4-12B-it
    • 73,2Mesuré par un tiersde score composite (intervalle de 72,0 à 74,0) : deuxième sur 106 systèmes, dans sa version Q8.JevBench v1.5.4
    • 50,02Mesuré par un tiersd'indice : dixième sur 71 systèmes. Deuxième d'un banc, dixième de l'autre.Jev Decision Index 0.2.1

    Hugging Face

  • alibiserikbay

    JevK5

    Poids ouverts

    Une famille de reproductions ouvertes sur Qwen3.5 : 4B d'abord, puis des variantes v0.3, 2B, 9B et Lite.

    Sortie
    Licence
    Apache-2.0
    Base
    Qwen/Qwen3.5-4B

    Hugging Face

  • Mapika

    decider-2b, decider-4b

    Poids ouverts

    Deux reproductions ouvertes sur Qwen3.5 : decider-2b est sorti le 16 septembre 2026, au lendemain de Jev, et decider-4b a suivi le 22 septembre. Une variante decider-35b-a3b existe aussi.

    Sortie
    Licence
    Apache-2.0
    Base
    Qwen3.5-2B-Base et Qwen3.5-4B-Base

    decider-2bdecider-4b

  • Bespoke Labs

    Bespoke-Nimble-9B

    Poids ouverts

    Une reproduction ouverte sur Qwen3.5, dont l'éditeur publie aussi une suite de tests à étiquettes humaines qui compare son modèle à Jev.

    Sortie
    Licence
    Apache-2.0 pour le modèle ; le dépôt GitHub ne déclare pas de licence
    Base
    Qwen/Qwen3.5-9B avec un adaptateur LoRA
    Langues
    Anglais, d'après les métadonnées de la fiche Hugging Face.
    • 90,1 %Déclaréd'accord sur 324 exemples tenus à l'écart, contre 93,2 % pour Jev 1.13.0.Bespoke Labs
    • 74,8 %Déclaréd'exactitude moyenne sur 13 jeux à étiquettes humaines (3 880 cas), contre 76,0 % pour Jev.Bespoke Labs

    Hugging FaceGitHub

  • Convai Innovations

    Laya

    Poids ouverts

    Un petit encodeur (ModernBERT ou mmBERT) ajusté pour rendre des décisions typées, en version anglaise ou multilingue.

    Sortie
    Licence
    Apache-2.0
    Taille
    421 millions de paramètres (anglais, sur ModernBERT-large) ; 322 millions (multilingue, sur mmBERT-base)
    Langues
    L'éditeur annonce « 100+ languages » pour la variante multilingue.
    • 33 msDéclaréenviron, de temps de réponse.Convai Innovations
    • 0,766Déclaréd'exactitude pour la variante affinée sur typed-decisions, contre 0,362 pour le modèle de base.Convai Innovations
    • 0,0Mesuré par un tierssur l'axe d'exactitude de JevBench : 93e sur 106 systèmes.JevBench v1.5.4

    Hugging Face

  • Together AI

    Tev1-4B-experimental

    Poids ouverts

    La reproduction expérimentale de Together AI, déclinée aussi en 0,8B. Les poids sont publiés sans licence : leur réutilisation n'est pas encadrée.

    Sortie
    Licence
    Aucune licence déclarée
    Base
    Qwen/Qwen3.5-4B

    Hugging Face

  • InternLM

    Intern-Decision

    Poids ouverts

    Trois modèles de décision ouverts (0,8B, 2B et 4B) publiés par l'équipe InternLM.

    Sortie
    Licence
    Apache-2.0
    Base
    Qwen/Qwen3.5-4B

    Hugging Face

  • llm-semantic-router

    Decision-1.0

    Poids ouverts

    Une gamme de six modèles de décision (Eos, Kai, Lex, Sol, Nox, Lux), publiée par l'organisation llm-semantic-router.

    Sortie
    Licence
    Apache-2.0

    Hugging Face

  • Theodore Lee

    SemIf (ex-OpenJev)

    Poids ouverts

    Un outil sans entraînement, qui lit les probabilités d'un modèle ouvert existant pour en tirer une décision typée.

    Licence
    MIT

    GitHub

  • Featherless AI

    SimpleJev

    Poids ouverts

    La reproduction ouverte publiée par Featherless AI.

    Licence
    Apache-2.0
    • 0,716Mesuré par un tiersd'exactitude sur 2 000 décisions, contre 0,727 pour Jev. La référence de ce banc est synthétique.typed-decisions (LocalLLaMA)

    GitHub

  • Maisa

    djev

    Poids non précisés

    Une reproduction bâtie sur DiffusionGemma, proposée par une API hébergée en aperçu gratuit. La publication de ses poids n'a pas été vérifiée.

    Base
    DiffusionGemma

    Vu sur benchmarkheaven.com

  • Kotoba Labs

    open-jev-deberta-v3-large

    Poids ouverts

    Une reproduction ouverte sur un encodeur DeBERTa, bien plus petite que les reproductions bâties sur un modèle de langage.

    Sortie
    Licence
    Apache-2.0
    Taille
    434 millions de paramètres

    Hugging Face

  • iApp

    OpenThai-SystemOne

    Poids ouverts

    Un modèle de décision ouvert pour le thaï et l'anglais.

    Sortie
    Licence
    Apache-2.0
    Langues
    Thaï et anglais.

    Hugging Face

Les encodeurs et extracteurs à schéma

7 fiches

Pour la plupart antérieurs à Jev, ces modèles reçoivent les étiquettes ou le schéma au moment de l'appel. Aucun banc commun ne les compare entre eux, et leurs chiffres viennent presque tous de leurs éditeurs.

  • Fastino

    GLiNER2.5-Decide

    Poids ouverts

    Un encodeur de la lignée GLiNER publié fin septembre 2026 pour les tâches de décision, avec une variante multilingue (287 millions de paramètres) et une variante 1B.

    Sortie
    Licence
    Apache-2.0
    Taille
    340 millions selon la fiche, 486 millions de paramètres selon l'API Hugging Face
    Langues
    Anglais pour la variante principale ; une variante « multi-Decide » est multilingue, sans liste de langues relevée.
    • 60,2 %Déclaréd'exactitude sur fast-decisions, le banc de l'éditeur (17 domaines, 300 exemples chacun, en anglais), devant JevK5 à 57,6 %. Jev lui-même n'est pas dans ce tableau.Fastino
    • 11,21Mesuré par un tiersd'indice : 54e sur 71 systèmes.Jev Decision Index 0.2.1

    Hugging Face

  • Fastino

    GLiNER2 et GLiNER2.5

    Poids ouverts

    Des encodeurs qui repèrent des entités, classent un texte, extraient des champs structurés et des relations en une seule passe. GLiNER2.5 (small, base, multi) date d'août 2026.

    Sortie
    Licence
    Apache-2.0
    • 9 à 22Mesuré par un tierssur l'axe d'exactitude de JevBench, entre la 66e et la 80e place sur 106 : loin derrière les modèles de décision.JevBench v1.5.4

    GitHub

  • Knowledgator

    GLiClass

    Poids ouverts

    Des classifieurs sans exemple : on donne les étiquettes à l'appel, pour de l'intention, du réordonnancement ou de la détection d'hallucination. Des variantes multilingues (edge, mini, ultra) ont suivi en avril 2026.

    Sortie
    Licence
    Apache-2.0
    • 0,7199Déclaréde F1 moyen sans exemple, pour le modèle « large ».Knowledgator

    Hugging Face

  • Knowledgator

    GLiFormer large-v1

    Poids ouverts

    Un encodeur unique pour les entités, la classification, les relations, les enregistrements structurés et la mise en page de PDF.

    Sortie
    Licence
    Apache-2.0
    Taille
    575,6 millions de paramètres ; une version « base » existe
    Langues
    Anglais, d'après les métadonnées de la fiche Hugging Face.

    Hugging Face

  • Urchade Zaratiana et la communauté

    GLiNER

    Poids ouverts

    Le modèle d'origine de la lignée (gliner_multi-v2.1) : il repère dans un texte les entités dont on lui donne le nom à l'appel.

    Sortie
    Licence
    Apache-2.0
    Langues
    Multilingue, d'après les métadonnées de la fiche, sans liste de langues.

    Hugging Face

  • NuMind

    NuExtract3

    Poids ouverts

    Un extracteur génératif : il remplit un gabarit JSON à partir d'un texte ou d'une image. Il écrit sa réponse, contrairement aux encodeurs de ce groupe.

    Sortie
    Licence
    Apache-2.0
    Base
    Qwen3.5-4B
    Taille
    4 milliards de paramètres

    NuMind annonce un banc d'extraction et un classement ouverts « in the coming weeks » : ils n'étaient pas publiés le 30 septembre 2026.

    Hugging Face

  • OpenAI

    privacy-filter

    États-UnisPoids ouverts

    Un classifieur de jetons qui repère les données personnelles dans un texte, pour les masquer avant un traitement.

    Sortie
    Licence
    Apache-2.0
    Taille
    1,4 milliard de paramètres

    Hugging Face

Les modèles de garde et de modération

9 fiches

Un groupe à part. Ces modèles décident eux aussi, mais d'une seule chose : un contenu est-il acceptable ? Aucun test ne les relie à Jev, et il n'existe pas de classement indépendant à jour de la modération. La seule comparaison récente entre éditeurs est le tableau que Mistral publie sur la fiche de Shieldstral.

  • Mistral AI

    Shieldstral-1.0-3B

    FrancePoids ouvertsFrançais cité

    Un classifieur de sécurité pour le texte et l'image : on lui écrit la règle à appliquer en langage courant, il dit si le contenu la respecte.

    Sortie
    Licence
    Apache-2.0
    Langues
    Anglais, français, espagnol, allemand, italien, portugais, néerlandais, chinois, japonais et d'autres.

    Le tableau de sa fiche compare Shieldstral à GPT-OSS-Safeguard-20B, Qwen3Guard-8B, Nemotron-3.5, LlamaGuard-4-12B et ShieldGemma-9B. C'est la seule comparaison récente entre éditeurs, et c'est Mistral qui la publie.

    • 88,1Déclaréde F1 sur WildGuardTest.Mistral AI
    • 84,1Déclaréde F1 sur ToxicChat.Mistral AI
    • 86,2Déclaréde F1 sur Aegis v2.Mistral AI

    Hugging Face

  • Meta

    Llama Guard 4

    États-UnisPoids ouverts

    Le modèle de modération de Meta, dans sa version de 12 milliards de paramètres.

    Sortie
    Licence
    Licence Llama 4, téléchargement sur demande
    Taille
    12 milliards de paramètres
    Langues
    Anglais, d'après les métadonnées de la fiche Hugging Face.

    Hugging Face

  • Meta

    Llama Prompt Guard 2

    États-UnisPoids ouvertsFrançais cité

    Deux très petits classifieurs de Meta contre l'injection de requêtes.

    Sortie
    Licence
    Licence Llama 4, téléchargement sur demande
    Taille
    86 millions et 22 millions de paramètres
    Langues
    Anglais, français, allemand, hindi, italien, portugais, espagnol et thaï, d'après les métadonnées de la fiche Hugging Face.

    Version 86MVersion 22M

  • Google

    ShieldGemma 2

    États-UnisPoids ouverts

    Le modèle de modération d'images de Google. Trois ShieldGemma plus anciens (2B, 9B, 27B) datent de juillet 2024.

    Sortie
    Licence
    Licence Gemma, téléchargement sur demande
    Taille
    4 milliards de paramètres

    Hugging Face

  • IBM

    Granite Guardian 4.1 8B

    États-UnisPoids ouverts

    Le modèle de garde d'IBM, de la famille Granite, publié sous licence libre.

    Sortie
    Licence
    Apache-2.0
    Langues
    Anglais, d'après les métadonnées de la fiche Hugging Face.

    Hugging Face

  • NVIDIA

    Nemotron-3.5-Content-Safety

    États-UnisPoids ouvertsFrançais cité

    Le classifieur de sécurité des contenus de NVIDIA, dans sa gamme Nemotron.

    Sortie
    Licence
    OpenMDW
    Langues
    Douze langues dont le français, d'après les métadonnées de la fiche Hugging Face.

    Hugging Face

  • OpenAI

    gpt-oss-safeguard

    États-UnisPoids ouverts

    Les modèles de garde ouverts d'OpenAI, en deux tailles (20b et 120b).

    Sortie
    Licence
    Apache-2.0

    Version 20bVersion 120b

  • Alibaba

    Qwen3Guard-Gen-8B

    ChinePoids ouverts

    Le modèle de garde de la famille Qwen d'Alibaba.

    Sortie
    Licence
    Apache-2.0

    Hugging Face

  • Fastino

    gliguard-LLMGuardrails-300M

    Poids ouverts

    Un petit modèle de garde-fous pour modèles de langage, publié par Fastino.

    Sortie
    Licence
    Apache-2.0
    Langues
    Anglais, d'après les métadonnées de la fiche Hugging Face.

    Hugging Face

Les bancs qui les mesurent

Trois bancs publics, tous nés en septembre 2026. Aucun n'est tenu par TypeSafe. Un seul autorise la reprise de son tableau.

JevBenchAccord attendu

v1.5.4 ·

Tenu par
Benchmark Heaven, le projet personnel de Florian Standhartinger (Allemagne), sans lien avec TypeSafe AI
Il mesure
Quatre axes (exactitude corrigée du hasard, calibration, vitesse, coût), réunis en un score par une moyenne harmonique à poids égaux.
Protocole
1 624 décisions par système, dont 720 gardées secrètes. Intervalles calculés par rééchantillonnage (2 000 tirages).
Limite
Sa méthode et son podium bougent encore : la version du 27 septembre 2026 plaçait Imajev-4B premier et Jev quatrième, celle du 30 septembre place Cygnet premier et Jev troisième.
Reprise
Le banc est sous licence MIT, mais rien ne couvre explicitement la reprise de ses résultats. Quelle IA attend l'accord écrit de son auteur avant de recopier son tableau.
5 autres limites
  • 220 décisions du niveau difficile ont été écrites par deux modèles de langage, qui se sont relus l'un l'autre.
  • La vitesse et le coût des modèles hébergés par leurs auteurs reposent sur des hypothèses.
  • Le score composite pénalise les modèles de langage sur la vitesse et le coût : GPT-6 Luna obtient 96,2 en exactitude et finit 35e.
  • Les intervalles des dix premiers se recouvrent presque tous.
  • Une évaluation prioritaire payante existe (49 ou 99 $), déclarée sans effet sur le score.

benchmarkheaven.com ↗Le dépôt ↗

Jev Decision IndexAccord attendu

0.2.1 ·

Tenu par
multimodalart (Apolinário), dans un espace Hugging Face
Il mesure
Un indice de 0 à 100, corrigé du hasard, sur 38 bancs publics réécrits en décisions, dans cinq domaines : connaissances, langue, recherche, outils, arts. L'erreur de calibration est donnée à part.
Protocole
120 340 requêtes. Jev est interrogé par son API, les 70 reproductions tournent sur une même carte graphique.
Limite
Les reproductions ne répondent qu'à 76 % des requêtes, contre 100 % pour Jev, et une requête sans réponse compte comme fausse : l'avance de Jev tient en partie à cet effet de couverture.
Reprise
L'espace ne déclare aucune licence. Quelle IA attend l'accord écrit de son auteur avant de recopier son tableau.
Une autre limite
  • Les bancs d'origine sont adaptés : les scores ne se comparent pas aux classements dont ils viennent, dit la méthodologie.

huggingface.co ↗

JevalsReproductible

suite 0.1.0 ·

Tenu par
Jevals, dont l'auteur n'est pas nommé sur les pages consultées et qui se dit indépendant de TypeSafe AI
Il mesure
Un « Decision Score » par épreuve, mesuré contre des étiquettes humaines : 100 pour un sans-faute, 0 pour qui devinerait d'après la fréquence des réponses. S'y ajoutent la calibration, le coût et la latence.
Protocole
Trois épreuves de 300 questions : Jev et six modèles de langage, plus un témoin qui devine.
Limite
Un seul modèle de décision y figure. Jevals situe Jev face à des modèles de langage et ne dit rien encore des reproductions ouvertes, annoncées dans sa rubrique « Coming next ».
Reprise
Les données sont sous licence CC BY 4.0, déclarée dans le dépôt et au pied du site.

jevals.com ↗Le dépôt ↗

Ces bancs ne sont pas d'accord entre eux. Sur JevBench v1.5.4, Cygnet est premier avec 73,7 et Jev troisième avec 72,1. Sur le Jev Decision Index 0.2.1, Jev est premier avec 57,91 et Cygnet n'y figure pas. Quelle IA cite ces chiffres avec leur source et ne recopie pas leurs tableaux, faute d'accord de leurs auteurs.

Le tableau de Jevals

Source : Jevals, version du · licence CC BY 4.0
ModèlePubMedQAoui ou non, 300 questionsBanking77choix parmi 77 intentions, 300 questionsHelpSteer2note d'utilité, 300 questions
JevTypeSafe AI · modèle de décision69,0de 59,8 à 76,5438 ms · 0,029 $ les 1 00067,8de 61,3 à 74,5467 ms · 0,043 $ les 1 0009,2de −4,4 à 21,0478 ms · 0,036 $ les 1 000
DeepSeek V4.1 FlashDeepSeek47,5de 34,7 à 59,1838 ms · 0,078 $ les 1 00063,9de 58,5 à 69,6999 ms · 0,138 $ les 1 000−19,0de −36,0 à −3,3912 ms · 0,125 $ les 1 000
Gemini 3.8 FlashGoogle73,0de 62,1 à 82,21 854 ms · 0,803 $ les 1 00074,1de 68,4 à 79,81 636 ms · 1,368 $ les 1 0004,6de −12,2 à 19,01 887 ms · 1,269 $ les 1 000
GLM-5.3Z.ai60,6de 50,0 à 69,81 757 ms · 0,512 $ les 1 00066,8de 62,0 à 71,72 110 ms · 0,719 $ les 1 0007,8de −4,6 à 18,62 211 ms · 0,785 $ les 1 000
Mercury 2.5Inception55,7de 44,8 à 65,4584 ms · 0,023 $ les 1 00054,0de 47,8 à 60,6638 ms · 0,036 $ les 1 000−5,5de −16,2 à 4,0618 ms · 0,034 $ les 1 000
Mistral Medium 3.5Mistral AI58,0de 45,3 à 69,8533 ms · 0,875 $ les 1 00059,5de 54,3 à 64,8936 ms · 1,515 $ les 1 000−13,7de −28,3 à −0,1706 ms · 1,325 $ les 1 000
Qwen3.8 FlashAlibaba62,4de 50,9 à 72,51 088 ms · 0,086 $ les 1 00062,4de 55,9 à 68,91 713 ms · 0,122 $ les 1 000−1,4de −15,4 à 11,51 422 ms · 0,126 $ les 1 000

Decision Score : 100 pour un sans-faute, 0 pour qui devinerait d'après la fréquence des réponses. La bande couvre l'intervalle publié par Jevals, le trait marque le score. Sous chaque score : la latence médiane et le coût des 1 000 décisions, en dollars. En orange, un intervalle qui contient zéro : rien n'établit alors que le modèle fait mieux que deviner. Jev d'abord, puis l'ordre alphabétique : ce tableau situe Jev face à six modèles de langage, sans classer personne.Attribution : Jevals (jevals.com), version du 18 septembre 2026, suite 0.1.0. CC BY 4.0. Le fichier de données

Pourquoi pas de classement, et quand il viendra

Pour classer les modèles de langage, Quelle IA suit 98 benchmarks publics. Pour les modèles de décision, la matière manque encore. Quatre raisons, relevées le 30 septembre 2026.

  1. Des bancs trop jeunes

    Les deux bancs tiers qui couvrent les mêmes modèles, JevBench et le Jev Decision Index, avaient entre huit et treize jours le 30 septembre 2026.

  2. Deux podiums différents

    JevBench place Cygnet premier et Jev troisième. Le Decision Index place Jev premier et ne contient pas Cygnet.

  3. Une méthode qui change

    JevBench a changé de barème et de podium entre le 27 et le 30 septembre 2026. Un score hebdomadaire refléterait ces changements autant que les modèles.

  4. Des chiffres d'éditeur invérifiables

    TypeSafe mesure Jev contre une référence faite par deux modèles de langage et refuse les bancs publics : « Put no weight on public benchmarks ».

Un classement s'ouvrira quand quatre conditions seront réunies

  1. Condition 1

    Trois sources indépendantes

    Trois bancs tenus par des auteurs différents, qui mesurent au moins huit à dix modèles en commun.

    Pas encoreDeux seulement : JevBench et le Decision Index. Jevals deviendrait le troisième s'il ajoute les reproductions ouvertes, comme il l'annonce.

  2. Condition 2

    Quatre semaines de stabilité

    La même méthode et les mêmes identifiants de modèles d'une semaine à l'autre.

    Pas encoreJevBench a changé de méthode en trois jours. Il publie un journal de ses révisions, ce qui permettra de le vérifier.

  3. Condition 3

    Une part de vérité humaine

    Des étiquettes posées par des humains dans chaque source retenue, ou au moins une source qui n'utilise qu'elles.

    Pas encoreSeuls Jevals, la suite de Bespoke Labs et des articles de recherche s'appuient sur des étiquettes humaines, et ils comparent Jev à des modèles de langage ou à un seul concurrent.

  4. Condition 4

    L'accord écrit des auteurs

    L'autorisation de Benchmark Heaven et de multimodalart de reprendre leurs lignes, avec attribution.

    Pas encorePas encore obtenu. Seul Jevals, sous licence CC BY 4.0, se reprend sans demander.

En bref

Qu'est-ce que Jev ?
Jev est un modèle de décision publié par TypeSafe AI (États-Unis) le 15 septembre 2026, en accès anticipé. Jev reçoit un texte et une liste de questions fermées, et rend pour chacune un choix, une note ou un oui/non avec sa probabilité. Il ne rédige aucun texte. Ses poids ne sont pas publiés : il s'utilise par une API, au prix déclaré de 0,042 $ par million de jetons d'entrée. TypeSafe appelle cette famille « System One ».
Jev est-il meilleur que Claude ?
Sur l'exactitude, les mesures de tiers disponibles au 30 septembre 2026 disent que non. Sur jev-frontier-bench, Jev obtient 72,5 % d'exactitude sur 200 décisions (intervalle de 66,0 à 78,5), contre 84,0 % pour Claude Fable 5.1 et 79,0 % pour GPT-6 Astra. Sur le banc de l'éditeur lui-même, Jev (67,8 % d'accord) fait jeu égal avec « sonnet 5 » et reste derrière « opus 5 » (73,1 %). Jev est en revanche bien plus rapide et moins cher : TypeSafe annonce 70 à 500 ms de temps de réponse, et quatre bancs tiers mesurent une latence médiane de 0,43 à 0,71 s. Ces mesures portent sur de petits jeux de décisions en anglais.
Jev est-il vraiment 193 fois plus rapide ?
Le « 193,6 fois plus rapide, 444,6 fois moins cher » de TypeSafe vient de son propre banc et réunit deux rapports pris sur deux modèles différents : ×195 en temps face à « sonnet 5 », l'un des plus lents du banc, et ×440 en coût face à « opus 5 », le plus cher. Face à « luna » (OpenAI), le modèle de langage d'exactitude comparable le moins cher, l'écart tombe à ×32 en temps et ×8 en coût. La référence de ce banc est faite des réponses de deux modèles de langage, sans étiquette humaine, et l'éditeur écrit lui-même que ces multiplicateurs sont « on the higher end of real world gains ».
Existe-t-il des alternatives ouvertes à Jev ?
Oui. Quelle IA en recense 14 au 30 septembre 2026, dont Cygnet (blockbrain), Winnow-12B (EldanRing), JevK5 (alibiserikbay), decider-2b, decider-4b (Mapika) et Bespoke-Nimble-9B (Bespoke Labs). La plupart partent d'un petit modèle ouvert, Qwen3.5 ou Gemma 4, dont on lit les probabilités sur les options. Sur JevBench v1.5.4, Cygnet obtient 73,7 de score composite, devant Jev (72,1), mais leurs intervalles se recouvrent, et l'autre banc tiers, le Jev Decision Index, place Jev premier.
Jev comprend-il le français ?
Rien ne le montre aujourd'hui. TypeSafe écrit que l'anglais est la langue principale d'entraînement de Jev, que les autres langues sont « handled but not equally well », et ne cite pas le français. Au 30 septembre 2026, la suite publique de Bespoke Labs mesure 86,9 % en allemand, contre 87,4 % en anglais, sur les mêmes 350 requêtes du jeu MASSIVE. C'est la seule mesure hors de l'anglais trouvée. Aucune mesure en français n'existe. Parmi les modèles voisins, Shieldstral-1.0-3B, Llama Prompt Guard 2 et Nemotron-3.5-Content-Safety citent le français dans leurs langues.
Pourquoi Quelle IA ne classe-t-il pas les modèles de décision ?
Parce que la matière manque encore pour un classement honnête. Les deux bancs tiers qui couvrent les mêmes modèles, JevBench et le Jev Decision Index, avaient entre huit et treize jours le 30 septembre 2026. JevBench place Cygnet premier et Jev troisième. Le Decision Index place Jev premier et ne contient pas Cygnet. JevBench a changé de barème et de podium entre le 27 et le 30 septembre 2026. Un score hebdomadaire refléterait ces changements autant que les modèles. Quelle IA ouvrira un classement quand quatre conditions seront réunies : trois sources indépendantes, quatre semaines de stabilité, une part de vérité humaine et l'accord écrit des auteurs.

Le classement des modèles de langage →Un autre dossier sans score : Données →Comment Quelle IA calcule un score →

Ce dossier existe aussi en texte et en JSON, avec la source de chaque chiffre.