Impact humain

Jev, l'IA faite pour prendre des décisions

8 min de lecture

Pourquoi Jev a créé le buzz

La newsletter IA gratuite
Jev, l'IA faite pour prendre des décisions

Un modèle d'IA avec qui on ne peut pas discuter

Depuis le 15 septembre, un modèle d'intelligence artificielle occupe les conversations des développeurs. Le jour de sa sortie, son billet d'annonce a réuni 1 930 points et 507 commentaires sur Hacker News, le forum où ces gens-là se retrouvent. TechCrunch rapporte que son service a brièvement cessé de répondre, tant la demande était forte.

Sa particularité : on ne peut pas lui parler. Il ne rédige rien, pas une phrase, pas une ligne de code. Posez-lui une question ouverte, il n'en fera rien : il ne répond qu'à des questions fermées, et il y répond par un choix. Ce n'est pas un ChatGPT en moins bon, c'est une autre espèce.

Il s'appelle Jev et vient de TypeSafe AI, laboratoire de San Francisco fondé en 2024 par Diogo Almeida, ancien d'OpenAI et co-auteur du papier InstructGPT qui a mené à ChatGPT. Le laboratoire est sorti de l'ombre le même jour avec 40 millions de dollars en amorçage, menés par DCVC selon son communiqué.

Reste à comprendre pourquoi un modèle muet enthousiasme des gens qui construisent des logiciels. Il faut pour ça regarder ce qu'ils construisent en ce moment.

Ce qu'on appelle un agent

Depuis deux ans, l'IA a changé de métier : on ne lui demande plus seulement de répondre, on lui demande de faire. C'est ce qu'on appelle un agent, un logiciel à qui on confie une tâche entière et qui enchaîne les étapes sans qu'on lui tienne la main.

Prenons un cas, on le gardera jusqu'au bout. Un client écrit au service après-vente : depuis trois jours, la connexion à son compte Stripe échoue, l'outil qui encaisse ses paiements ne marche plus, il perd des ventes.

Avant, un humain lisait ce message : il jugeait de l'urgence, l'envoyait au bon service, regardait l'historique, décidait s'il fallait rembourser. Un agent fait la même tournée tout seul, et s'arrête pour demander un avis quand il ne se sent pas sûr.

Une chaîne de décisions, pas une rédaction

Regardons cette tournée de près : elle n'est faite que de décisions. Réclamation ou question technique ? Urgent ou pas ? Ce client demande-t-il un remboursement ? Est-il assez sûr pour agir seul, ou faut-il réveiller quelqu'un ?

Aucune de ces questions ne demande d'écrire. Elles demandent de choisir. Cocher une case, poser une note, dire oui ou non.

Et pourtant, c'est à un modèle qui écrit qu'on les confie. À chaque étape, on pose la question à un ChatGPT ou à un cousin, il rédige une réponse, et comme un logiciel ne sait pas lire de la prose, on lui demande de la ranger dans un format qu'une machine relira. On vérifie que le format tient, on recommence quand il ne tient pas.

Chaque petit choix se paie donc au prix et à la durée d'une rédaction. On fait passer une dissertation à quelqu'un dont on attend seulement qu'il coche une case.

Ce que fait Jev

Jev prend le problème par l'autre bout. On lui donne une situation, ici le message du client et l'état de son compte, et on lui pose des questions fermées. Il ne peut rendre que trois choses.

Un choix dans une liste écrite à l'avance : facturation, technique, ou gestion de compte. Une note sur une échelle qu'on a décrite : client calme, agacé, très en colère. Un oui ou non : demande-t-il un remboursement ? Toutes les questions sont traitées d'un coup, dans le même mouvement.

Surtout, chaque réponse arrive avec un chiffre : la probabilité qu'elle soit la bonne. Pas un ton assuré, un nombre. Il permet au logiciel d'agir seul quand il est haut et de passer la main quand il est bas, avec une exigence d'autant plus forte que l'action sera difficile à rattraper.

Des mécanismes existaient déjà pour forcer un modèle bavard à rendre une réponse bien rangée. Ils garantissent la forme de la réponse, pas la confiance qu'on peut lui accorder. Entre un formulaire bien rempli et un formulaire signé d'une main tremblante, la case est cochée dans les deux cas.

À quoi ça sert

Tout ce qui trie. Router un e-mail vers le bon service, noter un signalement de modération, repérer dans un texte une information parmi une liste connue.

Un usage plus retors est remonté des premiers utilisateurs : surveiller un autre modèle. Faire relire un ChatGPT par un second ChatGPT coûte cher, et beaucoup y renoncent. Le faire par Jev, facturé 42 dollars le milliard d'unités de texte en entrée et gratuit en sortie, change l'arithmétique.

Pourquoi ça s'emballe

Trois choses se cumulent : la signature d'un vétéran d'OpenAI, le récit de l'anti-chatbot dans une année de lassitude, et des chiffres spectaculaires.

C'est là qu'il faut ralentir. La page d'accueil annonce 193,6 fois plus rapide et 444,6 fois moins cher ; le communiqué de levée de fonds, publié le même jour, annonce « jusqu'à 100 fois ». Un produit, deux chiffres, selon le public visé.

Et sur le site où l'entreprise détaille sa méthode, la bonne réponse n'est pas une vérité de terrain : c'est la moyenne des réponses de deux modèles concurrents, sur quatre cas fabriqués par ses équipes. TypeSafe ne mesure pas sa justesse, elle mesure son accord avec ses rivaux.

Les seules mesures faites par des tiers sont plus sobres. Un ingénieur de Vercel, cité par TechCrunch, a remplacé un trieur ChatGPT par Jev : 5 à 18 fois plus rapide. Le directeur technique de Bryo AI l'a comparé à Gemini sur du classement d'e-mails : 10 à 20 fois moins cher, mais Gemini légèrement plus précis.

Ce que l'éditeur dit lui-même de son modèle

TypeSafe publie une page listant neuf défauts connus de sa version actuelle, et c'est la lecture la plus utile du dossier. Jev prend les questions au pied de la lettre, ne compte pas de façon fiable, lit les dates comme du texte, et n'a aucune connaissance du monde.

Deux exemples de leur doc valent tous les avertissements. Sur un ticket, la question du remboursement rend 0,22 posée d'une façon et 0,01 posée d'une autre. Sur un second, « remboursement » sort à 0,72 et son contraire à 0,47, soit 1,19 à eux deux. Les probabilités ne s'additionnent pas.

Une limite compte particulièrement en France : l'anglais est la langue d'entraînement principale, les autres étant moins bien traitées de l'aveu de la doc. Le tout en accès anticipé, sans mesure indépendante.

Le chaînon manquant des agents, mythe ou réalité ?

L'écosystème a tranché vite, au moins en gestes. Vercel a branché Jev sur sa passerelle dès le 16 septembre. LangChain, l'outil avec lequel beaucoup d'agents sont assemblés, publie un paquet maison et écrit que Jev n'est pas un remplaçant du modèle bavard mais son complément : le texte pour le raisonnement ouvert, Jev pour les décisions en chemin. LlamaIndex, Pydantic AI et LiteLLM ont suivi en cinq jours.

Reste l'obstacle, et c'est la documentation de TypeSafe qui le nomme : Jev ne se méfie pas de ce qu'on lui donne à lire. Une consigne glissée dans un texte peut déplacer sa réponse. Or un agent lit précisément ce qu'il ne contrôle pas : une page web, un e-mail venu de l'extérieur, la production d'un autre modèle. Le composant qu'on voudrait poser en garde-fou est fragile là où on veut l'installer.

Le verdict tient en deux temps. Réel quand la décision est fermée et l'entrée maîtrisée : trier une file interne, noter un dossier, choisir quel modèle traitera une demande. Prématuré partout où l'agent lit du contenu venu de dehors. Les intégrations les plus avancées portent d'ailleurs la mention « expérimental ».

Une décision peut être valide et fausse

L'argument de vente le plus répété : Jev ne peut pas inventer. C'est vrai dans un sens étroit, il ne rendra jamais une réponse hors de la liste qu'on lui a donnée. Mais comme l'a formulé un développeur, respecter le format n'est pas dire le vrai : un modèle qui doit trancher entre « facturation » et « technique » choisira toujours l'un des deux, même quand la bonne réponse était « ni l'un ni l'autre ».

La documentation le dit à sa manière. La fiabilité de ces probabilités se vérifie sur de grands ensembles de réponses, et ne garantit pas qu'une réponse prise isolément soit juste. Almeida le reconnaît lui-même : il reste possible d'avoir tort avec assurance.

Le risque ne disparaît pas, il change de forme. Il ne ressemble plus à une phrase inventée qu'on repère à l'œil nu, il ressemble à un 0,94 bien rangé dans une variable, qui part directement dans la suite du programme.

Sujets abordés :

ProductivitéDécryptage

Questions fréquentes

Qu'est-ce que Jev, le modèle de TypeSafe AI ?
Jev est un modèle qui ne rédige rien, pas une phrase, pas une ligne de code. Il ne répond qu'à des questions fermées, et il y répond par un choix. Il vient de TypeSafe AI, laboratoire de San Francisco fondé en 2024 par Diogo Almeida, ancien d'OpenAI et co-auteur du papier InstructGPT.
Que peut rendre Jev comme réponse ?
Trois choses seulement : un choix dans une liste écrite à l'avance, une note sur une échelle qu'on a décrite, ou un oui ou non. Chaque réponse arrive avec un chiffre : la probabilité qu'elle soit la bonne.
Les chiffres de vitesse et de coût de Jev sont-ils vérifiés ?
Ce sont des annonces de l'éditeur : sa page d'accueil affiche 193,6 fois plus rapide et 444,6 fois moins cher, son communiqué de levée de fonds annonce « jusqu'à 100 fois » le même jour. Les seules mesures faites par des tiers sont plus sobres et distinctes : un ingénieur de Vercel cité par TechCrunch relève 5 à 18 fois plus rapide, et le directeur technique de Bryo AI 10 à 20 fois moins cher que Gemini, mais avec Gemini légèrement plus précis.
Quels sont les défauts connus de Jev ?
TypeSafe publie une page listant neuf défauts connus de sa version actuelle. Jev prend les questions au pied de la lettre, ne compte pas de façon fiable, lit les dates comme du texte et n'a aucune connaissance du monde. L'anglais est sa langue d'entraînement principale, les autres étant moins bien traitées de l'aveu de la documentation.
Jev peut-il servir de garde-fou dans un agent ?
La documentation de TypeSafe indique que Jev ne se méfie pas de ce qu'on lui donne à lire : une consigne glissée dans un texte peut déplacer sa réponse. L'usage est réel quand la décision est fermée et l'entrée maîtrisée, prématuré partout où l'agent lit du contenu venu de dehors.
Combien TypeSafe AI a-t-elle levé, et auprès de qui ?
Le laboratoire est sorti de l'ombre le 15 septembre 2026 avec 40 millions de dollars en amorçage, menés par DCVC selon son communiqué. Le même jour, son billet d'annonce réunissait 1 930 points et 507 commentaires sur Hacker News.
Alexandre Noto

Alexandre Noto

Co-fondateur & Expert Tech

Alexandre est dans la tech depuis plus de 20 ans. Entrepreneur, architecte logiciel et passionné d'intelligence artificielle, il traduit les concepts complexes en explications accessibles. Chez Declic Media, il est la voix technique qui rend l'IA compréhensible pour tous.

Tous les articles de Alexandre →
La newsletter IA gratuite