
Tech • IA • Robotique • Jeu
Typesafe AI affirme que Jeff est conçu pour des décisions de machine à machine plutôt que pour le chat, en utilisant des probabilités calibrées au lieu de la génération de texte afin de rendre les tâches de routage et de classification plus rapides, moins coûteuses et plus faciles à automatiser.
De nombreuses équipes utilisent de grands modèles de langage pour trier des tâches à fort volume, comme 2 000 tickets de support par jour, en catégories telles que facturation, ingénierie ou ventes. Les modèles de type conversationnel peuvent expliquer leur choix en langage naturel, mais cela est peu pratique pour des logiciels qui ont besoin d'une sortie propre et structurée. Les développeurs ajoutent souvent des schémas pour forcer une seule étiquette, mais cela ne donne toujours aucune mesure claire du degré de certitude du modèle.
Les LLM traditionnels sont en grande partie entraînés via la prédiction du token suivant, puis ajustés avec le RLHF, ou apprentissage par renforcement à partir de retours humains. Ce processus récompense les réponses que les gens préfèrent, mais n'apprend pas directement au modèle à aligner un score de confiance sur la précision réelle. Un ticket portant clairement sur une double facturation et un ticket pouvant relever soit de la facturation soit du technique peuvent tous deux revenir avec la même étiquette unique.
Typesafe AI indique que Jeff utilise le RLCD, pour apprentissage par renforcement pour des décisions calibrées. Au lieu de s'appuyer sur des évaluateurs humains, le système utilise des données d'entraînement générées avec des réponses correctes connues, ce qui lui permet de comparer les probabilités prédites aux résultats réels. L'objectif est le calibrage: si le modèle attribue 0,8, alors environ 80 % de ces décisions devraient être correctes au fil du temps.
Jeff est présenté comme un modèle de System 1, en reprenant le concept d'intuition rapide popularisé dans Thinking, Fast and Slow de Daniel Kahneman. L'idée est que de nombreuses décisions logicielles n'ont pas besoin d'une longue chaîne de raisonnement. Elles ont besoin d'un jugement rapide dans du code en production, où la latence, le coût et la fiabilité comptent davantage que la richesse conversationnelle.
Au lieu de formuler une invite textuelle, les développeurs envoient un état et des questions structurées. Les questions peuvent être un choix parmi des options déclarées, un score sur une échelle ordonnée, ou une formulation null de type oui/non qui renvoie un nombre entre 0 et 1. Un ticket de support au sujet d'une mise à niveau n'ayant pas débloqué certaines fonctionnalités pourrait recevoir 0.62 technique et 0.38 facturation, au lieu d'une seule étiquette imposée.
Jeff renvoie aussi une valeur de confiance indiquant à quel point la distribution de probabilité est concentrée. Un ticket avec une confiance proche de 0,9 peut être routé automatiquement, un ticket entre 0,5 et 0,9 peut d'abord être confirmé, et un ticket sous 0,5 peut être envoyé à un humain ou à un modèle de raisonnement plus puissant. Cela crée un système de triage où le logiciel n'agit que lorsque l'incertitude est jugée suffisamment faible.
La tarification des LLM est généralement liée aux tokens, et les tokens de sortie sont souvent plus coûteux, car la génération de texte exige des passages répétés dans les poids du modèle et crée un goulot d'étranglement de bande passante mémoire sur les GPU. Jeff évite ce surcoût en ne générant pas de prose. Typesafe AI affiche un tarif de 42 $ par milliard de tokens d'entrée, soit environ 0,04 $ par million, avec aucun frais pour les tokens de sortie.
Comme le modèle renvoie des jugements numériques plutôt qu'un texte complet, plusieurs questions peuvent être traitées en une seule passe. Un développeur peut demander non seulement quelle équipe doit traiter un ticket, mais aussi si le client semble en colère, mentionne un concurrent, risque de résilier, ou devrait passer en priorité. Typesafe décrit ce schéma comme un speculative fan-out, car plusieurs branches potentiellement utiles sont évaluées en même temps.
Le compromis est que Jeff est volontairement littéral et n'est pas adapté aux tâches impliquant arithmétique, comptage ou raisonnement temporel. Les dates sont traitées comme du texte, non comme des points dans le temps, et tout ce qui exige ordre ou calcul doit rester dans du code classique. Les usages les plus adaptés incluent le routage du support, la modération de contenu, le tri de boîtes de réception, la classification d'intention et le scoring multifactoriel à grande échelle.
Un jeu simple inspiré de Papers, Please a été utilisé pour comparer Jeff à des modèles étiquetés GPT 5.5 et DeepSeek. Dans la simulation, trois agents d'approbation traitaient des files de dossiers, et Jeff a vidé sa file nettement plus vite. Le dispositif a été construit comme une application web légère utilisant un service unifié de clé API pour tester plusieurs modèles via la même interface.
Jeff reflète une séparation croissante dans l'IA entre les modèles conçus pour la conversation et ceux conçus pour les décisions opérationnelles. Si ses promesses de calibrage et de faible coût se confirment en production, il pourrait être utile pour des flux logiciels à fort volume où un jugement rapide et structuré compte plus que le texte généré.
Poser une question