Tech • IA • Robotique • Jeu

VIDÉO
ENFR

Cette compétence de Claude peut vous faire économiser 400x sur les tokens de Claude Code

7/10
IACharlie Automates26 septembre 2026 à 14:5112:03
Lecteur audio
0:00 / 0:00

INTRO

Jev, un modèle d’IA axé sur la classification, a fortement réduit les coûts et le temps d’exécution du tri d’e-mails par rapport à Claude Opus lors d’un test sur 216 e-mails, tout en étant surtout efficace comme premier filtre plutôt que comme système de rédaction ou de raisonnement.

POINTS CLÉS

À quoi Jev est conçu pour servir

Jev est conçu pour des tâches de classification ciblées plutôt que pour des conversations ouvertes. Il prend des décisions à format fixe, comme choisir entre plusieurs options, juger si quelque chose est vrai et attribuer un score de confiance. Cette conception contrainte réduit le coût et la latence par rapport à des modèles plus larges comme Claude Opus.

Test comparatif de tri d’e-mails

Un flux de travail en conditions réelles a placé Jev et Opus sur la même tâche: traiter 216 e-mails et répondre à quatre questions pour chaque message. Le système classait le type d’e-mail, vérifiait si de l’argent était mentionné, identifiait ce qui était demandé et estimait si l’expéditeur avait l’intention de payer. Le test visait le tri des collaborations et des partenariats sponsorisés.

Comparaison de vitesse

En traitement d’un seul e-mail, Jev a affiché une moyenne de 0,3 seconde par e-mail contre 1,3 seconde pour Opus. Sur l’ensemble des 216 e-mails, Jev a terminé en 65 secondes. Opus ne pouvait finir en 37 secondes qu’en étant exécuté en neuf lots parallèles, tandis qu’un traitement séquentiel prenait 4 minutes 46 secondes, ce qui rendait Jev environ quatre fois plus rapide pour ce cas d’usage.

Comparaison de coût

L’écart de coût était bien plus important que l’écart de vitesse. Jev a traité l’ensemble pour environ 0,01 $, en utilisant environ 277 000 tokens d’entrée avec une sortie gratuite. Opus a utilisé environ 625 000 tokens d’entrée et 24 000 tokens de sortie, pour un coût estimé à 4,73 $ au tarif API. Cela rendait Jev environ 48 fois moins cher en coût API direct.

Taux de concordance des résultats

Les deux systèmes étaient d’accord la plupart du temps, mais pas parfaitement. La concordance a atteint 87 % sur le type d’e-mail, 88 % sur les références à l’argent, 94 % sur ce que l’expéditeur voulait faire produire, et 74 % sur la probabilité que l’expéditeur paie. Ces chiffres suggèrent que la classification est plus solide sur des champs concrets et plus faible sur l’intention ou la nuance commerciale.

Là où ils divergeaient

Il y avait 28 e-mails contestés qui ont nécessité un examen plus poussé. Parmi eux, 13 étaient des newsletters, 8 des offres réservées à l’affiliation, 4 des cas où Jev a été jugé correct face à Claude, et 3 étaient flous ou du spam. L’examen a suggéré qu’aucun des deux modèles n’était universellement le plus précis; chacun échouait différemment.

Des schémas d’erreur différents

Jev a tendance à manquer de nuance parce qu’il répond de manière étroite et littérale, question par question. Claude peut surinterpréter, en inférant parfois une intention commerciale là où il n’y en a pas. Dans un exemple, une invitation à participer à un débat du vendredi sur la sécurité de l’IA, sans discussion de paiement, a été étiquetée par Claude comme un partenariat de marque, illustrant le risque d’excès créatif dans le tri.

Meilleur flux de travail: videur et gestionnaire

La configuration la plus efficace consiste à traiter Jev comme le filtre de premier passage et Claude comme le réviseur final. Jev trie les messages en parallèle, renvoie des étiquettes et des scores de confiance, puis ne transmet à Claude que les cas à faible confiance. Dans le flux de test, Claude n’a eu besoin de lire que 38 e-mails incertains après le passage initial de Jev.

Économies combinées et compromis

L’exécution du flux hybride a réduit le coût estimé à environ 0,85 $ contre 4,73 $ avec Opus seul. L’approche économise aussi les limites d’usage du modèle et l’espace de contexte en réservant le raisonnement plus coûteux aux cas incertains. En contrepartie, Jev ne peut pas rédiger des réponses, conserver une mémoire ou résoudre des contradictions seul; il fonctionne donc comme une infrastructure plutôt que comme un assistant autonome.

Comment l’outil est intégré

La configuration utilise une clé API OpenRouter et un pack de compétences basé sur des commandes, installé dans un espace de travail Claude. La recommandation n’est pas d’utiliser Jev isolément, mais de l’intégrer dans des compétences existantes et des pipelines d’automatisation afin que des modèles plus larges décident quand l’invoquer. Cela fait de Jev un classificateur backend pour le tri répétitif à fort volume.

CONCLUSION

Le test indique que Jev a surtout de la valeur comme gardien rapide et peu coûteux pour des décisions structurées, et non comme remplacement des modèles de raisonnement complets. Pour des flux comme le tri quotidien d’e-mails, associer Jev à Claude peut réduire le coût et la charge du modèle tout en préservant le jugement sur les cas ambigus.

Poser une question
Transcription complète

Sur le même sujet : IA