Tech • IA • Robotique • Jeu

VIDÉO
ENFR

Arrêtez de surpayer l’intelligence | DevDay 2026

7/10
IAOpenAI7 octobre 2026 à 21:1023:01
Lecteur audio
0:00 / 0:00

INTRO

L’optimisation des dépenses en IA dépend moins du prix des listes de tokens que du coût par tâche, avec des économies majeures venant du bon dimensionnement des modèles, du cache de prompts, de l’orchestration des outils dans le code, d’un effort de raisonnement ajusté et du traitement différé par lots.

POINTS CLÉS

Le coût par tâche compte plus que le coût par token

Un prix plus bas par token ne garantit pas un coût réel plus faible. Un modèle moins performant peut consommer davantage de tokens, échouer à terminer la tâche ou nécessiter l’intervention d’un humain, ce qui augmente le coût réel d’exécution. Dans le support client, par exemple, un chatbot en échec peut ajouter à la fois l’usage du modèle et du travail humain à une même demande.

La qualité du modèle peut réduire la dépense globale

OpenAI a cité des cas où des modèles plus capables réduisaient le coût à la tâche en accomplissant le travail plus efficacement. Perplexity a indiqué que 6 Astra produisait des résultats de recherche 9% plus précis pour la moitié du coût par rapport à un modèle antérieur. Notion a rapporté de façon similaire que le passage de 5.5 à 5.6 Sol améliorait la précision tout en réduisant de moitié le coût par tâche.

Les développeurs sont encouragés à définir d’abord des objectifs de précision

Le point de départ recommandé est de définir clairement la tâche et de fixer un seuil métier de performance acceptable, comme la résolution automatique de 80% des demandes de support. Les équipes peuvent ensuite tester modèles, prompts et réglages par rapport à cette référence, puis choisir la configuration la moins coûteuse qui respecte encore le niveau de qualité requis.

Une approche de Pareto est recommandée pour choisir les modèles

Le compromis à optimiser est celui entre précision et coût. Il est conseillé aux équipes d’évaluer plusieurs modèles et configurations, puis de tracer une frontière de Pareto pour trouver le point où la performance est suffisante au coût pratique le plus bas. Des tâches simples comme la classification ou l’extraction de champs peuvent convenir à de plus petits modèles comme Luna, tandis qu’une planification ou un raisonnement plus complexes peuvent justifier 6 Astra.

Les petits modèles peuvent gérer la plupart des workflows

Luna a été mis en avant comme un modèle capable de surpasser de plus gros systèmes de génération précédente lorsqu’il est associé à des réglages de raisonnement élevés. OpenAI a indiqué que certains clients utilisent Luna pour 80% à 90% des workflows de développement, en réservant les modèles plus grands aux tâches nécessitant réellement une intelligence supérieure. Une API Decisions nouvellement annoncée a aussi été présentée pour des tâches plus simples.

Le cache de prompts est l’un des plus grands leviers de coût

Les instructions répétées et le contexte partagé peuvent être réutilisés au lieu d’être retraités à chaque appel. Les entrées mises en cache peuvent réduire le coût jusqu’à 90%, tout en diminuant aussi la latence. Le principal conseil est de garder le début des prompts aussi stable que possible afin de réutiliser les instructions fixes et les textes de politique entre les requêtes.

Les appels d’outils programmatiques réduisent le travail inutile du modèle

Au lieu de renvoyer chaque résultat intermédiaire d’outil dans le modèle, les applications peuvent utiliser du code pour coordonner les appels d’outils, comparer les sorties et ne renvoyer que le résultat final assemblé pour évaluation. L’éditeur de logiciels juridiques Clio a signalé 38% de tokens de prompt en moins dans un workflow d’analyse documentaire en plusieurs étapes après avoir adopté cette approche, sans perte de qualité.

L’effort de raisonnement doit être ajusté, pas maximisé

Un effort de raisonnement plus élevé peut valoir son coût sur des tâches difficiles ou différenciantes, mais il doit être traité comme un paramètre à tester plutôt que comme une valeur par défaut. Pour le routage et d’autres tâches simples, la recommandation est de commencer bas et d’augmenter seulement si les évaluations montrent des problèmes de qualité. Des réponses courtes peuvent tout de même exiger un raisonnement important, donc la longueur de sortie n’est pas un indicateur fiable.

Le traitement par lots peut fortement réduire le prix lorsque la latence est flexible

Pour des travaux non urgents comme le traitement de grands ensembles de documents, les tâches Batch API peuvent s’exécuter sur une fenêtre de 24 heures avec un prix par token inférieur de 50% à celui des requêtes synchrones. Cela fait du traitement différé un moyen concret de réduire les dépenses sans modifier la logique applicative sous-jacente.

De nouveaux contrôles de cache visent à améliorer la réutilisation

Avec les familles de modèles plus récentes, les développeurs peuvent définir des points d’arrêt explicites pour mettre en cache les sections stables d’un prompt tout en laissant dynamiques les détails variables de la tâche. Un mode explicite uniquement offre un contrôle plus strict sur ce qui est exactement mis en cache. OpenAI a aussi indiqué que les systèmes plus récents peuvent modifier l’effort de raisonnement au cours d’une conversation sans casser la réutilisation du cache, et que les outils peuvent être changés sans invalider les sections de prompt mises en cache.

Les résultats clients montrent l’impact de l’optimisation du cache

L’entreprise de développement logiciel Blitzy a indiqué qu’en passant d’un appel unique à sortie structurée à la boucle d’appel d’outils de Luna, elle avait fait passer la réutilisation du cache de 24% à 90%. Sur le trafic de production, l’entreprise a rapporté 8.5x moins de tokens de prompt en sortie, un coût inférieur de 87% à GPT 5.4 Mini, et la prise en charge de 2.2x plus de contexte.

CONCLUSION

Le message central est que la maîtrise des coûts de l’IA dépend de la mesure des résultats réussis, et pas seulement du prix des tokens. Les équipes qui définissent des objectifs de qualité, évaluent les modèles de façon systématique et réduisent le travail inutile du modèle peuvent fortement diminuer les coûts sans sacrifier les performances.

Poser une question

Sur le même sujet : IA