
Tech • IA • Robotique • Jeu
OpenAI a présenté l’API Decisions, une interface à faible latence sur GPT-6 Luna permettant d’acheminer des entrées textuelles ou visuelles vers des actions prédéfinies en moins d’un dixième de seconde.
L’API Decisions est conçue pour les cas où un logiciel doit choisir une action presque instantanément, par exemple acheminer une requête, classer une image ou sélectionner le prochain mouvement d’un agent. Les développeurs fournissent une entrée texte ou image, définissent une question et un ensemble fixe de réponses possibles, puis utilisent directement le choix renvoyé dans une application.
Le système fonctionne sur GPT-6 Luna et concentre le modèle sur un petit ensemble d’options plutôt que sur une génération ouverte. Cette conception de tâche plus étroite le rend près de 10 fois plus rapide, tout en conservant des capacités comme la compréhension d’image, une large prise en charge des langues et des protections de sécurité intégrées.
Lors de démonstrations sur du texte non structuré, l’API a servi à extraire des informations structurées et à classer les messages entrants dans des catégories comme support ou ventes. Dans un exemple de classification de prospects commerciaux, les réponses côté serveur sont arrivées en moins de 100 millisecondes, rendant l’interaction pratiquement instantanée.
Un cas d’usage central est le tri opérationnel. De longs envois utilisateurs, rédigés librement, peuvent être convertis en sorties proches de formulaires ou acheminés vers la bonne équipe interne, permettant aux entreprises d’automatiser les files de support et le tri des demandes commerciales entrantes sans attendre un raisonnement complet.
L’API prend aussi en charge les entrées visuelles pour une sélection d’actions rapide. Dans une démonstration de jeu de conduite, elle a analysé des images de route et des obstacles, puis choisi si une voiture devait rester dans sa voie, aller à gauche ou à droite. Le modèle a continué à piloter avec précision même quand la vitesse du jeu augmentait, tout en opérant avec une fraction de la latence d’un modèle de raisonnement.
Ce flux de décision visuelle ouvre la voie à des applications légères d’usage informatique, où des captures d’écran peuvent être interprétées et converties en actions immédiates. Pour des scénarios plus avancés de navigation web ou de contrôle d’ordinateur, des systèmes plus riches peuvent rester nécessaires, mais la nouvelle API est présentée comme une couche rapide pour des décisions simples et répétées.
Combinée à GPT-Live-1, l’API Decisions a été utilisée pour contrôler les expressions faciales d’un personnage animé pendant une conversation vocale en direct. Tandis que le modèle vocal gérait le dialogue parlé, l’API Decisions sélectionnait en temps réel parmi un ensemble prédéfini d’expressions, ajoutant des réactions visuelles alignées sur la tonalité émotionnelle de l’échange.
Dans une démonstration robotique, un robot Microduck programmable nommé Lavender a utilisé GPT-Live pour la voix et l’API Decisions pour les mouvements de tête basés sur la caméra. Le robot analysait périodiquement les images de sa caméra et choisissait où regarder selon des consignes comme suivre une pomme.
Le robot a aussi été montré en train de répondre à des concepts plus larges plutôt qu’à un seul objet nommé. Lorsqu’on lui demandait de suivre le fruit, il suivait la pomme. Lorsqu’on lui demandait ce qui était « plus amusant à utiliser » entre une pomme et une manette de jeu, il choisissait la manette et continuait à la suivre à mesure que les positions changeaient, illustrant une classification au niveau du concept plutôt qu’une simple correspondance d’objet.
L’API Decisions vise une catégorie croissante d’applications d’IA où la vitesse compte davantage que le raisonnement long. En contraignant les sorties à des choix définis, OpenAI positionne GPT-6 Luna comme un outil pratique pour le routage en temps réel, le contrôle visuel et les systèmes interactifs réactifs.
Poser une question