
Tech • IA • Robotique • Jeu
L’API Gemini Live de Google a ajouté l’appel de fonctions asynchrone, l’audio proactif, l’injection de contexte via send client content et des fonctionnalités d’audio natif à raisonnement élevé, afin de rendre les agents vocaux en direct plus réactifs et plus capables.
La Gemini Live API mise à jour peut désormais être configurée pour parler uniquement lorsque c’est pertinent, au lieu de répondre à chaque tour de conversation. Dans une démonstration, l’agent restait silencieux sauf s’il était directement interpellé comme Gemini, ce qui permettait à une conversation parallèle naturelle de se poursuivre sans interruptions inutiles. Cette fonctionnalité est conçue pour les assistants vocaux qui doivent rester présents sans être intrusifs.
Une nouvelle capacité send client content permet aux développeurs d’envoyer des informations dans une session en cours sans déclencher de réponse orale immédiate. Cela permet des mises à jour silencieuses en arrière-plan, comme l’ajout de contexte, de l’état utilisateur ou de données applicatives pendant que la conversation continue. Le résultat est une coordination plus étroite entre la logique de l’application et le modèle en direct.
L’API prend désormais en charge l’appel de fonctions asynchrone, ce qui permet à des outils plus lents ou à des systèmes externes de s’exécuter en arrière-plan pendant que l’agent continue de parler. Dans un exemple, une recherche de commande pour l’ID de commande 1234 XYZ a été lancée, l’assistant a fourni des mises à jour de statut en temps réel, puis a ensuite renvoyé un résultat d’expédition. La commande a été indiquée comme expédiée avec une date d’arrivée estimée au 11 août 2026.
Le raisonnement élevé et des modes de raisonnement plus avancés sont désormais disponibles dans l’expérience d’audio natif en direct. Cela étend à la voix des capacités plus poussées de résolution de problèmes en plusieurs étapes, au lieu de les limiter aux environnements d’abord textuels. Cette évolution apporte ce qui a été décrit comme un raisonnement de niveau frontier aux cas d’usage conversationnels en direct.
Une comparaison à partir d’une demande de dessin SVG représentant un pélican à vélo a illustré comment des modèles au raisonnement plus puissant améliorent la qualité du résultat. Un modèle audio natif standard a produit un résultat plus faible, tandis qu’un modèle Max high reasoning a généré une illustration plus élaborée comprenant un casque, une écharpe volante et un vélo plus détaillé. La tâche s’exécutait en arrière-plan pendant que la conversation se poursuivait en parallèle.
L’un des changements centraux est la capacité à combiner un traitement lourd en arrière-plan avec une interaction en temps réel. Pendant que le système travaillait à générer le SVG, il continuait à répondre à des questions sans lien sans bloquer la session. Cette architecture vise des cas d’usage où les utilisateurs attendent à la fois une conversation immédiate et des calculs plus approfondis au sein d’un même échange en direct.
La dernière mise à jour de la Gemini Live API vise à rendre les agents vocaux en direct moins perturbateurs, plus conscients du contexte et mieux capables de gérer des tâches longues. Ensemble, ces nouvelles fonctionnalités rapprochent les systèmes conversationnels en temps réel d’assistants pratiques et très performants pour les applications et services.
Explique-moi