Tech • IA • Robotique • Jeu

VIDÉO
ENFR

La prochaine génération d’IA vocale avec Google DeepMind et Sierra AI

5/10
GoogleGoogle for Developers24 septembre 2026 à 23:025:21
Lecteur audio
0:00 / 0:00

INTRO

Deux nouveaux modèles d’IA audio native sont lancés pour offrir aux développeurs le choix entre de meilleures performances conversationnelles en rapidité et des agents vocaux d’entreprise plus précis, dans un effort plus large visant à améliorer la latence, la gestion multilingue de la parole et l’évaluation en conditions réelles.

POINTS CLÉS

Lancement de deux modèles pour les agents vocaux

La sortie s’articule autour de deux modèles audio native. L’un est une option légère et plus rapide, conçue pour des échanges vifs et un usage limité d’outils. L’autre est présenté comme un modèle davantage orienté entreprise, pensé pour une plus grande précision dans les tâches vocales, surtout lorsque des appels de fonctions en plusieurs étapes, une meilleure exactitude et des déploiements plus sensibles sont requis.

La demande des entreprises se déplace vers des tâches plus difficiles

Les entreprises qui conçoivent des agents IA destinés aux clients dépassent les simples interactions de support pour aller vers des tâches plus complexes. Cela inclut le raisonnement sur un horizon long, les agents sortants et les workflows axés sur la vente, ce qui reflète la manière dont des grands modèles de langage plus puissants élargissent l’éventail des tâches que les systèmes vocaux doivent prendre en charge.

La latence est désormais mesurée de deux façons

Les développeurs distinguent de plus en plus la latence entre le temps jusqu’au premier audio et le temps jusqu’à la première réponse utile. Le premier mesure la rapidité avec laquelle un modèle commence à répondre à voix haute de façon conversationnelle. Le second suit le temps nécessaire pour fournir une information pertinente après un accusé de réception, comme une promesse d’aller chercher l’information.

Accélérer la première réponse est une priorité

Les générations précédentes pouvaient afficher de meilleurs résultats sur les benchmarks lorsque des modes de raisonnement internes étaient activés, mais cela augmentait souvent le délai avant que le modèle ne commence à parler. L’objectif actuel est de ramener le temps jusqu’au premier audio à un niveau véritablement conversationnel, afin que les utilisateurs aient l’impression d’un échange en direct plutôt que d’attendre qu’un système réfléchisse.

L’audio native peut améliorer le changement de langue

L’un des avantages les plus notables revendiqués pour les systèmes audio native est une gestion plus fluide de la parole multilingue et de l’alternance naturelle entre les langues. Au lieu de s’appuyer sur une chaîne parole-vers-texte qui peut perdre des nuances dans un effet de « téléphone cassé », les modèles audio de bout en bout sont censés préserver plus fidèlement ces changements de langue et répondre avec plus de fluidité.

La qualité vocale est évaluée comme une hiérarchie

Un cadre utile qui émerge dans l’industrie décompose les performances vocales en trois niveaux: exactitude, qualité et expérience. L’exactitude mesure la capacité du système à accomplir la tâche. La qualité indique si l’interaction est supportable plutôt que frustrante. L’expérience constitue le niveau le plus élevé et couvre la prononciation naturelle, le ton et le caractère réellement agréable de la conversation.

Les benchmarks évoluent au-delà des tests statiques

L’évaluation vocale en temps réel s’éloigne des tests statiques à réponse unique au profit de dispositifs plus dynamiques avec simulateurs d’utilisateurs, bruit et personas. L’idée est que l’IA conversationnelle doit être testée dans des conditions plus proches des déploiements réels, où les interruptions, l’ambiguïté et les changements de contexte comptent davantage que la correspondance avec une seule réponse de référence.

La saturation des benchmarks arrive rapidement

Les équipes qui travaillent sur les benchmarks d’agents expliquent que des tâches d’abord jugées difficiles peuvent être saturées en quelques mois seulement à mesure que les capacités des modèles progressent. Ce rythme oblige les concepteurs de benchmarks à relever la difficulté tout en évitant de rendre les classements publics si exigeants qu’ils découragent la participation ou reflètent mal les gains pratiques des produits.

Le dialogue devient une interface clé

L’interaction vocale en temps réel est de plus en plus considérée comme l’une des façons les plus convaincantes d’utiliser l’IA, car elle paraît fluide et réduit la dépendance aux écrans, aux bureaux ou aux téléphones. Cette commodité, combinée aux progrès rapides dans les laboratoires, contribue à faire du dialogue vocal un élément central de la manière dont les gens pourraient utiliser les systèmes d’IA au cours de l’année à venir.

CONCLUSION

Les derniers modèles d’audio native reflètent un basculement plus large du secteur, qui passe de simples interfaces vocales à des agents conversationnels pleinement déployés devant concilier rapidité, exactitude et expérience utilisateur. Le prochain front concurrentiel sera probablement la performance vocale en conditions réelles, et non les seuls scores bruts sur benchmarks.

Poser une question
Transcription complète

Sur le même sujet : Google