Lancement de Gemini 3.8 Live et fonctionnalités audio
Deux nouveaux modèles d’intelligence artificielle, Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking, ont été dévoilés par Google DeepMind. Ces avancées visent à améliorer les interactions vocales avec l'IA, en rendant les conversations plus intuitives et efficaces. Les deux modèles sont conçus pour répondre à des besoins différents, allant de tâches simples à des raisonnements complexes nécessitant une compréhension approfondie du contexte conversationnel.
Les nouvelles fonctionnalités audio s’inscrivent dans une volonté de rendre l’interaction avec Gemini plus naturelle et accessible, en permettant aux utilisateurs d’effectuer des tâches simplement en utilisant leur voix. Ces modèles ouvrent la voie à de nouvelles applications pour les entreprises, notamment dans le domaine du service client et de l’automatisation des flux de travail internes.
Les faits
Gemini 3.8 Live est conçu pour une utilisation à grande échelle, optimisé pour la rentabilité tout en combinant intelligence conversationnelle et compréhension visuelle. Il est destiné à alimenter des agents vocaux fiables et prêts pour un usage en production, facilitant ainsi les échanges fluides avec Gemini via l’application, Google Workspace et la recherche. Gemini 3.8 Live Extended Thinking, quant à lui, est conçu pour les tâches de complexité élevée, offrant une intelligence accrue et une capacité de raisonnement multi-étapes. Il a obtenu la première place sur l’index de qualité Speech to Speech d’Artificial Analysis avec un score de 82,6%, ainsi que des résultats leaders dans la complétion de tâches agentiques.
Les deux modèles s’appuient sur Gemini 3.5 Transcribe, un modèle dédié à la transcription vocale précis dans plus de 85 langues, qui a atteint une moyenne de Word Error Rate (WER) de 4,0% (streaming) et 2,6% (non-streaming). Les capacités de ces nouveaux modèles incluent l’appel asynchrone de fonctions pour exécuter des appels API et des outils en arrière-plan tout en continuant à diffuser les réponses audio aux utilisateurs, ainsi que la prise en compte du contexte visuel.
Les acteurs
Google DeepMind est le principal acteur derrière le développement de ces nouveaux modèles. L’entreprise met l’accent sur l’amélioration continue de ses modèles Gemini grâce à des mises à jour régulières et des performances optimisées. Artificial Analysis, spécialisée dans l’évaluation des systèmes d’IA vocale, a validé la qualité des performances de Gemini 3.8 Live Extended Thinking en le plaçant en tête de son index Speech to Speech Quality Index.
Les réactions
Le lancement de ces modèles a suscité un intérêt significatif auprès des développeurs et des entreprises. L’objectif est de permettre aux entreprises d’intégrer plus facilement l’IA dans leurs applications vocales, facilitant ainsi la création de solutions innovantes pour le service client, l’automatisation et les workflows internes. La capacité de Gemini 3.8 Live Extended Thinking à maintenir un niveau de performance élevé sur des benchmarks tels que τ-Voice et Sierra’s τ-Voice-banking benchmark témoigne de son potentiel dans des applications exigeantes.
Les enjeux
Le développement de modèles d’IA vocale performants soulève plusieurs enjeux. L’amélioration de la qualité des interactions entre l’homme et la machine est un enjeu majeur, notamment pour rendre l’IA plus accessible et intuitive à utiliser. La capacité de ces nouveaux modèles à gérer des tâches complexes tout en maintenant le contexte conversationnel représente un progrès significatif par rapport aux systèmes précédents. De plus, les implications économiques liées à l’automatisation des flux de travail grâce à l’IA vocale sont considérables.
Ce qu’il faut retenir
- Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking ont été lancés par Google DeepMind pour améliorer la qualité des interactions vocales avec l’IA.
- Ces modèles offrent des capacités de raisonnement avancées, ainsi que des fonctionnalités d’appel asynchrone de fonctions et prise en compte du contexte visuel.
- Leurs performances sont validées par Artificial Analysis, qui les classe parmi les meilleurs systèmes d’IA vocale disponibles.
Sources
- Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking
- Google Introduces Gemini 3.8 Live Audio Models for Real-Time Voice AI Workflows
- Build real-time voice applications with Gemini 3.8 Live and 3.5 Transcribe
Sujet détecté par regroupement sémantique · classé « Tech » · rédigé avec gemma3:4b via Ollama. Comment cet article a été produit