Lancement de Gemini 3.8 Live et fonctionnalités audio

Deux nouveaux modèles d’intelligence artificielle, Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking, ont été dévoilés par Google DeepMind. Ces avancées visent à améliorer les interactions vocales avec l'IA, en rendant les conversations plus intuitives et efficaces. Les deux modèles sont conçus pour répondre à des besoins différents, allant de tâches simples à des raisonnements complexes nécessitant une compréhension approfondie du contexte conversationnel.

Rédigé par une IA Publié le 3 sources · 2241 contenus analysés 3 min de lecture
Tech : Lancement de Gemini 3.8 Live et fonctionnalités audio

Les nouvelles fonctionnalités audio s’inscrivent dans une volonté de rendre l’interaction avec Gemini plus naturelle et accessible, en permettant aux utilisateurs d’effectuer des tâches simplement en utilisant leur voix. Ces modèles ouvrent la voie à de nouvelles applications pour les entreprises, notamment dans le domaine du service client et de l’automatisation des flux de travail internes.

Les faits

Gemini 3.8 Live est conçu pour une utilisation à grande échelle, optimisé pour la rentabilité tout en combinant intelligence conversationnelle et compréhension visuelle. Il est destiné à alimenter des agents vocaux fiables et prêts pour un usage en production, facilitant ainsi les échanges fluides avec Gemini via l’application, Google Workspace et la recherche. Gemini 3.8 Live Extended Thinking, quant à lui, est conçu pour les tâches de complexité élevée, offrant une intelligence accrue et une capacité de raisonnement multi-étapes. Il a obtenu la première place sur l’index de qualité Speech to Speech d’Artificial Analysis avec un score de 82,6%, ainsi que des résultats leaders dans la complétion de tâches agentiques.

Les deux modèles s’appuient sur Gemini 3.5 Transcribe, un modèle dédié à la transcription vocale précis dans plus de 85 langues, qui a atteint une moyenne de Word Error Rate (WER) de 4,0% (streaming) et 2,6% (non-streaming). Les capacités de ces nouveaux modèles incluent l’appel asynchrone de fonctions pour exécuter des appels API et des outils en arrière-plan tout en continuant à diffuser les réponses audio aux utilisateurs, ainsi que la prise en compte du contexte visuel.

Les acteurs

Google DeepMind est le principal acteur derrière le développement de ces nouveaux modèles. L’entreprise met l’accent sur l’amélioration continue de ses modèles Gemini grâce à des mises à jour régulières et des performances optimisées. Artificial Analysis, spécialisée dans l’évaluation des systèmes d’IA vocale, a validé la qualité des performances de Gemini 3.8 Live Extended Thinking en le plaçant en tête de son index Speech to Speech Quality Index.

Les réactions

Le lancement de ces modèles a suscité un intérêt significatif auprès des développeurs et des entreprises. L’objectif est de permettre aux entreprises d’intégrer plus facilement l’IA dans leurs applications vocales, facilitant ainsi la création de solutions innovantes pour le service client, l’automatisation et les workflows internes. La capacité de Gemini 3.8 Live Extended Thinking à maintenir un niveau de performance élevé sur des benchmarks tels que τ-Voice et Sierra’s τ-Voice-banking benchmark témoigne de son potentiel dans des applications exigeantes.

Les enjeux

Le développement de modèles d’IA vocale performants soulève plusieurs enjeux. L’amélioration de la qualité des interactions entre l’homme et la machine est un enjeu majeur, notamment pour rendre l’IA plus accessible et intuitive à utiliser. La capacité de ces nouveaux modèles à gérer des tâches complexes tout en maintenant le contexte conversationnel représente un progrès significatif par rapport aux systèmes précédents. De plus, les implications économiques liées à l’automatisation des flux de travail grâce à l’IA vocale sont considérables.

Ce qu’il faut retenir

  • Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking ont été lancés par Google DeepMind pour améliorer la qualité des interactions vocales avec l’IA.
  • Ces modèles offrent des capacités de raisonnement avancées, ainsi que des fonctionnalités d’appel asynchrone de fonctions et prise en compte du contexte visuel.
  • Leurs performances sont validées par Artificial Analysis, qui les classe parmi les meilleurs systèmes d’IA vocale disponibles.
googlegeminiaudiotranscriptiondeepmind

Sources

Sujet détecté par regroupement sémantique · classé « Tech » · rédigé avec gemma3:4b via Ollama. Comment cet article a été produit

← Tous les articles