Cryptelio

Marchés

Google Lance le Modèle de Reconnaissance Vocale Gemini 3.5 avec Détection des Émotions

Cryptelio Editorial Publié 26 août 2026 · 17:33 UTC

Google a dévoilé son modèle de reconnaissance vocale Gemini 3.5, marquant une avancée significative dans ses capacités en intelligence artificielle. Ce modèle, détaillé dans une fiche dédiée, prend en charge diverses fonctionnalités au-delà de la simple transcription, y compris les horodatages, l'identification des intervenants, la traduction, la synthèse et, surtout, la détection des émotions.

Le modèle Gemini 3.5 peut traiter des sessions audio prolongées allant jusqu'à 96 000 tokens, ce qui le rend adapté aux enregistrements longs tels que les réunions d'affaires et les dépositions légales. Les utilisateurs peuvent télécharger des formats audio courants comme le MP3 via l'API Gemini ou l'application Gemini pour macOS. Le modèle améliore l'expérience utilisateur en éliminant les mots de remplissage et en produisant un texte soigné directement à partir de la parole naturelle.

La détection des émotions est un élément clé qui distingue cette version, permettant une compréhension plus nuancée du contenu parlé. Par exemple, un résumé qui note la frustration d'un client lors d'un appel fournit des informations plus profondes qu'une simple transcription. Cette capacité est particulièrement bénéfique pour les professionnels générant d'importants volumes de contenu oral, y compris les journalistes, les avocats et les universitaires.

Le mouvement stratégique de Google avec Gemini 3.5 intervient dans un contexte de forte concurrence sur le marché de l'IA, notamment face à des entreprises comme OpenAI et Anthropic. Ce lancement vise à renforcer la position de Google dans le classement des modèles d'IA alors qu'il continue d'innover et d'élargir son portefeuille d'IA.

Alors que le marché attend des références de performance et des mises à jour de la part des concurrents, le succès de Gemini 3.5 sera étroitement surveillé, notamment dans le cadre de sa position sur le tableau des leaders des LLM dans l'arène des chatbots.

FAQ

Qu'est-ce que le modèle de conversion de la parole en texte Gemini 3.5 ?

Le modèle de conversion de la parole en texte Gemini 3.5 est la dernière avancée en IA de Google qui offre des fonctionnalités telles que la transcription, les horodatages, l'identification des locuteurs, la traduction, la synthèse et la détection des émotions.

Quelle caractéristique unique le modèle Gemini 3.5 offre-t-il ?

Un élément distinctif du modèle Gemini 3.5 est sa capacité de détection des émotions, qui permet une compréhension nuancée du contenu parlé, fournissant des informations au-delà de la simple transcription.

Quelle durée d'audio le modèle Gemini 3.5 peut-il traiter ?

Le modèle Gemini 3.5 peut traiter des sessions audio prolongées allant jusqu'à 96 000 tokens, ce qui le rend adapté aux enregistrements longs tels que les réunions d'affaires et les dépositions légales.

Quels formats audio peuvent être téléchargés sur le modèle Gemini 3.5 ?

Les utilisateurs peuvent télécharger des formats audio courants comme MP3 via l'API Gemini ou l'application Gemini pour macOS.

Qui peut bénéficier de l'utilisation du modèle Gemini 3.5 ?

Les professionnels générant des volumes importants de contenu parlé, y compris les journalistes, les avocats et les universitaires, peuvent bénéficier des fonctionnalités améliorées du modèle Gemini 3.5.

Lire →