Google vient de dévoiler deux nouveaux modèles spécialisés dans la génération vocale. Gemini 3.8 Flash TTS peut notamment reproduire le profil vocal d’une personne à partir d’un enregistrement de seulement 30 secondes. Une capacité spectaculaire, qui s’accompagne toutefois de plusieurs protections destinées à limiter les détournements et les deepfakes.
À retenir
- Gemini 3.8 Flash TTS peut reproduire une voix à partir d’un simple échantillon audio de 30 secondes.
- Google exige une preuve de consentement du propriétaire de la voix avant d’autoriser sa reproduction.
- Les contenus générés sont marqués avec SynthID et la fonction de réplication vocale n’est pour l’instant pas disponible dans l’Espace économique européen.
Trente secondes pourraient désormais suffire pour reproduire une voix avec les outils de Google. L’entreprise vient d’annoncer Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS, deux nouveaux modèles de synthèse vocale destinés notamment aux développeurs, créateurs de contenus et entreprises.
Google ne cantonne toutefois pas son nouveau modèle à la reproduction d’une personne existante. Gemini 3.8 Flash TTS peut générer entièrement de nouvelles voix à partir d’instructions en langage naturel, en définissant par exemple leur accent, leur rôle ou différentes caractéristiques vocales. Plus de 100 langues et dialectes sont prises en charge et Google annonce par ailleurs une bibliothèque comptant plus de 2 000 voix prêtes à l’emploi.
Seulement 30 secondes pour reproduire une voix
La fonction la plus impressionnante demeure la « voice replication ». Google explique que Gemini 3.8 Flash TTS peut recréer un profil vocal cohérent à partir de 30 secondes d’audio.
Une fois la voix créée, elle peut être conservée puis réutilisée sur différents contenus. Le modèle sait également maîtriser finement son interprétation : rythme, émotions, accent ou pauses peuvent être ajustés ligne par ligne. Il peut même générer des rires, des soupirs ou d’autres réactions afin de rendre une conversation plus naturelle.
Google vise en particulier les livres audio, podcasts, jeux vidéo, doublages ou agents vocaux. Le modèle est aussi conçu pour conserver une voix stable pendant plusieurs heures, afin d’éviter que son timbre ne se modifie progressivement au fil d’un long contenu.
Google veut empêcher le clonage vocal sans consentement
Une telle technologie soulève évidemment une question : quelques secondes d’un podcast, d’une vidéo YouTube ou d’un message vocal pourraient théoriquement suffire à s’approprier la voix d’une personne.
Google impose donc plusieurs garde-fous. La reproduction est réservée à sa propre voix ou à une voix dont l’utilisateur détient les droits. Avant de créer le profil, le propriétaire doit fournir un enregistrement verbal attestant son consentement. Le système vérifie ensuite que cette personne correspond bien au locuteur entendu dans l’échantillon de référence.
Tous les contenus audio produits par les modèles Gemini Audio intègrent également SynthID, le filigrane invisible mis au point par Google pour identifier les contenus générés par ses modèles. La société évoque aussi l’usage d’informations d’authenticité C2PA pour renforcer la traçabilité.
Le clonage vocal n’est pas encore disponible en Europe
Gemini 3.8 Flash TTS entame son déploiement dans Gemini API et Google AI Studio, et doit également arriver dans Gemini Notebook. La version Flash-Lite, conçue pour produire de gros volumes d’audio à moindre coût, est notamment prévue dans Google Vids.
Les Européens devront cependant patienter avant de tester la fonction la plus remarquable. Google précise que la réplication de voix dans AI Studio n’est pas disponible pour l’instant dans l’Espace économique européen, ni au Royaume-Uni, en Suisse, en Inde et dans certains États américains.
Google dispose donc déjà de la technologie permettant de recréer une voix avec quelques dizaines de secondes d’enregistrement seulement. Il reste désormais à déterminer jusqu’où cette possibilité pourra être déployée sans favoriser, dans le même temps, la multiplication des imitations et des deepfakes vocaux.







