Une femme parlant à son smartphone.
par Jelena Kostic, Unsplash.
Accueil » Web » Google peut désormais cloner une voix à partir de 30 secondes d’audio
Web

Google peut désormais cloner une voix à partir de 30 secondes d’audio

par La Rédaction, publié le 23.09.2026 à 20h39

Google vient de dévoiler deux nouveaux modèles spécialisés dans la génération vocale. Gemini 3.8 Flash TTS peut notamment reproduire le profil vocal d’une personne à partir d’un enregistrement de seulement 30 secondes. Une capacité spectaculaire, qui s’accompagne toutefois de plusieurs protections destinées à limiter les détournements et les deepfakes.

À retenir

  • Gemini 3.8 Flash TTS peut reproduire une voix à partir d’un simple échantillon audio de 30 secondes.
  • Google exige une preuve de consentement du propriétaire de la voix avant d’autoriser sa reproduction.
  • Les contenus générés sont marqués avec SynthID et la fonction de réplication vocale n’est pour l’instant pas disponible dans l’Espace économique européen.

Trente secondes pourraient désormais suffire pour reproduire une voix avec les outils de Google. L’entreprise vient d’annoncer Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS, deux nouveaux modèles de synthèse vocale destinés notamment aux développeurs, créateurs de contenus et entreprises.

Google ne cantonne toutefois pas son nouveau modèle à la reproduction d’une personne existante. Gemini 3.8 Flash TTS peut générer entièrement de nouvelles voix à partir d’instructions en langage naturel, en définissant par exemple leur accent, leur rôle ou différentes caractéristiques vocales. Plus de 100 langues et dialectes sont prises en charge et Google annonce par ailleurs une bibliothèque comptant plus de 2 000 voix prêtes à l’emploi.

Seulement 30 secondes pour reproduire une voix

La fonction la plus impressionnante demeure la « voice replication ». Google explique que Gemini 3.8 Flash TTS peut recréer un profil vocal cohérent à partir de 30 secondes d’audio.

Une fois la voix créée, elle peut être conservée puis réutilisée sur différents contenus. Le modèle sait également maîtriser finement son interprétation : rythme, émotions, accent ou pauses peuvent être ajustés ligne par ligne. Il peut même générer des rires, des soupirs ou d’autres réactions afin de rendre une conversation plus naturelle.

Google vise en particulier les livres audio, podcasts, jeux vidéo, doublages ou agents vocaux. Le modèle est aussi conçu pour conserver une voix stable pendant plusieurs heures, afin d’éviter que son timbre ne se modifie progressivement au fil d’un long contenu.

Google veut empêcher le clonage vocal sans consentement

Une telle technologie soulève évidemment une question : quelques secondes d’un podcast, d’une vidéo YouTube ou d’un message vocal pourraient théoriquement suffire à s’approprier la voix d’une personne.

Google impose donc plusieurs garde-fous. La reproduction est réservée à sa propre voix ou à une voix dont l’utilisateur détient les droits. Avant de créer le profil, le propriétaire doit fournir un enregistrement verbal attestant son consentement. Le système vérifie ensuite que cette personne correspond bien au locuteur entendu dans l’échantillon de référence.

Tous les contenus audio produits par les modèles Gemini Audio intègrent également SynthID, le filigrane invisible mis au point par Google pour identifier les contenus générés par ses modèles. La société évoque aussi l’usage d’informations d’authenticité C2PA pour renforcer la traçabilité.

Le clonage vocal n’est pas encore disponible en Europe

Gemini 3.8 Flash TTS entame son déploiement dans Gemini API et Google AI Studio, et doit également arriver dans Gemini Notebook. La version Flash-Lite, conçue pour produire de gros volumes d’audio à moindre coût, est notamment prévue dans Google Vids.

Les Européens devront cependant patienter avant de tester la fonction la plus remarquable. Google précise que la réplication de voix dans AI Studio n’est pas disponible pour l’instant dans l’Espace économique européen, ni au Royaume-Uni, en Suisse, en Inde et dans certains États américains.

Google dispose donc déjà de la technologie permettant de recréer une voix avec quelques dizaines de secondes d’enregistrement seulement. Il reste désormais à déterminer jusqu’où cette possibilité pourra être déployée sans favoriser, dans le même temps, la multiplication des imitations et des deepfakes vocaux.

Partager cet article

A propos de l'auteur

La Rédaction

La rédaction de Pixel-Replay choisit pour vous plus d'une dizaine de sujets d'actualité triés sur le volet, chaque jour, pour vous informer. Les articles sont rédigés par l'humain, avec l'aide de l'IA, qui intervient dans la mise en page SEO et apporte des informations de contexte additionnelles. Chaque information publiée est vérifiée, éditée et écrite par les membres de l'équipe. Parmi nos formats, les actualités sont les seuls articles dans lesquels l'IA intervient dans un rôle d'aide à la rédaction.
NEWSLETTER

Inscrivez-vous à notre newsletter

Recevez chaque semaine notre sélection des meilleurs tests, analyses, dossiers et actualités Gaming & Tech.

Social

Rejoignez Pixel Replay

Suivez-nous sur vos plateformes préférées et ne manquez rien de l’actualité Gaming & Tech.

X

News et coulisses en temps réel.

SUIVRE →

Youtube

Vidéos, tests et découvertes.

SUIVRE →

Facebook

Rejoignez la communauté.

SUIVRE →

Twitch

Lives et rediffusions.

SUIVRE →

Instagram

Stories et actus en images.

SUIVRE →