Les intelligences artificielles capables de lire un texte à haute voix existent déjà depuis longtemps. Les technologies récentes de text-to-speech vont même beaucoup plus loin, avec des voix synthétiques particulièrement naturelles.
Mais l’initiative annoncée en Inde par ElevenLabs et le gouvernement du Karnataka poursuit un objectif différent : permettre à des personnes ayant perdu la capacité de parler de communiquer à nouveau avec une version numérique de leur propre voix.
De la lecture d’un texte à la reconstruction d’une identité vocale
Une IA de synthèse vocale traditionnelle fonctionne simplement : on lui fournit un texte et elle le transforme en parole avec une voix disponible dans le système.
La restauration vocale ajoute une étape essentielle.
À partir d’enregistrements existants d’une personne — par exemple d’anciens messages, vidéos ou conversations — l’IA peut analyser les caractéristiques de sa voix et créer un modèle vocal personnalisé. La personne peut ensuite saisir un texte qui sera prononcé non plus par une voix générique, mais par une reconstruction numérique de sa propre voix. ElevenLabs utilise déjà cette approche dans son programme consacré aux personnes ayant subi une perte permanente de la parole.
C’est donc moins le principe du texte → parole qui constitue la nouveauté que son utilisation pour préserver ou restituer l’identité vocale d’une personne.
Un programme de restauration vocale au Karnataka
Le gouvernement du Karnataka et ElevenLabs viennent de signer un accord portant notamment sur la restauration vocale par IA pour des personnes ayant perdu la capacité de parler.
Le programme prévoit notamment l’accès à des licences gratuites à vie pour certains bénéficiaires éligibles, avec une attention particulière portée au kannada. Le partenariat doit également travailler sur l’accessibilité des services publics et sur un cadre de sécurité destiné à lutter contre les deepfakes, la fraude vocale et le clonage de voix sans consentement.
Cette dernière dimension est importante : la même technologie capable de restituer une voix peut également être détournée pour imiter quelqu’un.
L’enjeu devient donc double : rendre une identité vocale à ceux qui l’ont perdue tout en protégeant cette identité contre son utilisation abusive.
En savoir plus sur InnovDigit
Subscribe to get the latest posts sent to your email.