ElevenLabs: guida pratica per creare voci, musica ed effetti sonori con l’AI

L’intelligenza artificiale può trasformare un testo in una voce narrante, riprodurre una voce simile alla nostra, tradurre un video in un’altra lingua e persino generare musica ed effetti sonori. Tra gli strumenti che permettono di sperimentare con queste possibilità c’è ElevenLabs.

Ma come funziona davvero? E soprattutto, cosa si può fare concretamente senza avere competenze tecniche o attrezzature professionali?

Ho deciso di provarlo in prima persona, esplorando alcune delle sue funzionalità più interessanti. In questa guida ti mostro passo passo come utilizzare ElevenLabs, con esempi pratici e i miei risultati.

Indice

Cos’è ElevenLabs e a cosa serve?

ElevenLabs è una piattaforma di intelligenza artificiale specializzata nella generazione e nella manipolazione dell’audio. Permette di trasformare testi in parlato, clonare voci, doppiare contenuti in altre lingue e generare musica ed effetti sonori.

Le sue funzionalità possono essere utili in diversi contesti: dalla creazione di video e podcast alla produzione di audiolibri, fino alla realizzazione di contenuti creativi.

ElevenCreative ed ElevenAgents: qual è la differenza?

ElevenLabs comprende strumenti con obiettivi diversi, organizzati principalmente in due aree:

  • ElevenCreative è dedicato alla creazione e alla modifica di contenuti audio e multimediali, come voci narranti, doppiaggi, musica ed effetti sonori.
  • ElevenAgents permette invece di creare assistenti AI capaci di interagire con le persone attraverso conversazioni vocali o testuali, per esempio per rispondere alle domande dei clienti.

In questa guida mi concentrerò su ElevenCreative, per esplorare le sue funzionalità attraverso una serie di prove pratiche.

Trasformare un testo in una voce narrante: Text to Speech

Il Text to Speech consiste nella conversione di un testo scritto in un audio parlato.

È utile, per esempio, per aggiungere una voce narrante a un video, creare una versione audio di un articolo o realizzare un contenuto senza dover registrare personalmente la propria voce.

Come funziona

  • Accedi a ElevenLabs e clicca sulla funzionalità Text to Speech.
  • Inserisci il testo che vuoi trasformare in audio.
  • Scegli una voce tra quelle disponibili, prestando attenzione alla lingua e allo stile.
  • Se necessario, modifica le impostazioni disponibili.
  • Avvia la generazione e ascolta il risultato.
  • Se il risultato ti soddisfa, scarica il file audio.

Test e risultati

Per testarlo io ho usato un testo con cui valutare la pronuncia, le pause e l’intonazione della voce.

Ecco il risultato:

Personalmente, trovo le pause un po’ troppo lunghe e il tono poco emotivo, più adatto a contenuti divulgativi come documentari, video informativi o promozionali che a contenuti più dinamici e coinvolgenti.

La cosa interessante, però, è che dopo aver generato l’audio è possibile creare anche un video con una persona parlante, sincronizzata con la voce.

Clonare la propria voce

Questa è una delle funzionalità che mi incuriosiscono di più: creare una versione artificiale della propria voce, in grado di leggere anche testi che non abbiamo mai pronunciato.

L’AI utilizza una registrazione della nostra voce per riprodurne alcune caratteristiche. In questo modo possiamo generare nuovi contenuti audio senza dover registrare ogni frase personalmente.

Come funziona

  • Apri la sezione Creazione della voce
  • Seleziona Clonazione Vocale Istantanea (per un risultato veloce) o Clonazione Vocale Professionale (per un risultato più accurato).
  • Registra o carica un campione della tua voce. Più ne fornisci, più è accurato.
  • Completa la procedura per creare la voce.
  • Fai leggere alla voce clonata un testo, con la funzionalità Text to speech precedente.

Test e risultati

Per una questione di copyright della mia voce e, soprattutto, per evitare che possa essere utilizzata impropriamente, non caricherò il risultato. Ma vi assicuro che è stato assurdo!

Caricando appena 1 minuto e 30 secondi di parlato, lo strumento è riuscito a replicare la mia voce in modo impressionante e a farle pronunciare frasi che non ho mai detto.

Ho scaricato gli audio e li ho fatti ascoltare ad amici e familiari, senza dire loro che erano stati generati dall’AI. Ho semplicemente chiesto se riuscissero a capire che la voce non fosse reale. Nessuno ha notato nulla di strano: per tutti, sembrava essere la mia voce.

Quindi, da ora in poi, occhio a chi mandate messaggi vocali!

Creare una voce personalizzata con l’intelligenza artificiale

E se, invece di scegliere una voce già esistente o la propria, potessimo descrivere quella che abbiamo in mente e lasciare che sia l’AI a crearla?

Con Voice Design è possibile generare una voce a partire da una descrizione testuale, indicando caratteristiche come il timbro, l’accento e lo stile di parlato.

Come funziona

  • Seleziona Creazione della voce.
  • Apri la funzionalità Voice Design.
  • Inserisci una descrizione della voce che vorrei ottenere e avvia la generazione.
  • Ascolta le voci proposte e scelgo quella che preferisco.

Test e risultati

Questo è il prompt che ho utilizzato:

Voce maschile adulta, molto roca e profonda, con una leggera ruvidità naturale e una componente leggermente graffiata. Il tono deve essere caldo, credibile e realistico, senza risultare caricaturale.

Parlato chiaro e ben articolato, con un ritmo medio e naturale. La voce deve trasmettere sicurezza e calma, ma mantenere una certa personalità e presenza. Evitare un tono eccessivamente impostato, teatrale o da speaker radiofonico.

La respirazione deve essere leggermente percepibile e naturale, con piccole variazioni di intonazione e ritmo. La voce deve sembrare quella di una persona reale che parla normalmente, non quella di un doppiatore professionista.

Accento italiano neutro, senza inflessioni regionali marcate.

E questo è il risultato:

Questa volta il risultato è davvero molto in linea con quello che avevo chiesto: la voce è roca, profonda e soprattutto molto naturale. Il risultato mi è piaciuto davvero molto.

Musica, effetti sonori e doppiaggio

Dopo aver sperimentato con le voci, ti segnalo anche alcune delle funzionalità creative, adatte soprattutto a chi vuole creare video: la generazione di musica, effetti sonori e il doppiaggio di contenuti in altre lingue.

Generare effetti sonori

Puoi provare a generare un effetto sonoro partendo esclusivamente da una descrizione testuale. È possibile, ad esempio, descrivere un rumore ambientale, un’azione o un suono specifico e lasciare che l’AI provi a ricrearlo.

Per ottenere dei risultati più accurati, inserisci una descrizione in lingua inglese.

Questo il prompt che ho usato io:

Thin rubbery water balloon bursting with a loud splash on asphalt.

Ti verranno proposte quattro opzioni.

Questa secondo me quella che si avvicinava di più a cosa avevo in mente:

Alcune delle opzioni generate erano decisamente troppo eccessive, ma comunque in linea con la richiesta. Nel complesso, però, il risultato finale non è stato affatto male.

Generare una musica con l’AI

La generazione musicale permette di creare un brano partendo da una semplice descrizione, specificando elementi come genere, atmosfera e stile.

Ecco il testo che ho usato e il risultato che ho ottenuto:

Genera una musica rock emozionante e coinvolgente, che trasmetta un forte senso di rinascita, rivincita e ripartenza. Inizia con un’atmosfera più intensa e introspettiva, per poi crescere gradualmente fino a un’esplosione energica e liberatoria.

Utilizza chitarre elettriche potenti, batteria incisiva e un crescendo progressivo. Il risultato deve trasmettere emozione, forza e speranza, come il momento in cui, dopo aver superato un periodo difficile, si ritrova finalmente la voglia di ricominciare.

Stile cinematografico e rock, epico ma non eccessivamente aggressivo. La musica deve suscitare una forte emozione e lasciare una sensazione di energia, libertà e rinascita.

Il risultato è stato sorprendente. Non solo ha creato un brano perfettamente in linea con quanto avevo descritto, ma non mi aspettavo che generasse anche il testo della canzone e aggiungesse la voce di un cantante.

Te lo faccio ascoltare:

Ad ogni modo, se il risultato non convince, è comunque possibile modificarlo e provare a ottenere una versione più vicina a ciò che avevamo in mente, intervenendo sulle indicazioni fornite o rigenerando il brano.

L’unico limite che ho riscontrato è che, per esportare il brano e scaricare il file audio, è necessario un piano a pagamento.

Doppiare un video in un’altra lingua

Infine, ho provato la funzione di doppiaggio AI, che permette di tradurre l’audio di un video in un’altra lingua generando una nuova traccia vocale. L’obiettivo è mantenere il più possibile naturalezza, ritmo e caratteristiche della voce originale.

Per questa prova ho utilizzato la stessa voce che avevo generato precedentemente e ho provato a farla parlare in inglese.

La cosa che mi ha colpito di più è che la voce è rimasta la stessa e anche l’accento è risultato davvero perfetto, rendendo il doppiaggio molto naturale e credibile:

L’unica nota negativa di questa funzionalità è che consuma molti crediti.

Quanto costa ElevenLabs?

ElevenLabs propone diversi piani, compreso un piano gratuito con limiti di utilizzo (ad oggi 10.000 crediti al mese) .

Le funzionalità disponibili, i crediti inclusi e le condizioni possono cambiare nel tempo.Per questo motivo è utile controllare la pagina ufficiale dei prezzi e verificare quali strumenti siano inclusi nel proprio account.

Per le prove che ho effettuato ho potuto utilizzare il piano gratuito e mi sono avanzati circa metà dei crediti mensili. Solo per scaricare la musica è stato necessario il piano a pagamento.

La mia esperienza con ElevenLabs: conclusioni

Dopo aver provato diverse funzionalità, posso dire che ElevenLabs mi ha sorpreso soprattutto per la qualità e la semplicità d’uso. Non servono competenze tecniche o attrezzature particolari: basta descrivere ciò che si vuole ottenere, scegliere le impostazioni disponibili e lasciare che l’AI faccia il resto.

Le funzioni che mi hanno colpito maggiormente sono state sicuramente la clonazione della voce, per quanto sia impressionante la sua accuratezza, e la possibilità di creare voci completamente nuove partendo da una semplice descrizione.

La generazione di musica ed effetti sonori è invece particolarmente interessante per chi crea video o altri contenuti multimediali. Non tutti i risultati sono perfetti al primo tentativo, ma la possibilità di rigenerare e modificare le proposte permette di avvicinarsi progressivamente al risultato desiderato.

Nel complesso ElevenLabs è uno strumento che vale la pena provare, soprattutto se lavori con video, podcast, contenuti social o audio e vuoi sperimentare con l’intelligenza artificiale senza dover avere competenze specifiche nel settore.


Non perderti le ultime novità!

Iscriviti alla newsletter per ricevere i miei ultimi articoli inviati sulla tua e-mail.


AUTORE

Valentina Lanzuise

È una consulente informatica appassionata di intelligenza artificiale. In questo sito condivide guide pratiche e riflessioni sull’IA, esplorando come questa tecnologia può trasformare le attività giornaliere.

In un mondo dove puoi ottenere tutte le risposte, è importante saper fare le domande giuste.

Iscriviti alla newsletter per rimanere sempre al passo con le novità!