Salta al contenuto

Cosa sono gli audio tag? Guida completa al TTS emozionale

Scritto da
Jack Limebear
Pubblicato
Ultimo aggiornamento

AscoltaAscolta questo articolo

Gli audio tag sono indicazioni tra parentesi quadre, scritte in linguaggio naturale, come [ride], [ansima], [entusiasta] e [preoccupato], che Eleven v3 interpreta come istruzioni di interpretazione e non come parole da pronunciare. Quando scrivi uno script per un modello di text to speech, inserire questi audio tag ti permette di controllare nel dettaglio la resa emotiva del tuo testo.Eleven v3, il prompting audio è appena diventato una competenza fondamentale. Ora, invece di scrivere o incollare semplicemente le parole che vuoi far dire alla voce IA, puoi usare una nuova funzione — Audio Tag — per controllare tutto, dall’emozione alla resa.

Eleven v3 è una versione alpha anteprima di ricerca del nuovo modello. Richiede più prompt engineering rispetto ai modelli precedenti — ma i risultati sono sorprendenti.

Gli Audio Tag di ElevenLabs sono parole racchiuse tra parentesi quadre che il nuovo modello Eleven v3 può interpretare e usare per guidare l’azione sonora. Possono essere qualsiasi cosa: da [excited], [whispers] e [sighs] fino a [gunshot], [clapping] e [explosion].

I Tag Audio ti permettono di modellare come

In questa guida trovi cosa sono gli audio tag, come funzionano, tutte le categorie disponibili e il confronto con SSML (Speech Synthesis Markup Language). Vedrai anche i casi d’uso più comuni, ognuno con una guida dedicata.

Puoi inserire gli Audio Tag ovunque nel tuo script per modellare la resa in tempo reale. Puoi anche combinare più tag nello stesso script o addirittura nella stessa frase. I tag si dividono in categorie principali:

In sintesi:

Questi tag ti aiutano a impostare il tono emotivo della voce — che sia cupo, intenso o allegro. Ad esempio puoi usare uno o più tra [sad], [angry], [happily] e [sorrowful].

Background
Background

Gli audio tag si inseriscono direttamente nel testo e sono racchiusi tra parentesi quadre. Ogni volta che vuoi cambiare la resa, ad esempio da normale a [preoccupato], ti basta aggiungere un audio tag.

Questi riguardano più il tono e la performance. Puoi usare questi tag per regolare volume ed energia in scene che richiedono delicatezza o forza. Esempi: [whispers], [shouts] e anche [x accent].

Background
Background

Reazioni umane

L’architettura di Eleven v3 permette al modello di leggere il contesto in modo più profondo rispetto alle versioni precedenti, seguendo indicazioni emotive, cambi di tono, passaggi tra speaker e segnali contestuali senza bisogno di parametri o impostazioni aggiuntive. Basta dire al modello cosa serve in quel momento e interpreterà la battuta esattamente come l’hai pensata.

Background
Background

Eleven v3 gestisce anche dialoghi con più speaker in modo spontaneo, incluse interruzioni, cambi di umore e il naturale botta e risposta di una conversazione reale, tutto grazie ai tag e alla struttura dello script.

Audio tag vs. SSML

Se hai già lavorato con altri sistemi TTS, probabilmente conosci il Speech Synthesis Markup Language. Piattaforme come Amazon Polly e Microsoft Azure Speech usano tag SSML come <break> o <emphasis> per aggiungere contesto a uno script TTS.dialoghi multi-personaggio che sembrano spontanei — gestendo interruzioni, cambi di umore e sfumature conversazionali con pochissimo prompting.

Disponibile ora

Eleven v3 non supporta i tag SSML come break o il resto dei tag SSML. Al loro posto, audio tag, punteggiatura e la struttura stessa del testo svolgono questa funzione, offrendo comunque un controllo preciso sulla resa.

Eleven v3 è disponibile nell’interfaccia ElevenLabs e offriamo l’80% di sconto fino alla fine di giugno. La Public API per Eleven v3 (alpha) è anche disponibile. Che tu stia sperimentando o lavorando su larga scala, ora è il momento di scoprire cosa puoi fare.

Puoi usare la tabella qui sotto per confrontare i tag SSML più comuni con l’equivalente in Eleven v3.

Dal punto di vista di chi scrive, aggiungere [sussurra] a una battuta è molto più semplice che configurare un parametro di prosodia.interpreta — e non si limita a leggere — dipende dalla padronanza degli Audio Tag. Abbiamo preparato sette guide pratiche e concise che mostrano come tag come [SUSSURRA], [RIDE PIANO], oppure [accento francese] ti permettono di modellare contesto, emozione, ritmo e persino dialoghi multi-personaggio con un solo modello.

Le categorie di audio tag in v3: come dirigere la performance con gli audio tag

  • Consapevolezza della situazione – Tag come [SUSSURRA], [URLO], e [SOSPIRO] permettono a Eleven v3 di reagire al momento — aumentando la tensione, smorzando avvertimenti o creando suspense con una pausa.
  • Performance del personaggio – Da [voce da pirata] a [accento francese], i tag trasformano la narrazione in interpretazione. Cambia personaggio a metà frase e dirigi performance complete senza cambiare modello.
  • Contesto emotivo – Segnali come [sospiro], [entusiasta], oppure [stanco] guidano le emozioni momento per momento, aggiungendo tensione, sollievo o umorismo — senza bisogno di nuove registrazioni.
  • Intelligenza narrativa – Raccontare storie è questione di tempi. Tag come [pausa], [meraviglia], oppure [tono drammatico] controlla ritmo ed enfasi così
  • Dialogo multi-personaggio – Scrivi battute sovrapposte e scambi rapidi con [interrompe], [si sovrappone], o cambi di tono. Un solo modello, tante voci — conversazioni naturali in un’unica sessione.
  • Controllo della resa – Regola ritmo ed enfasi nei dettagli. Tag come [pausa], [frettoloso], oppure [prolungato] ti danno precisione sul tempo, trasformando il testo in interpretazione.
  • Emulazione di accenti – Cambia regione al volo — [accento americano], [accento britannico], [accento sud degli Stati Uniti] e altri ancora — per un parlato ricco di sfumature culturali senza cambiare modello.

Articoli simili

Crea con l'audio IA della massima qualità