Que sont les audio tags ? Le guide complet du TTS émotionnel
- Rédigé par
- Jack Limebear
- Publié
- Dernière mise à jour
ÉcouterÉcouter cet article
Les audio tags sont des indications entre crochets, rédigées en langage naturel, comme [rit], [halète], [enthousiaste] ou [inquiet], qu’Eleven v3 interprète comme des consignes de jeu plutôt que comme des mots à prononcer. Lorsque vous rédigez un script pour un modèle de synthèse vocale, insérer ces audio tags vous permet de contrôler avec précision la dimension émotionnelle de votre texte.Eleven v3, le prompt audio devient une compétence essentielle. Au lieu de simplement écrire ou coller le texte à faire lire par la voix IA, vous pouvez maintenant utiliser une nouvelle fonctionnalité — Tags audio — pour tout contrôler, de l’émotion à l’interprétation.
Eleven v3 est une version alpha aperçu de recherche du nouveau modèle. Il demande plus de prompt engineering que les versions précédentes — mais les résultats sont bluffants.
Les Audio Tags ElevenLabs sont des mots entre crochets que le nouveau modèle Eleven v3 peut interpréter pour guider l’action sonore. Cela peut aller de [excité], [chuchote], [soupire] à [coup de feu], [applaudissements] ou [explosion].
Les Audio Tags vous permettent de façonner la manière dont
Ce guide explique ce que sont les audio tags, leur fonctionnement, les différentes catégories disponibles, et leur comparaison avec SSML (Speech Synthesis Markup Language). Nous aborderons aussi les cas d’usage courants, chacun renvoyant vers un guide dédié.
Vous pouvez placer des Audio Tags n’importe où dans votre script pour ajuster l’interprétation en temps réel. Il est aussi possible de combiner plusieurs tags dans un même script ou même une phrase. Les tags se répartissent en grandes catégories :
Résumé :
Ces tags vous aident à définir le ton émotionnel de la voix — qu’il soit sombre, intense ou enjoué. Par exemple, vous pouvez utiliser un ou plusieurs de [triste], [en colère], [joyeusement] ou [affligé].
Les audio tags s’intègrent directement dans votre script, entre crochets. Dès que vous souhaitez modifier l’interprétation — par exemple passer d’un ton neutre à [inquiet] — il suffit d’ajouter un audio tag.
Ces tags concernent davantage le ton et la performance. Utilisez-les pour ajuster le volume et l’énergie selon la scène, qu’elle soit retenue ou énergique. Exemples : [chuchote], [crie] ou même [accent x].
Réactions humaines
L’architecture d’Eleven v3 permet au modèle de lire le contexte à un niveau bien plus fin que les versions précédentes, et de suivre les indications émotionnelles, les changements de ton, les transitions d’interlocuteur et les indices contextuels, sans paramétrage supplémentaire. Indiquez simplement ce que requiert la situation, le modèle interprétera la réplique comme vous l’avez imaginée.
Eleven v3 gère aussi les dialogues à plusieurs voix de façon naturelle, y compris les interruptions, les changements d’humeur et la dynamique d’une vraie conversation, uniquement à partir des tags et de la structure du script.
Balises audio vs. SSML
Si vous avez déjà utilisé d’autres systèmes TTS, vous connaissez sans doute le Speech Synthesis Markup Language. Des plateformes comme Amazon Polly ou Microsoft Azure Speech utilisent des balises SSML comme <break> ou <emphasis> pour ajouter du contexte à un script TTS.dialogues multi-interlocuteurs qui semblent spontanés — avec interruptions, changements d’humeur et nuances de conversation, le tout avec un minimum de prompt.
Disponible dès maintenant
Eleven v3 ne prend pas en charge les balises SSML, y compris les pauses. À la place, les audio tags, la ponctuation et la structure même du texte prennent le relais, tout en offrant un contrôle précis sur l’interprétation.
Eleven v3 est disponible dans l’interface ElevenLabs, et nous proposons 80% de réduction jusqu’à fin juin. L’API publique pour Eleven v3 (alpha) est aussi disponible. Que vous testiez ou que vous déployiez à grande échelle, c’est le moment d’explorer les possibilités.
Le tableau ci-dessous vous permet de retrouver l’équivalent Eleven v3 des balises SSML les plus courantes.

Pour un auteur, ajouter [chuchote] à une réplique est bien plus simple que de configurer un taux de prosodie.interprète — et ne fait pas que lire — repose sur la maîtrise des Audio Tags. Nous avons préparé sept guides courts et pratiques pour montrer comment des tags comme [CHUCHOTE], [RIT DOUCEMENT], ou [accent français] vous permettent de gérer le contexte, l’émotion, le rythme et même les dialogues multi-personnages avec un seul modèle.
Catégories d’audio tags dans v3 : Diriger l’interprétation avec les audio tags
- Contexte situationnel – Des tags comme
[CHUCHOTE],[CRIE], et[SOUPIRE]permettent à Eleven v3 de réagir à la situation — pour accentuer la tension, adoucir un avertissement ou marquer une pause. - Interprétation de personnage – De
[voix de pirate]à[accent français], les tags transforment la narration en jeu de rôle. Changez de personnage en cours de phrase et dirigez des interprétations complètes sans changer de modèle. - Contexte émotionnel – Des indices comme
[soupire],[enthousiaste], ou[fatigué]guident les émotions à chaque instant, ajoutant tension, soulagement ou humour — sans réenregistrement. - Intelligence narrative – Raconter, c’est aussi gérer le rythme. Des tags comme
[pause],[émerveillé], ou[ton dramatique]contrôlez le rythme et l’accentuation pour que - Dialogue multi-personnages – Écrivez des répliques qui se chevauchent ou des échanges rapides avec
[interrompt],[superposé], ou des changements de ton. Un seul modèle, plusieurs voix — une conversation naturelle en une seule prise. - Contrôle de l’interprétation – Ajustez précisément le rythme et l’accent. Des tags comme
[pause],[pressé], ou[étiré]permettent de moduler le tempo et de transformer un texte simple en véritable performance. - Imitation d’accent – Changez de région à la volée —
[accent américain],[accent britannique],[accent du sud des États-Unis]et bien d’autres — pour une parole riche culturellement, sans changer de modèle.










