Salta al contenido

¿Qué son las etiquetas de audio? Guía completa para Texto a Voz emocional

Escrito por
Jack Limebear
Publicado
Última actualización

EscucharEscucha este artículo

Las etiquetas de audio son indicaciones entre corchetes escritas en lenguaje natural, como [ríe], [suspira], [emocionado] o [preocupado], que Eleven v3 interpreta como instrucciones de interpretación en vez de palabras que debe pronunciar. Al escribir un guion para un modelo de texto a voz, añadir estas etiquetas te da control total sobre la entonación emocional de tu texto.Eleven v3, el audio prompting se ha convertido en una habilidad esencial. Ahora, en vez de solo escribir o pegar el texto que quieres que diga la voz IA, puedes usar una nueva función — Etiquetas de audio — para controlar desde la emoción hasta la entonación.

Eleven v3 es una versión alfa en fase de investigación del nuevo modelo. Requiere más prompt engineering que los modelos anteriores, pero los resultados son sorprendentes.

Las Audio Tags de ElevenLabs son palabras entre corchetes que el nuevo modelo Eleven v3 interpreta para dirigir la acción sonora. Pueden ser desde [excited], [whispers] y [sighs] hasta [gunshot], [clapping] o [explosion].

Las etiquetas de audio te permiten definir cómo

En esta guía te explicamos qué son las etiquetas de audio, cómo funcionan, todas las categorías disponibles y cómo se comparan con SSML (Speech Synthesis Markup Language). También verás casos de uso habituales, cada uno enlazado a su propia guía.

Puedes colocar Audio Tags en cualquier parte de tu guion para ajustar la entonación en tiempo real. También puedes combinar varias tags en un mismo guion o incluso en una frase. Las tags se agrupan en varias categorías principales:

Resumen:

Estas tags te ayudan a marcar el tono emocional de la voz, ya sea serio, intenso o alegre. Por ejemplo, puedes usar una o varias como [sad], [angry], [happily] o [sorrowful].

Background
Background

Las etiquetas de audio se colocan dentro del texto y van entre corchetes. Cuando quieras cambiar la entonación, por ejemplo de normal a [preocupado], solo tienes que añadir una etiqueta de audio.

Estas tags se centran más en el tono y la interpretación. Puedes usarlas para ajustar el volumen y la energía en escenas que requieren contención o fuerza. Ejemplos: [whispers], [shouts] o incluso [x accent].

Background
Background

Reacciones humanas

La arquitectura de Eleven v3 permite que el modelo entienda el contexto a un nivel más profundo que versiones anteriores, siguiendo indicaciones emocionales, cambios de tono, transiciones de hablante y pistas contextuales sin necesidad de parámetros o ajustes extra. Solo tienes que indicar al modelo lo que buscas y lo interpretará tal como lo has planeado.

Background
Background

Eleven v3 también gestiona diálogos con varios hablantes de forma natural, incluyendo interrupciones, cambios de humor y el ritmo real de una conversación, todo solo con etiquetas y la estructura del guion.

Etiquetas de audio vs. SSML

Si has usado otros sistemas TTS, seguramente conozcas Speech Synthesis Markup Language. Plataformas como Amazon Polly y Microsoft Azure Speech usan etiquetas SSML como <break> o <emphasis> para añadir contexto a un guion TTS.diálogos con varios personajes que suenan espontáneos, gestionando interrupciones, cambios de humor y matices conversacionales con muy poco prompting.

Disponible ya

Eleven v3 no es compatible con etiquetas SSML como break ni con el resto del conjunto SSML. En su lugar, las etiquetas de audio, la puntuación y la propia estructura del texto asumen ese papel, permitiendo un control preciso sobre la entonación.

Eleven v3 está disponible en la interfaz de ElevenLabs y ofrecemos un 80% de descuento hasta finales de junio. La API pública de Eleven v3 (alfa) también está disponible. Tanto si quieres experimentar como si vas a escalar, ahora es el momento de descubrir todo lo que puedes hacer.

Puedes usar la tabla de abajo para ver la equivalencia entre etiquetas SSML habituales y las de Eleven v3.

Desde el punto de vista de quien escribe, añadir [susurra] a una frase es mucho más sencillo que configurar la velocidad de la prosodia.interpreta — no solo lee — depende de dominar las Audio Tags. Hemos preparado siete guías prácticas y breves que muestran cómo tags como [SUSURRANDO], [RÍE SUAVEMENTE], o [acento francés] te permiten definir el contexto, la emoción, el ritmo e incluso el diálogo entre varios personajes con un solo modelo.

Categorías de etiquetas de audio en v3: Dirige la interpretación con etiquetas de audio

  • Conciencia situacional – Tags como [SUSURRANDO], [GRITANDO], y [SUSPIRA] permiten que Eleven v3 reaccione al momento: subiendo la tensión, suavizando advertencias o haciendo pausas para crear suspense.
  • Interpretación de personajes – Desde [voz de pirata] hasta [acento francés], las tags convierten la narración en interpretación. Cambia de personaje en mitad de una frase y dirige interpretaciones completas sin cambiar de modelo.
  • Contexto emocional – Señales como [suspira], [emocionado], o [cansado] marcan el sentimiento en cada momento, añadiendo tensión, alivio o humor, sin necesidad de volver a grabar.
  • Inteligencia narrativa – Contar historias es cuestión de ritmo. Tags como [pausa], [asombro], o [tono dramático] controla el ritmo y el énfasis para que
  • Diálogo entre varios personajes – Escribe líneas superpuestas y réplicas rápidas con [interrumpiendo], [superpuesto], o cambios de tono. Un solo modelo, muchas voces: conversación natural en una sola toma.
  • Control de entonación – Ajusta el ritmo y el énfasis al detalle. Tags como [pausa], [apresurado], o [alargado] te dan precisión sobre el tempo, convirtiendo texto plano en interpretación.
  • Imitación de acentos – Cambia de región al instante: [acento americano], [acento británico], [acento del sur de EE. UU.] y más, para voces con riqueza cultural sin cambiar de modelo.

Artículos relacionados

Crea con el audio IA de la más alta calidad