«Dice todo lo correcto, pero no suena a persona».
Es lo primero que suelen comentar quienes han probado a integrar un agente telefónico con IA.
¡Hola! Somos Sonetho. ⚡
Quienes han creado su propio agente telefónico con IA tras leer nuestra Parte 1 (Introducción) y Parte 2 (Agencia inmobiliaria) nos han transmitido repetidamente la misma inquietud:
El guion es impecable, pero el agente responde con el mismo tono exacto tanto ante un cliente enfadado como al cerrar un acuerdo.
Cuando una persona cambiaría de forma natural el tono de voz y la IA no lo hace, quien escucha piensa de inmediato: «Otra IA más», y desconecta.
Para solucionar precisamente esta limitación, ElevenLabs desarrolló el modo expresivo (Expressive mode).
⚠️ Antes de empezar, conviene aclarar algo: no se trata de una función recién estrenada.
Se anunció oficialmente en el blog de ElevenLabs en febrero de 2026.
Sin embargo, como en la documentación oficial no figura la fecha de publicación, muchas personas la están descubriendo ahora por primera vez, y ha sido la pregunta más repetida a lo largo de esta serie.
Por eso, hoy te explicamos cómo configurar el Expressive mode.
🎭 1. El modo expresivo hace funcionar dos elementos a la vez
No es un simple botón para «añadir emoción», sino una actualización simultánea en dos componentes del flujo conversacional:
① Eleven v3 Conversational (la síntesis de voz)
Es una versión del modelo v3 optimizada con menor latencia para conversaciones en tiempo real. La clave está en que mantiene el contexto del diálogo de un turno a otro.
Si el usuario suena preocupado, el agente responde con un tono más calmado; y en los puntos donde debe transmitir la información con precisión, articula con mayor claridad.
② El nuevo sistema de turn-taking (la escucha activa)
Determina cuándo hablar y cuándo esperar basándose en las señales en tiempo real de Scribe v2 Realtime.
No se limita a analizar el texto transcrito, sino que evalúa cómo se pronunció (la entonación).
El ejemplo de la documentación oficial es muy intuitivo:
Un simple «Sí» puede significar que el usuario ya terminó de hablar o ser solo una señal de que va a continuar con su frase.
Leyendo solo el texto plano es imposible distinguirlo, pero la entonación marca la diferencia. El sistema detecta ese matiz para elegir el momento exacto en el que debe intervenir.
Por eso, al activar el modo expresivo obtienes dos ventajas a la vez: una voz con matices emocionales y muchas menos interrupciones a destiempo.
⚙️ 2. Cómo activarlo: basta con cambiar un solo modelo
No hay ningún interruptor adicional: al seleccionar V3 Conversational como modelo de TTS, el modo expresivo se activa por defecto.
Desde el panel de control (Dashboard)
Abre tu agente, entra en la pestaña Agent Voice, cambia el modelo de Text to Speech a V3 Conversational y guarda los cambios. Eso es todo.
Desde la CLI
elevenlabs agents pull --agent "<nombre-del-agente>"En el archivo descargado agent_configs/<nombre-del-agente>.json, modifica el parámetro conversation_config.tts.model_id de esta forma:
{
"conversation_config": {
"tts": {
"model_id": "eleven_v3_conversational"
}
}
}elevenlabs agents push --agent "<nombre-del-agente>"
Desde la API
from elevenlabs import ElevenLabs
elevenlabs = ElevenLabs()
elevenlabs.conversational_ai.agents.update(
agent_id="TU_AGENT_ID_AQUI",
conversation_config={
"tts": {"model_id": "eleven_v3_conversational"},
},
)
Empieza gratis con ElevenAgents →
📝 3. El tono se define en el system prompt
Si solo cambias el modelo, el abanico emocional será más amplio, pero cuándo y cómo utilizarlo quedará a criterio exclusivo del modelo.
Si tu marca tiene un tono definido o protocolos de atención, debes indicarlo en el system prompt para mantener la coherencia.
Método ①: Definir una orientación general
Eres un agente de atención al cliente. Si el usuario suena frustrado o enfadado,
responde con un tono sereno y tranquilizador. Cuando comuniques buenas noticias,
transmite una calidez genuina en la voz. En general, mantén un trato profesional
pero cercano y accesible.
Método ②: Fijar pautas por escenario
Pautas de tono:
- Si el usuario muestra disconformidad: usa un tono calmado y empático.
- Al explicar procedimientos técnicos: habla de forma clara y a velocidad constante.
- Si el usuario comparte buenas noticias: responde con calidez y entusiasmo.
- Al gestionar reclamaciones: mantén una actitud serena y orientada a la solución.
La documentación oficial aclara que no es necesario colocar etiquetas en cada situación.
Si redactas las instrucciones en lenguaje natural como en los ejemplos anteriores, el modelo sabrá interpretar el contexto.
En la práctica, la opción ② es la más segura: si trabajas en un sector con protocolos de atención, dejar por escrito «qué tono usar en cada caso» facilita mucho las revisiones de calidad posteriores.
🏷️ 4. Ajustes puntuales mediante etiquetas
Por encima de la modulación contextual, puedes forzar cambios en fragmentos concretos haciendo que el LLM devuelva etiquetas directamente en su respuesta.
[laughs]añade una risa[whispers]baja la voz a un susurro[sighs]introduce un matiz de suspiro[slow]reduce el ritmo al hablar[excited]aporta un tono emocionado
★ Aquí es donde suele surgir la mayor confusión: una etiqueta no altera la frase entera.
Cada etiqueta influye únicamente en las 4 o 5 palabras inmediatamente posteriores, tras lo cual la voz regresa a su tono habitual.
Por tanto, colocar una etiqueta al principio de una frase larga esperando que afecte a toda la intervención no funcionará.
Debes insertarla justo antes del punto exacto donde quieras aplicar el efecto.
Este es el ejemplo que ofrece la documentación oficial:
"That's great to hear! [laughs] I'm glad we could sort that out for you."
Si es tu primera vez trabajando con etiquetas, te recomendamos revisar antes nuestra Guía completa de prompts para ElevenLabs, donde analizamos a fondo el uso de etiquetas con el modelo v3.
Allí recopilamos desde etiquetas emocionales y efectos de sonido hasta pautas para afinar la pronunciación y las pausas.
⚠️ 5. Limitaciones que debes evaluar antes de activarlo
La documentación oficial detalla tres limitaciones importantes, y la primera de ellas es fundamental:
① No conserva las características de la clonación de voz profesional (PVC)
Si has invertido tiempo y recursos en crear una clonación profesional (PVC) de la voz del director general o de un locutor, este factor condicionará por completo tu decisión.
Por ahora, Eleven v3 Conversational no retiene bien las características del PVC.
El resultado final puede sonar perceptiblemente distinto a la voz original clonada.
La recomendación de la documentación oficial es tajante: si la identidad exacta de tu voz PVC es prioritaria, utiliza Flash v2.
En otras palabras, toca elegir entre «mayor expresividad emocional o la voz exacta de esa persona»; contar con ambas a la vez aún no es posible.
② El efecto de las etiquetas solo abarca 4 o 5 palabras
Como explicamos más arriba: no están diseñadas para transformar oraciones completas de principio a fin.
③ El resultado varía según la voz y el idioma
Admite más de 70 idiomas, lo que supone un salto notable frente a los cerca de 32 idiomas de la serie Flash.
La documentación oficial destaca mejoras evidentes en lenguas que antes mostraban menos riqueza de matices, como el japonés.
No obstante, el mismo documento advierte de que la expresividad no es homogénea en todos los idiomas.
Si vas a implementar un agente para atender en español, lo adecuado es hacer varias pruebas directamente en español y con la voz definitiva antes de sacarlo a producción. Que una demo en inglés suene impecable no garantiza que en español ocurra exactamente lo mismo.
💰 6. No incrementa los costes
Es una duda muy común, pero la respuesta oficial en las FAQ es tajante: «No».
Eleven v3 Conversational mantiene el mismo precio por minuto que los demás modelos de TTS para agentes, a partir de 0,08 $ por minuto. Activar el modo expresivo no añade ningún recargo adicional.
Si quieres calcular el presupuesto mensual según tu volumen estimado de llamadas, puedes introducir los minutos en nuestra calculadora de tarifas.
✍️ Para terminar
A modo de resumen:
Cómo activarlo: Selecciona V3 Conversational como modelo de TTS. Eso es todo.
Cómo afinarlo: Define en el system prompt el tono para cada situación mediante frases en lenguaje natural.
Cómo aplicarlo puntualmente: Inserta etiquetas justo antes de las palabras donde desees aplicar énfasis (solo afecta a unas 4 o 5 palabras).
Cuándo descartarlo: Si utilizas voces clonadas con PVC, compara primero los resultados antes de dar el salto.
¡Gracias por leernos! ⚡