Voz de IA sem emoção? Ative o ElevenLabs Expressive Mode

Se o seu agente de IA soa igual tanto com clientes irritados quanto com boas notícias, veja como usar o Expressive Mode do ElevenLabs. Ele vem ativado por padrão ao mudar para o modelo TTS V3 Conversational. Aprenda a configurar via dashboard, CLI e API, guiar o tom no prompt de sistema, o limite de 4 a 5 palavras das tags e as limitações na clonagem de voz profissional (PVC).

“Fala tudo certo, mas não parece uma pessoa de verdade.”
Essa é a primeira frase que ouvimos de quem coloca um atendente telefônico com IA em operação.

Olá, aqui é a Sonetho. ⚡

Entre as pessoas que acompanharam a Parte 1 (Introdução) e a Parte 2 (Imobiliária) para criar atendentes telefônicos com IA, há um relato recorrente:

O roteiro é impecável, mas a IA fala no mesmo tom tanto com um cliente furioso quanto no momento em que um contrato é fechado.
Como a entonação da voz não muda onde qualquer pessoa mudaria, quem está ouvindo logo percebe — “é mais uma IA” — e se fecha.

 

O recurso que a ElevenLabs desenvolveu exatamente para resolver essa questão é o modo expressivo (Expressive mode).

⚠️ Antes de tudo, vale um esclarecimento: este não é um recurso recém-lançado.
Ele foi anunciado no blog oficial da plataforma em fevereiro de 2026.
No entanto, como a página da documentação oficial não exibe datas, muitas pessoas estão tendo contato com ele pela primeira vez agora — e essa foi a dúvida que mais recebemos ao longo desta série.
Por isso, apresentamos aqui como configurar o Expressive mode.

 


🎭 1. O modo expressivo opera em duas frentes conjuntas

 

Não se trata de um simples botão para ligar a emoção, mas de alterar duas partes essenciais da pilha de conversação da IA ao mesmo tempo.

 

① Eleven v3 Conversational (o lado da fala)

Trata-se do modelo v3 adaptado para conversação em tempo real, com latência reduzida. O ponto central é que ele mantém o contexto da conversa entre os turnos de fala.
Se o usuário soa preocupado, a voz responde de forma mais calma; quando precisa transmitir uma informação com exatidão, a pronúncia fica mais clara e articulada.

 

② Novo sistema de alternância de fala / turn-taking (o lado da escuta)

A decisão de quando falar e quando aguardar é baseada em sinais em tempo real do Scribe v2 Realtime.
Ele não analisa apenas o texto transcrito, mas também como as palavras foram ditas (a entonação).

O exemplo dado pela documentação oficial é muito intuitivo:
Uma única palavra como “Sim” pode significar que a pessoa concluiu a resposta ou ser um sinal de que pretende continuar falando.
Apenas pelo texto transcrito não é possível distinguir, mas o tom da fala revela a diferença. É com base nisso que o sistema identifica o momento exato de intervir.

 

Por isso, ao ativar o modo expressivo, o ganho de emoção na voz e a redução de interrupções na fala vêm juntos.

 


⚙️ 2. Como ativar: basta trocar um único modelo

 

Não existe um seletor separado. Ao escolher o V3 Conversational como modelo de TTS, o modo expressivo já vem ativado por padrão.

 

Pelo Dashboard

Abra o seu agente, vá até a aba Agent Voice, altere o modelo de Text to Speech para V3 Conversational e salve. Pronto.

 

Pela CLI

elevenlabs agents pull --agent "<nome-do-agente>"

No arquivo agent_configs/<nome-do-agente>.json baixado, altere o parâmetro conversation_config.tts.model_id da seguinte forma:

{
  "conversation_config": {
    "tts": {
      "model_id": "eleven_v3_conversational"
    }
  }
}
elevenlabs agents push --agent "<nome-do-agente>"

 

Pela API

from elevenlabs import ElevenLabs

elevenlabs = ElevenLabs()

elevenlabs.conversational_ai.agents.update(
    agent_id="SEU_AGENT_ID_AQUI",
    conversation_config={
        "tts": {"model_id": "eleven_v3_conversational"},
    },
)

 

Comece a usar o ElevenAgents gratuitamente →

 


📝 3. O tom de voz é definido no prompt do sistema

 

Se você apenas alterar o modelo e parar por aí, a variação emocional até aumenta, mas onde e como aplicá-la fica a critério do próprio modelo.
Para quem tem uma identidade de marca ou regras de atendimento específicas, é fundamental descrevê-las no prompt do sistema para garantir consistência.

 

Método ①: Definir uma orientação geral

Você é um atendente de suporte ao cliente. Se o usuário parecer frustrado ou irritado,
responda com um tom calmo e tranquilizador. Ao dar boas notícias, deixe transparecer um calor
genuíno na voz. No geral, mantenha uma postura profissional, mas acessível e próxima.

 

Método ②: Estabelecer regras claras por situação

Diretrizes de tom:
- Se o usuário manifestar insatisfação, use um tom calmo e empático
- Ao explicar procedimentos técnicos, fale de forma clara e em ritmo constante
- Se o usuário compartilhar uma boa notícia, reaja de forma calorosa e positiva
- Ao lidar com reclamações, mantenha a calma e foque na solução

 

A documentação oficial destaca que não é necessário incluir tags em cada situação.
Ao estruturar as orientações em linguagem natural como mostrado acima, o modelo interpreta o contexto perfeitamente.
No dia a dia de produção, o Método ② é o mais seguro. Para operações que exigem conformidade com normas de atendimento, registrar em frases “qual tom adotar em cada cenário” facilita bastante a revisão e a manutenção posteriores.

 


🏷️ 4. Ajuste momentos específicos com tags

 

Além do controle baseado no contexto, você pode definir trechos pontuais de forma explícita.
Nesse modelo, o próprio LLM gera a tag diretamente dentro da resposta que será falada.

  • [laughs] insere uma risada leve

  • [whispers] abaixa a voz para sussurrar

  • [sighs] transmite a sensação de um suspiro

  • [slow] reduz a velocidade da fala

  • [excited] transmite um ar de empolgação

 

Este é o ponto que mais gera mal-entendidos: uma tag não altera a frase inteira.
Cada tag afeta apenas as 4 a 5 palavras seguintes e, logo depois, a voz retorna ao tom padrão.

Por isso, inseri-la no início da frase esperando que ela altere a resposta inteira não trará o resultado esperado.
Ela deve ser posicionada imediatamente antes das palavras onde você deseja aplicar o efeito.

 

O exemplo oficial demonstra exatamente isso:

"That's great to hear! [laughs] I'm glad we could sort that out for you."

 

Se esta é a sua primeira experiência com tags sonoras, recomendamos começar pelo nosso Guia Definitivo de Prompts da ElevenLabs, onde cobrimos a fundo o modelo v3.
Lá você encontra desde tags de emoções e efeitos sonoros até pronúncia e pausas de leitura.

 


⚠️ 5. Limitações essenciais para conferir antes de ativar

 

A documentação oficial aponta três limitações claras — e a primeira delas é especialmente crítica.

 

① As características da Clonagem de Voz Profissional (PVC) não são preservadas

Se você investiu tempo e orçamento criando a voz de um locutor ou de um porta-voz via PVC, este item define a sua decisão de adotar ou não o recurso.
No momento, o Eleven v3 Conversational ainda não preserva com fidelidade a identidade do PVC.
A saída de áudio pode não soar como a voz de referência original.

A recomendação da documentação oficial também é clara: se a identidade da voz clonada for prioridade, continue utilizando o Flash v2.
Em termos práticos, você precisa escolher entre “expressividade emocional ou a voz exata daquela pessoa”. Ter as duas coisas juntas ainda não é possível.

 

② O efeito das tags dura de 4 a 5 palavras

Como vimos acima, elas não foram feitas para modular frases longas por inteiro.

 

③ A qualidade varia de acordo com a voz e o idioma

A lista de idiomas suportados ultrapassa 70 opções, um salto expressivo frente aos cerca de 32 idiomas da linha Flash.
A documentação oficial menciona explicitamente melhorias em idiomas que antes tinham menos modulação de nuances, como o japonês.

Contudo, o próprio documento adverte que a capacidade expressiva não é homogênea entre todos os idiomas.
Se o seu agente for atender em português, o ideal é fazer testes diretamente em português e com a voz definitiva que pretende usar antes de tomar uma decisão. Um resultado impressionante na demonstração em inglês não significa que o desempenho será o mesmo em português.

 


💰 6. O custo não aumenta

 

Essa é uma dúvida muito comum, mas a resposta no FAQ oficial é direta: “Não”.

 

O Eleven v3 Conversational mantém o mesmo preço unitário dos demais modelos de TTS para agentes, partindo de US$ 0,08 por minuto. Ativar o modo expressivo não adiciona nenhum custo à chamada.

 

Para calcular quanto ficaria o total mensal de acordo com o seu volume de minutos, basta fazer a simulação na nossa calculadora de custos.

 


✍️ Em resumo

 

Recapitulando os pontos essenciais:

  • Como ativar: basta selecionar o modelo de TTS como V3 Conversational. É só isso.

  • Como ajustar: defina o tom para cada situação em frases no prompt do sistema.

  • Como pontuar: insira a tag logo antes do trecho desejado (o efeito dura de 4 a 5 palavras).

  • Como avaliar: se a sua operação depende de vozes em PVC, faça testes comparativos antes de migrar.

 

Obrigado pela leitura! ⚡