“Fala tudo certo, mas não parece uma pessoa de verdade.”
Essa é a primeira frase que ouvimos de quem coloca um atendente telefônico com IA em operação.
Olá, aqui é a Sonetho. ⚡
Entre as pessoas que acompanharam a Parte 1 (Introdução) e a Parte 2 (Imobiliária) para criar atendentes telefônicos com IA, há um relato recorrente:
O roteiro é impecável, mas a IA fala no mesmo tom tanto com um cliente furioso quanto no momento em que um contrato é fechado.
Como a entonação da voz não muda onde qualquer pessoa mudaria, quem está ouvindo logo percebe — “é mais uma IA” — e se fecha.
O recurso que a ElevenLabs desenvolveu exatamente para resolver essa questão é o modo expressivo (Expressive mode).
⚠️ Antes de tudo, vale um esclarecimento: este não é um recurso recém-lançado.
Ele foi anunciado no blog oficial da plataforma em fevereiro de 2026.
No entanto, como a página da documentação oficial não exibe datas, muitas pessoas estão tendo contato com ele pela primeira vez agora — e essa foi a dúvida que mais recebemos ao longo desta série.
Por isso, apresentamos aqui como configurar o Expressive mode.
🎭 1. O modo expressivo opera em duas frentes conjuntas
Não se trata de um simples botão para ligar a emoção, mas de alterar duas partes essenciais da pilha de conversação da IA ao mesmo tempo.
① Eleven v3 Conversational (o lado da fala)
Trata-se do modelo v3 adaptado para conversação em tempo real, com latência reduzida. O ponto central é que ele mantém o contexto da conversa entre os turnos de fala.
Se o usuário soa preocupado, a voz responde de forma mais calma; quando precisa transmitir uma informação com exatidão, a pronúncia fica mais clara e articulada.
② Novo sistema de alternância de fala / turn-taking (o lado da escuta)
A decisão de quando falar e quando aguardar é baseada em sinais em tempo real do Scribe v2 Realtime.
Ele não analisa apenas o texto transcrito, mas também como as palavras foram ditas (a entonação).
O exemplo dado pela documentação oficial é muito intuitivo:
Uma única palavra como “Sim” pode significar que a pessoa concluiu a resposta ou ser um sinal de que pretende continuar falando.
Apenas pelo texto transcrito não é possível distinguir, mas o tom da fala revela a diferença. É com base nisso que o sistema identifica o momento exato de intervir.
Por isso, ao ativar o modo expressivo, o ganho de emoção na voz e a redução de interrupções na fala vêm juntos.
⚙️ 2. Como ativar: basta trocar um único modelo
Não existe um seletor separado. Ao escolher o V3 Conversational como modelo de TTS, o modo expressivo já vem ativado por padrão.
Pelo Dashboard
Abra o seu agente, vá até a aba Agent Voice, altere o modelo de Text to Speech para V3 Conversational e salve. Pronto.
Pela CLI
elevenlabs agents pull --agent "<nome-do-agente>"No arquivo agent_configs/<nome-do-agente>.json baixado, altere o parâmetro conversation_config.tts.model_id da seguinte forma:
{
"conversation_config": {
"tts": {
"model_id": "eleven_v3_conversational"
}
}
}elevenlabs agents push --agent "<nome-do-agente>"
Pela API
from elevenlabs import ElevenLabs
elevenlabs = ElevenLabs()
elevenlabs.conversational_ai.agents.update(
agent_id="SEU_AGENT_ID_AQUI",
conversation_config={
"tts": {"model_id": "eleven_v3_conversational"},
},
)
Comece a usar o ElevenAgents gratuitamente →
📝 3. O tom de voz é definido no prompt do sistema
Se você apenas alterar o modelo e parar por aí, a variação emocional até aumenta, mas onde e como aplicá-la fica a critério do próprio modelo.
Para quem tem uma identidade de marca ou regras de atendimento específicas, é fundamental descrevê-las no prompt do sistema para garantir consistência.
Método ①: Definir uma orientação geral
Você é um atendente de suporte ao cliente. Se o usuário parecer frustrado ou irritado,
responda com um tom calmo e tranquilizador. Ao dar boas notícias, deixe transparecer um calor
genuíno na voz. No geral, mantenha uma postura profissional, mas acessível e próxima.
Método ②: Estabelecer regras claras por situação
Diretrizes de tom:
- Se o usuário manifestar insatisfação, use um tom calmo e empático
- Ao explicar procedimentos técnicos, fale de forma clara e em ritmo constante
- Se o usuário compartilhar uma boa notícia, reaja de forma calorosa e positiva
- Ao lidar com reclamações, mantenha a calma e foque na solução
A documentação oficial destaca que não é necessário incluir tags em cada situação.
Ao estruturar as orientações em linguagem natural como mostrado acima, o modelo interpreta o contexto perfeitamente.
No dia a dia de produção, o Método ② é o mais seguro. Para operações que exigem conformidade com normas de atendimento, registrar em frases “qual tom adotar em cada cenário” facilita bastante a revisão e a manutenção posteriores.
🏷️ 4. Ajuste momentos específicos com tags
Além do controle baseado no contexto, você pode definir trechos pontuais de forma explícita.
Nesse modelo, o próprio LLM gera a tag diretamente dentro da resposta que será falada.
[laughs]insere uma risada leve[whispers]abaixa a voz para sussurrar[sighs]transmite a sensação de um suspiro[slow]reduz a velocidade da fala[excited]transmite um ar de empolgação
★ Este é o ponto que mais gera mal-entendidos: uma tag não altera a frase inteira.
Cada tag afeta apenas as 4 a 5 palavras seguintes e, logo depois, a voz retorna ao tom padrão.
Por isso, inseri-la no início da frase esperando que ela altere a resposta inteira não trará o resultado esperado.
Ela deve ser posicionada imediatamente antes das palavras onde você deseja aplicar o efeito.
O exemplo oficial demonstra exatamente isso:
"That's great to hear! [laughs] I'm glad we could sort that out for you."
Se esta é a sua primeira experiência com tags sonoras, recomendamos começar pelo nosso Guia Definitivo de Prompts da ElevenLabs, onde cobrimos a fundo o modelo v3.
Lá você encontra desde tags de emoções e efeitos sonoros até pronúncia e pausas de leitura.
⚠️ 5. Limitações essenciais para conferir antes de ativar
A documentação oficial aponta três limitações claras — e a primeira delas é especialmente crítica.
① As características da Clonagem de Voz Profissional (PVC) não são preservadas
Se você investiu tempo e orçamento criando a voz de um locutor ou de um porta-voz via PVC, este item define a sua decisão de adotar ou não o recurso.
No momento, o Eleven v3 Conversational ainda não preserva com fidelidade a identidade do PVC.
A saída de áudio pode não soar como a voz de referência original.
A recomendação da documentação oficial também é clara: se a identidade da voz clonada for prioridade, continue utilizando o Flash v2.
Em termos práticos, você precisa escolher entre “expressividade emocional ou a voz exata daquela pessoa”. Ter as duas coisas juntas ainda não é possível.
② O efeito das tags dura de 4 a 5 palavras
Como vimos acima, elas não foram feitas para modular frases longas por inteiro.
③ A qualidade varia de acordo com a voz e o idioma
A lista de idiomas suportados ultrapassa 70 opções, um salto expressivo frente aos cerca de 32 idiomas da linha Flash.
A documentação oficial menciona explicitamente melhorias em idiomas que antes tinham menos modulação de nuances, como o japonês.
Contudo, o próprio documento adverte que a capacidade expressiva não é homogênea entre todos os idiomas.
Se o seu agente for atender em português, o ideal é fazer testes diretamente em português e com a voz definitiva que pretende usar antes de tomar uma decisão. Um resultado impressionante na demonstração em inglês não significa que o desempenho será o mesmo em português.
💰 6. O custo não aumenta
Essa é uma dúvida muito comum, mas a resposta no FAQ oficial é direta: “Não”.
O Eleven v3 Conversational mantém o mesmo preço unitário dos demais modelos de TTS para agentes, partindo de US$ 0,08 por minuto. Ativar o modo expressivo não adiciona nenhum custo à chamada.
Para calcular quanto ficaria o total mensal de acordo com o seu volume de minutos, basta fazer a simulação na nossa calculadora de custos.
✍️ Em resumo
Recapitulando os pontos essenciais:
Como ativar: basta selecionar o modelo de TTS como V3 Conversational. É só isso.
Como ajustar: defina o tom para cada situação em frases no prompt do sistema.
Como pontuar: insira a tag logo antes do trecho desejado (o efeito dura de 4 a 5 palavras).
Como avaliar: se a sua operação depende de vozes em PVC, faça testes comparativos antes de migrar.
Obrigado pela leitura! ⚡