"Dice le cose giuste, ma non sembra affatto una persona vera."
È la prima cosa che ci dice chiunque abbia provato a implementare un agente telefonico AI.
Ciao da Sonetho! ⚡
C'è un'osservazione che sentiamo ripetere spesso da chi ha creato un agente telefonico AI dopo aver letto la nostra Parte 1 (Guida introduttiva) e la Parte 2 (Caso agenzia immobiliare).
Il copione è impeccabile, ma l'agente parla con lo stesso identico tono sia a un cliente infuriato, sia nel momento in cui viene chiuso un accordo.
Quando la voce non cambia nei momenti in cui una persona reale modulerebbe istintivamente il tono, chi ascolta si chiude subito: "Ecco, la solita AI".
La funzionalità ideata da ElevenLabs proprio per superare questo limite è la modalità espressiva (Expressive mode).
⚠️ Prima di tutto, una doverosa precisazione: non si tratta di una novità dell'ultima ora.
Stando al blog ufficiale, è stata rilasciata a febbraio 2026.
Tuttavia, dato che la documentazione ufficiale non riporta date, molti la scoprono solo adesso; ed è stata la domanda più frequente ricevuta durante la stesura di questa serie.
Ecco perché oggi vi mostriamo nel dettaglio come configurare l'Expressive mode.
🎭 1. Nella modalità espressiva due componenti lavorano insieme
Non si tratta semplicemente di un pulsante per "aggiungere emozioni", ma di una modifica simultanea a due livelli dello stack di conversazione.
① Eleven v3 Conversational (la voce in uscita)
È la versione del modello v3 a bassissima latenza, ottimizzata per dialoghi in tempo reale. Il suo punto cardine è che preserva il contesto della conversazione tra un turno e l'altro.
Se rileva che l'utente è preoccupato risponde con un tono più calmo, mentre nei passaggi in cui le informazioni devono essere trasmesse con precisione scandisce le parole con maggiore chiarezza.
② Il nuovo sistema di turn-taking (l'ascolto)
Determina quando intervenire e quando attendere analizzando i segnali in tempo reale di Scribe v2 Realtime.
Non si limita a elaborare il testo trascritto, ma valuta anche come è stato pronunciato (l'intonazione).
L'esempio fornito dalla documentazione ufficiale è chiarissimo.
Un semplice "Sì" può rappresentare la conclusione di una risposta oppure il segnale che l'interlocutore intende proseguire il discorso.
Basandosi solo sul testo trascritto è impossibile distinguerlo, ma dal tono di voce la differenza è netta. È proprio questo che consente al sistema di scegliere il momento esatto in cui intervenire.
Di conseguenza, attivando la modalità espressiva si ottengono due vantaggi insieme: più naturalezza ed espressività nella voce e una drastica riduzione delle interruzioni o sovrapposizioni.
⚙️ 2. Come attivarla: basta cambiare un solo modello
Non serve attivare alcun interruttore dedicato: selezionando V3 Conversational come modello TTS, la modalità espressiva è abilitata di default.
Dalla dashboard
Aprite il vostro agente, andate nella scheda Agent Voice, impostate il modello Text to Speech su V3 Conversational e salvate. Tutto qui.
Da CLI
elevenlabs agents pull --agent "<nome-agente>"Nel file scaricato agent_configs/<nome-agente>.json, modificate il campo conversation_config.tts.model_id in questo modo:
{
"conversation_config": {
"tts": {
"model_id": "eleven_v3_conversational"
}
}
}elevenlabs agents push --agent "<nome-agente>"
Da API
from elevenlabs import ElevenLabs
elevenlabs = ElevenLabs()
elevenlabs.conversational_ai.agents.update(
agent_id="IL_TUO_AGENT_ID",
conversation_config={
"tts": {"model_id": "eleven_v3_conversational"},
},
)
Inizia gratis con ElevenAgents →
📝 3. Impostare il tono tramite il system prompt
Se vi limitate a sostituire il modello, la gamma espressiva si amplierà, ma il modo e il momento in cui utilizzarla resteranno a discrezione del modello.
Se la vostra realtà ha un tono di voce aziendale o standard di servizio definiti, è fondamentale specificarli nel system prompt per garantire uniformità.
Metodo ①: Fornire un orientamento generale
Sei un assistente per il supporto clienti. Se l'utente sembra frustrato o agitato,
rispondi con un tono calmo e rassicurante. Quando comunichi buone notizie, trasmetti
un calore sincero nella voce. Mantieni nel complesso uno stile professionale ma accogliente e accessibile.
Metodo ②: Stabilire regole per ogni scenario
Linee guida per il tono di voce:
- Quando l'utente esprime insoddisfazione: usa un tono calmo ed empatico.
- Quando spieghi procedure tecniche: parla in modo chiaro e con un ritmo costante.
- Quando l'utente comunica buone notizie: rispondi con calore ed entusiasmo.
- Nella gestione dei reclami: mantieni la calma e concentrati sulla risoluzione del problema.
La documentazione ufficiale precisa che non occorre inserire tag per ciascuna situazione.
Impostando le istruzioni in linguaggio naturale come sopra, il modello le interpreterà in base al contesto.
Nei casi operativi reali, il Metodo ② è il più affidabile: per chi opera con policy di assistenza ben codificate, definire nero su bianco "quale tono per quale situazione" rende anche molto più semplice la successiva fase di revisione e controllo qualità.
🏷️ 4. Mirare a momenti specifici con i tag
Oltre alla modulazione contestuale, potete indicare passaggi specifici in modo esplicito.
In questo caso, è l'LLM stesso a inserire direttamente i tag all'interno delle risposte generate.
[laughs]aggiunge una risata[whispers]abbassa la voce a un sussurro[sighs]conferisce una sfumatura di sospiro[slow]rallenta la velocità del parlato[excited]trasmette un senso di entusiasmo
★Questo è il punto su cui si creano più malintesi: un singolo tag non modifica l'intera frase.
Ciascun tag influisce soltanto sulle 4-5 parole immediatamente successive, per poi ritornare al tono base.
Pertanto, pensare che "basti inserirlo a inizio frase" non porterà al risultato desiderato.
Va posizionato immediatamente prima del punto esatto in cui volete applicare l'effetto.
L'esempio ufficiale è il seguente:
"That's great to hear! [laughs] I'm glad we could sort that out for you."
Se è la prima volta che utilizzate i tag, vi suggeriamo di leggere prima la nostra Guida completa ai prompt di ElevenLabs, interamente dedicata ai tag v3.
Troverete tutti i dettagli su tag emotivi, effetti sonori, pronuncia e gestione delle pause.
⚠️ 5. Limitazioni da verificare prima dell'attivazione
La documentazione ufficiale evidenzia tre limiti principali, e il primo è particolarmente critico.
① Le caratteristiche del Professional Voice Cloning (PVC) non vengono preservate
Se avete investito tempo e budget per creare una voce PVC del titolare o di uno speaker professionista, questo fattore è determinante nella scelta.
Attualmente Eleven v3 Conversational non preserva bene le caratteristiche uniche del PVC.
Il risultato potrebbe non somigliare affatto alla voce originale.
Anche la raccomandazione della documentazione ufficiale è netta: se l'identità della voce clonata via PVC è prioritaria, utilizzate Flash v2.
In sostanza, ci si trova a dover scegliere: "puntare sull'espressività emotiva o sulla fedeltà timbrica alla persona". Al momento non è possibile avere entrambe contemporaneamente.
② L'effetto dei tag copre solo 4-5 parole
Ne abbiamo già parlato sopra: non è pensato per trasformare intere frasi.
③ Le prestazioni variano a seconda della voce e della lingua
Le lingue supportate sono oltre 70, un notevole aumento rispetto alle circa 32 della serie Flash.
La documentazione ufficiale evidenzia espressamente i miglioramenti in lingue che in passato presentavano sfumature più limitate, come il giapponese.
Tuttavia, lo stesso documento segnala che l'espressività non è omogenea tra tutte le lingue.
Se il vostro assistente deve operare in italiano, la scelta più saggia è effettuare diversi test direttamente in italiano e con la voce reale che intendete utilizzare. Il fatto che le demo in inglese suonino perfette non garantisce che la resa sia identica in italiano.
💰 6. I costi non aumentano
Sorprendentemente è una domanda frequente, ma la risposta ufficiale nelle FAQ è: "No".
Eleven v3 Conversational ha la stessa tariffa base degli altri modelli TTS per agenti, a partire da 0,08 $ al minuto. L'attivazione della modalità espressiva non comporta alcun costo aggiuntivo.
Per verificare quanto spendereste al mese in base al vostro volume di chiamate, potete inserire la stima dei minuti direttamente nel nostro calcolatore di tariffe.
✍️ In sintesi
Ecco un riassunto pratico:
Come si attiva: impostate il modello TTS su V3 Conversational. È tutto qui.
Come si calibra: descrivete nel system prompt il tono da adottare per ciascuna situazione.
Come si enfatizza: inserite i tag subito prima del punto desiderato (hanno effetto solo per 4-5 parole).
Cosa verificare: se utilizzate una voce in PVC, fate un confronto approfondito prima di decidere.
Grazie per la lettura! ⚡