Agent vocal IA (3) : Activer le mode expressif ElevenLabs

Votre agent vocal IA garde le même ton face à un client furieux ou une bonne nouvelle ? Activez le mode expressif en passant au modèle TTS V3 Conversational d'ElevenLabs. Configuration (Dashboard, CLI, API), guidage du ton via prompt système, portée des balises (4 à 5 mots) et limites du clonage vocal professionnel (PVC) : voici le guide complet.

« Tout ce qu'il dit est juste, mais cela ne fait pas du tout humain. »
C'est la toute première remarque de ceux qui testent un agent téléphonique IA.

Bonjour, ici Sonetho. ⚡

Après la publication de notre Guide d'initiation (Partie 1) et de notre cas pratique Agence immobilière (Partie 2), un constat revient constamment de la part de ceux qui ont créé leur propre agent vocal.

Le script a beau être parfait, l'agent s'exprime sur le même ton, qu'il réponde à un client furieux ou qu'il vienne de conclure un contrat.
Là où un humain modulerait naturellement sa voix, l'IA ne varie pas. Résultat : l'interlocuteur se ferme aussitôt en se disant « Encore une IA ».

 

C'est précisément pour résoudre ce problème qu'ElevenLabs a conçu le mode expressif (Expressive mode).

⚠️ Précisons d'emblée une chose : il ne s'agit pas d'une nouveauté.
La fonctionnalité a été officialisée sur le blog officiel en février 2026.
Cependant, aucune date ne figurant sur la page de documentation technique, beaucoup la découvrent aujourd'hui, et c'est la question que nous avons le plus reçue au fil de cette série.
Voici donc concrètement comment configurer l'Expressive mode.

 


🎭 1. Le mode expressif fait intervenir deux mécanismes simultanés

 

Il ne s'agit pas d'un simple bouton pour injecter des émotions, mais d'une évolution conjointe de deux composantes de la chaîne conversationnelle.

 

① Eleven v3 Conversational (côté synthèse vocale)

Il s'agit du modèle v3 optimisé pour une latence ultra-faible en dialogue direct. Son point fort : conserver le contexte de la conversation d'un tour de parole à l'autre.
Si l'utilisateur semble inquiet, la voix se fait plus posée ; lorsqu'il s'agit d'énoncer des informations précises, elle articule plus distinctement.

 

② Le nouveau système de prise de parole (côté écoute)

Déterminer quand parler et quand patienter repose désormais sur les signaux en direct de Scribe v2 Realtime.
Le moteur n'analyse pas seulement les mots transcrits, mais aussi la façon dont ils sont prononcés (l'intonation).

L'exemple de la documentation officielle est particulièrement parlant :
Un simple « Oui » peut marquer la fin d'une réponse tout comme un signal pour continuer à développer.
À l'écrit, impossible de faire la distinction, mais l'intonation lève immédiatement le doute. C'est ce qui permet à l'agent de déterminer le moment idéal pour intervenir.

 

Activer le mode expressif apporte ainsi un double bénéfice : une voix plus expressive et une réduction nette des interruptions de parole.

 


⚙️ 2. Pour l'activer, il suffit de changer de modèle

 

Il n'y a pas d'option séparée. Dès que vous sélectionnez le modèle TTS V3 Conversational, le mode expressif est activé par défaut.

 

Depuis le tableau de bord

Ouvrez votre agent, allez dans l'onglet Agent Voice, basculez le modèle Text to Speech sur V3 Conversational et enregistrez. C'est tout.

 

En CLI

elevenlabs agents pull --agent "<nom-de-l-agent>"

Dans le fichier agent_configs/<nom-de-l-agent>.json récupéré, modifiez conversation_config.tts.model_id comme suit :

{
  "conversation_config": {
    "tts": {
      "model_id": "eleven_v3_conversational"
    }
  }
}
elevenlabs agents push --agent "<nom-de-l-agent>"

 

Via l'API

from elevenlabs import ElevenLabs

elevenlabs = ElevenLabs()

elevenlabs.conversational_ai.agents.update(
    agent_id="VOTRE_AGENT_ID",
    conversation_config={
        "tts": {"model_id": "eleven_v3_conversational"},
    },
)

 

Démarrer gratuitement avec ElevenAgents →

 


📝 3. Cadrer le ton dans le prompt système

 

Si vous changez uniquement de modèle, l'amplitude expressive grandit, mais l'IA décidera seule d'où et comment placer ses émotions.
Pour respecter une charte éditoriale ou des règles d'accueil, il est indispensable de les préciser dans le prompt système afin d'obtenir un résultat régulier.

 

Méthode ① : Donner une orientation générale

Vous êtes un conseiller du support client. Si l'interlocuteur semble contrarié ou agacé,
répondez d'un ton calme et rassurant. Lorsque vous annoncez une bonne nouvelle,
laissez transparaître une chaleur sincère dans votre voix. Dans l'ensemble,
conservez un ton professionnel tout en restant accessible.

 

Méthode ② : Définir des règles par situation

Directives de tonalité :
- Si l'utilisateur exprime une insatisfaction : adopter un ton calme et empathique.
- Lors de l'explication d'une démarche technique : parler distinctement à un rythme régulier.
- Si l'utilisateur partage une bonne nouvelle : réagir avec chaleur et positivité.
- En cas de réclamation : garder son calme et privilégier une approche orientée solutions.

 

La documentation officielle indique qu'il n'est pas nécessaire d'ajouter des balises pour chaque situation.
Rédigées en langage naturel comme ci-dessus, les consignes sont interprétées par le modèle selon le contexte.
En production, la méthode ② s'avère la plus sûre : pour les activités soumises à des consignes d'accueil, formaliser par écrit « quel ton pour quelle situation » facilite grandement les audits ultérieurs.

 


🏷️ 4. Cibler des moments précis avec des balises

 

En complément de la modulation contextuelle, vous pouvez définir explicitement l'intention vocale d'un passage ciblé.
Pour cela, le LLM doit insérer directement la balise dans sa réponse texte.

  • [laughs] ajoute une pointe de rire

  • [whispers] baisse la voix en un murmure

  • [sighs] insère une intonation de soupir

  • [slow] ralentit le débit de parole

  • [excited] donne une tonalité enthousiaste

 

C'est le point qui suscite le plus de malentendus : une balise ne s'applique pas à toute une phrase.
Chaque balise n'agit que sur les 4 à 5 mots qui la suivent immédiatement avant que la voix ne revienne à son ton initial.

Si vous pensez qu'il suffit d'en placer une en tout début de phrase, le résultat ne sera pas au rendez-vous.
La balise doit être positionnée juste devant les mots que vous souhaitez faire ressortir.

 

Exemple officiel :

"That's great to hear! [laughs] I'm glad we could sort that out for you."

 

Si vous découvrez l'usage des balises v3, nous vous conseillons de consulter d'abord notre Guide complet des prompts ElevenLabs.
Nous y détaillons l'ensemble des balises d'émotion et d'effets sonores, ainsi que la gestion de la prononciation et des pauses.

 


⚠️ 5. Trois limites à vérifier avant d'activer le mode

 

La documentation officielle mentionne trois limites, dont la première est particulièrement importante.

 

① Les spécificités des clones vocaux professionnels (PVC) ne sont pas préservées

Si vous avez investi du temps et un budget pour créer un clone PVC de la voix de votre dirigeant ou d'un comédien voix, ce point sera déterminant dans votre décision.
Pour l'instant, Eleven v3 Conversational conserve mal les spécificités uniques d'un clone PVC.
Le rendu final risque de ne plus sonner exactement comme la voix d'origine.

La recommandation officielle est d'ailleurs sans équivoque : si l'identité vocale de votre PVC est prioritaire, restez sur Flash v2.
En clair, il faut aujourd'hui choisir entre l'expressivité et la voix exacte de la personne. Obtenir les deux à la fois n'est pas encore possible.

 

② La portée d'une balise se limite à 4 ou 5 mots

Comme vu plus haut, ces balises ne sont pas conçues pour modifier une longue phrase dans son ensemble.

 

③ Des variations de rendu selon la langue et la voix

Le modèle prend en charge plus de 70 langues, une nette hausse par rapport aux quelque 32 langues de la série Flash.
La documentation officielle note notamment de réels progrès sur des langues où la restitution des nuances était jusqu'ici limitée, comme le japonais.

Le document souligne néanmoins que l'expressivité n'est pas uniforme d'une langue à l'autre.
Si votre agent est destiné à échanger en français, testez-le directement en français avec la voix choisie à plusieurs reprises avant de trancher. Une démo bluffante en anglais ne garantit pas un résultat identique en français.

 


💰 6. Aucun surcoût à prévoir

 

La question revient fréquemment, mais la réponse de la FAQ officielle est catégorique : « Non ».

Eleven v3 Conversational est proposé au même tarif unitaire que les autres modèles TTS pour agents, à partir de 0,08 $ la minute. L'activation du mode expressif n'entraîne aucun coût additionnel.

Pour estimer votre budget mensuel selon votre volume d'appels, vous pouvez simuler vos minutes sur notre calculateur de tarifs.

 


✍️ En résumé

 

Ce qu'il faut retenir :

  • Pour l'activer : sélectionnez le modèle TTS V3 Conversational. C'est tout ce qu'il y a à faire.

  • Pour l'ajuster : définissez des consignes claires par situation dans votre prompt système.

  • Pour cibler un passage : insérez votre balise juste devant les mots visés (effet sur 4 à 5 mots).

  • Pour trancher (PVC) : si vous utilisez un clone vocal PVC, comparez les rendus avant de décider.

 

Merci pour votre lecture ! ⚡