"Allt den säger stämmer, men det låter inte som en människa."
Det är det första vi får höra från dem som har testat att sätta upp en AI-telefonagent.
Hej! Här är Sonetho. ⚡
Bland dem som har läst del 1 (introduktion) och del 2 (mäklarkontoret) och sedan byggt en egen AI-telefonagent har samma synpunkt återkommit gång på gång:
Manuset är perfekt, men rösten håller exakt samma tonfall oavsett om kunden är upprörd eller om en affär precis har gått i lås.
När rösten inte ändrar tonläge där en människa naturligt skulle göra det tänker den som ringer snabbt "jaha, ännu en AI" och tappar intresset.
Det är just detta problem ElevenLabs vill lösa med funktionen Expressive mode.
⚠️ En sak bör dock klargöras direkt: det här är inte en helt ny funktion.
Enligt den officiella bloggen lanserades den i februari 2026.
Eftersom dokumentationen saknar datumstämpel är det många som upptäcker den först nu, och under arbetet med serien är det just detta vi har fått allra flest frågor om.
Därför går vi här igenom hur du ställer in Expressive mode.
🎭 1. Expressive mode bygger på två delar som samverkar
Det handlar inte om en knapp som slår på känslor, utan om att två delar i samtalskedjan ändras samtidigt.
① Eleven v3 Conversational (taldelen)
En v3-modell med sänkt latens optimerad för realtidssamtal. Kärnan är att den bär med sig samtalskontexten mellan replikskiftena.
Om användaren låter bekymrad anpassar den sig till ett lugnare tonläge; när viktiga detaljer ska förmedlas blir uttalet tydligare och mer distinkt.
② Nytt system för turtagning (lyssnandedelen)
När agenten ska tala och när den ska vänta avgörs via realtidssignaler från Scribe v2 Realtime.
Den analyserar inte bara de transkriberade orden utan även hur orden uttalas (intonation och tonfall).
Exemplet i den officiella dokumentationen är talande.
Ett enkelt "Ja" kan betyda att personen har pratat färdigt, men det kan lika gärna vara en signal om att man tänker fortsätta prata.
Ser man bara till texten går det inte att avgöra, men tonfallet avslöjar skillnaden. Detta ger agenten rätt tajming för att flika in i samtalet.
När du slår på Expressive mode får du alltså både mer känslouttryck i rösten och färre avbrott i samtalet på samma gång.
⚙️ 2. Aktiveringen handlar bara om att byta modell
Det finns inget separat reglage. Väljer du V3 Conversational som TTS-modell aktiveras Expressive mode som standard.
I kontrollpanelen (Dashboard)
Öppna din agent, gå till fliken Agent Voice, byt Text to Speech-modell till V3 Conversational och spara – klart.
Via CLI
elevenlabs agents pull --agent "<agent-namn>"Öppna den nedladdade filen agent_configs/<agent-namn>.json och ändra conversation_config.tts.model_id till följande:
{
"conversation_config": {
"tts": {
"model_id": "eleven_v3_conversational"
}
}
}elevenlabs agents push --agent "<agent-namn>"
Via API
from elevenlabs import ElevenLabs
elevenlabs = ElevenLabs()
elevenlabs.conversational_ai.agents.update(
agent_id="DITT_AGENT_ID",
conversation_config={
"tts": {"model_id": "eleven_v3_conversational"},
},
)
Kom igång gratis med ElevenAgents →
📝 3. Tonen styrs via systemprompten
Nöjer du dig med att bara byta modell vidgas känsloregistret, men var och hur känslorna uttrycks blir helt upp till modellen.
Har verksamheten en specifik varumärkeston eller bemötanderiktlinjer måste detta skrivas in i systemprompten för att det ska bli enhetligt.
Metod ①: Ange en övergripande riktning
Du är en kundtjänstmedarbetare. Om användaren låter frustrerad eller irriterad,
svara med ett lugnt och tryggt tonläge. När du förmedlar goda nyheter, låt
en genuin värme höras i rösten. Håll överlag en professionell men tillmötesgående samtalston.
Metod ②: Slå fast tonen per situation
Riktlinjer för tonläge:
- Om användaren uttrycker missnöje: använd en lugn och empatisk ton
- Vid förklaring av tekniska steg: tala tydligt och i jämn takt
- Om användaren delar goda nyheter: svara varmt och glatt
- Vid hantering av klagomål: behåll lugnet och fokusera på lösningar
Enligt den officiella dokumentationen behöver du inte sätta taggar i varje situation.
Formulerar du dig i naturligt språk enligt ovan tolkar modellen sammanhanget dynamiskt.
I praktiken är metod ② säkrast. Finns det riktlinjer för bemötande i verksamheten är det betydligt enklare att följa upp och granska om du har formulerat "vilket tonläge i vilken situation" i klartext.
🏷️ 4. Punktmarkera specifika ögonblick med taggar
Utöver den kontextbaserade styrningen kan du styra specifika fraser explicit.
Det görs genom att LLM genererar taggar direkt i svaret.
[laughs]lägger till ett skratt[whispers]sänker rösten till en viskning[sighs]ger en suckande ton[slow]sänker taltempot[excited]ger ett entusiastiskt tonläge
★Här uppstår det vanligaste missförståndet. En tagg förändrar inte en hel mening.
Varje tagg påverkar enbart de efterföljande 4–5 orden innan rösten återgår till grundtonen.
Så om man tänker "jag sätter en tagg i början av meningen så löser det sig" får man inte det resultat man tänkt sig.
Taggen måste placeras precis framför det ställe där effekten ska märkas.
Det officiella exemplet ser ut så här:
"That's great to hear! [laughs] I'm glad we could sort that out for you."
Är det första gången du arbetar med taggar rekommenderar vi att du börjar med vår genomgång: ElevenLabs kompletta promptguide.
Där har vi samlat allt om känslotaggar, ljudeffekter, uttal och pausering.
⚠️ 5. Begränsningar att kontrollera före aktivering
I den officiella dokumentationen listas tre begränsningar, och den första är särskilt viktig.
① Egenskaperna hos Professional Voice Cloning (PVC) bevaras inte
Om du har lagt tid och pengar på att ta fram en skräddarsydd röst via PVC – exempelvis för en vd eller en röstskådespelare – är detta en helt avgörande faktor för ditt vägval.
Eleven v3 Conversational lyckas för närvarande inte bevara PVC-röstens unika karaktär fullt ut.
Slutresultatet riskerar därför att inte låta som originalrösten.
Rekommendationen i den officiella dokumentationen är tydlig: om PVC-röstens identitet är viktig ska du använda Flash v2.
I dagsläget tvingas man alltså välja mellan "känslouttryck eller personens röst". Båda delarna går ännu inte att kombinera fullt ut.
② Taggeffekten sträcker sig över 4–5 ord
Som berörts tidigare är taggarna inte avsedda att färga hela, längre stycken.
③ Skillnader mellan olika röster och språk
Antalet språk som stöds är fler än 70, vilket är en markant ökning från cirka 32 i Flash-serien.
I den officiella dokumentationen nämns särskilt att språk som japanska, där subtila nyanser tidigare varit svagare, har förbättrats avsevärt.
Samtidigt påpekas i samma dokument att uttrycksfullheten inte är jämn mellan alla språk.
Om agenten ska hantera samtal på svenska är det klokt att testköra några omgångar direkt på svenska med den röst du planerar att använda. Att ett engelskt demo låter övertygande är ingen garanti för att svenskan presterar likadant.
💰 6. Kostnaden ökar inte
Detta är en förvånansvärt vanlig fundering, men svaret i den officiella FAQ:n är ett tydligt "Nej".
Eleven v3 Conversational har samma enhetspris som övriga TTS-modeller för agenter och startar på $0,08 per minut. Det kostar alltså inget extra att aktivera Expressive mode.
Vill du beräkna vad månadskostnaden blir utifrån din samtalsvolym kan du fylla i minuterna i vår priskalkylator.
✍️ Sammanfattning
Kort sammanfattat:
Aktivera: Byt TTS-modell till V3 Conversational – svårare än så är det inte
Finjustera: Beskriv hur agenten ska agera i olika situationer i klartext i systemprompten
Punktmarkera: Sätt taggar precis framför orden du vill påverka (gäller bara i 4–5 ord)
Avväg PVC: Använder du en PVC-röst bör du jämföra noga innan du bestämmer dig
Tack för att du läste! ⚡