„Wszystko mówi poprawnie, ale w ogóle nie brzmi jak człowiek”.
To pierwsza uwaga niemal każdego, kto wdrożył telefonicznego asystenta AI.
Cześć, tu Sonetho. ⚡
Od osób, które po lekturze Części 1 (Wprowadzenie) oraz Części 2 (Agencja nieruchomości) uruchomiły własnego bota głosowego AI, nieustannie słyszymy ten sam komentarz.
Scenariusz rozmowy jest bez zarzutu, ale bot mówi dokładnie tym samym tonem zarówno do poirytowanego klienta, jak i w momencie sfinalizowania umowy.
Kiedy w sytuacjach, w których u człowieka barwa głosu naturalnie by się zmieniła, bot brzmi jednostajnie, rozmówca natychmiast myśli: „Znowu automat” i po prostu traci zaangażowanie.
Funkcją stworzoną przez ElevenLabs dokładnie po to, by rozwiązać ten problem, jest tryb ekspresyjny (Expressive mode).
⚠️ Warto jednak wyjaśnić jedną rzecz na wstępie: nie jest to funkcja zupełnie nowa.
Według oficjalnego bloga została udostępniona w lutym 2026 roku.
Ponieważ jednak w oficjalnej dokumentacji brakuje daty, wielu twórców trafia na nią dopiero teraz – i to o nią pytano nas najczęściej podczas publikacji tej serii.
Dlatego dziś szczegółowo wyjaśniamy, jak skonfigurować Expressive mode.
🎭 1. Tryb ekspresyjny to dwa współpracujące ze sobą elementy
Nie jest to pojedynczy przełącznik dodający emocje, lecz równoczesna modyfikacja dwóch kluczowych warstw całego stosu konwersacyjnego.
① Eleven v3 Conversational (generowanie mowy / TTS)
To model v3 zoptymalizowany pod kątem minimalnych opóźnień w dialogu w czasie rzeczywistym. Jego sednem jest to, że przenosi kontekst rozmowy pomiędzy kolejnymi kwestiami (turnami).
Gdy w głosie użytkownika słychać niepokój, asystent odpowiada spokojniejszym tonem, a w momentach wymagających precyzyjnych ustaleń mówi wyraźniej i bardziej rzeczowo.
② Nowy system zabierania głosu / turn-taking (rozpoznawanie i nasłuch)
To, kiedy mówić, a kiedy poczekać, system ocenia na podstawie sygnałów w czasie rzeczywistym z silnika Scribe v2 Realtime.
Nie analizuje wyłącznie samego tekstu po transkrypcji, lecz także sposób wypowiedzi (intonację).
Świetnie obrazuje to przykład z oficjalnej dokumentacji:
Krótkie „Tak” może oznaczać zamkniętą odpowiedź, ale może też być sygnałem podtrzymania rozmowy i chęci rozwinięcia myśli.
Patrząc na sam suchy tekst, nie sposób tego rozróżnić, lecz intonacja od razu wskazuje różnicę. Na jej podstawie system precyzyjnie wyczuwa idealny moment na zabranie głosu.
Dlatego włączenie trybu ekspresyjnego przynosi dwie korzyści naraz: głos zyskuje autentyczne emocje, a pauzy i niezręczne wchodzenie sobie w słowo zostają zredukowane.
⚙️ 2. Aktywacja sprowadza się do zmiany jednego modelu
Nie ma tu osobnego przełącznika. Wystarczy wybrać model TTS V3 Conversational – tryb ekspresyjny uruchamia się wtedy domyślnie.
W panelu (Dashboard)
Otwórz swojego agenta, przejdź do zakładki Agent Voice, zmień model Text to Speech na V3 Conversational i zapisz zmiany. To wszystko.
W CLI
elevenlabs agents pull --agent "<nazwa-agenta>"W pobranym pliku agent_configs/<nazwa-agenta>.json zmień wartość conversation_config.tts.model_id w następujący sposób:
{
"conversation_config": {
"tts": {
"model_id": "eleven_v3_conversational"
}
}
}elevenlabs agents push --agent "<nazwa-agenta>"
W API
from elevenlabs import ElevenLabs
elevenlabs = ElevenLabs()
elevenlabs.conversational_ai.agents.update(
agent_id="TUTAJ_ID_AGENTA",
conversation_config={
"tts": {"model_id": "eleven_v3_conversational"},
},
)
Wypróbuj ElevenAgents za darmo →
📝 3. Tonem sterujesz za pomocą promptu systemowego
Samo przełączenie modelu poszerza wachlarz emocjonalny, ale to model decyduje, kiedy i jak ich użyje.
Jeśli Twoja marka ma wypracowany tone of voice lub określone standardy obsługi, musisz precyzyjnie opisać je w prompcie systemowym.
Wariant ①: Ogólny kierunek
Jesteś konsultantem wsparcia klienta. Jeśli rozmówca wydaje się sfrustrowany
lub poirytowany, odpowiadaj spokojnym, budzącym zaufanie tonem. Gdy przekazujesz
dobre wieści, niech w Twoim głosie wybrzmi szczere ciepło. Przez cały czas
utrzymuj profesjonalny, a zarazem przystępny i otwarty styl wypowiedzi.
Wariant ②: Precyzyjne reguły sytuacyjne
Wytyczne dotyczące tonu:
- Gdy klient wyraża niezadowolenie, stosuj spokojny i pełen empatii ton.
- Wyjaśniając procedury techniczne, mów wyraźnie i w miarowym tempie.
- Gdy rozmówca dzieli się dobrą wiadomością, reaguj ciepło i entuzjastycznie.
- Podczas obsługi reklamacji zachowaj opanowanie i skup się na rozwiązaniu problemu.
W oficjalnej dokumentacji zaznaczono, że nie trzeba definiować tagów dla każdej sytuacji.
Wystarczy opisać wytyczne językiem naturalnym, jak powyżej, a model zinterpretuje je odpowiednio do kontekstu.
W warunkach produkcyjnych bezpieczniejszy jest wariant ②. W branżach z procedurami obsługi klienta rozpisanie zależności „jaka sytuacja – jaki ton” ułatwia późniejszą weryfikację i audyt jakości rozmów.
🏷️ 4. Punktowe sterowanie za pomocą tagów
Niezależnie od sterowania kontekstowego, wybrane fragmenty można wskazać całkowicie jawnie.
W tym podejściu to model LLM bezpośrednio wstawia odpowiednie znaczniki w treści odpowiedzi.
[laughs]wtrąca lekki śmiech[whispers]zniża głos do szeptu[sighs]dodaje westchnienie[slow]zwalnia tempo mowy[excited]nadaje podekscytowany ton
★To kwestia najczęściej błędnie rozumiana przez twórców. Pojedynczy znacznik nie zmienia nastroju całego zdania.
Każdy tag oddziałuje wyłącznie na następujące po nim 4–5 słów, po czym barwa wraca do tonu wyjściowego.
Dlatego założenie, że „wystarczy wstawić tag na początku zdania”, nie przyniesie pożądanego efektu.
Znacznik należy umieścić bezpośrednio przed frazą, którą chcemy zaakcentować.
Oto oficjalny przykład:
"That's great to hear! [laughs] I'm glad we could sort that out for you."
Jeśli to Twój pierwszy kontakt ze znacznikami, polecamy zacząć od artykułu Kompletny przewodnik po promptowaniu w ElevenLabs, gdzie szczegółowo opisaliśmy znaczniki modelu v3.
Omówiliśmy tam tagi emocji, efekty dźwiękowe oraz techniki panowania nad pauzami i wymową.
⚠️ 5. Ograniczenia, które musisz sprawdzić przed wdrożeniem
W oficjalnej dokumentacji wskazano trzy ograniczenia, przy czym pierwsze ma fundamentalne znaczenie.
① Nie zachowuje pełnej wierności profesjonalnego klonowania głosu (PVC)
Jeśli zainwestowano czas i budżet w stworzenie profesjonalnego klonu głosu (Professional Voice Clone – PVC) prezesa firmy lub zawodowego lektora, ten punkt może zaważyć na decyzji o wdrożeniu.
Model Eleven v3 Conversational nie zachowuje obecnie pełnej specyfiki głosu PVC.
Rezultat może nie brzmieć dokładnie tak, jak oryginalny głos źródłowy.
Rekomendacja w dokumentacji jest jednoznaczna: jeśli kluczowa jest dla Ciebie tożsamość i wierność głosu PVC, pozostań przy modelu Flash v2.
Obecnie oznacza to wybór: albo bogata ekspresja, albo wierna tożsamość głosu. Połączenie obu tych cech nie jest jeszcze w pełni możliwe.
② Działanie tagów ogranicza się do 4–5 słów
Jak opisano wyżej: znaczniki nie służą do modulowania całych długich wypowiedzi.
③ Zróżnicowana jakość w zależności od głosu i języka
Liczba obsługiwanych języków wynosi ponad 70, co stanowi znaczny wzrost w porównaniu z około 32 w rodzinie Flash.
Dokumentacja osobno podkreśla wyraźną poprawę w językach, w których dotąd brakowało subtelnych niuansów (np. w japońskim).
Ten sam dokument otwarcie jednak wskazuje, że poziom ekspresji nie jest identyczny we wszystkich językach.
Jeśli bot ma rozmawiać po polsku, przetestuj go kilkukrotnie bezpośrednio w języku polskim, korzystając z docelowo planowanego głosu. Płynność w angielskich materiałach demonstracyjnych nie oznacza automatycznie takiego samego rezultatu w języku polskim.
💰 6. Koszty pozostają bez zmian
To pytanie pojawia się wyjątkowo często, a odpowiedź w oficjalnym FAQ brzmi: „Nie”.
Eleven v3 Conversational ma dokładnie taką samą stawkę jak pozostałe modele TTS dla agentów – ceny zaczynają się od 0,08 $ za minutę. Za włączenie trybu ekspresyjnego nie ma żadnych dodatkowych opłat.
Przewidywane koszty miesięczne w oparciu o wolumen połączeń w minutach możesz sprawdzić w naszym kalkulatorze opłat.
✍️ Podsumowanie
Podsumowując najważniejsze punkty:
Jak włączyć: Zmień model TTS na V3 Conversational. To wszystko.
Jak dostroić: Opisz pożądany ton w prompcie systemowym dla konkretnych scenariuszy.
Jak punktowo sterować: Wstaw znacznik bezpośrednio przed wybraną frazą (działa na 4–5 słów).
Na co uważać: Jeśli korzystasz z PVC, najpierw porównaj próbki i dopiero wtedy podejmij decyzję.
Dziękujemy za lekturę! ⚡