«Слова правильные, но звучит не как живой человек».
Именно это первым делом говорят те, кто пробовал подключать голосового AI-оператора.
Всем привет! На связи Sonetho. ⚡
От тех, кто создал голосового AI-консультанта по нашей первой части (руководство для новичков) и второй части (кейс агентства недвижимости), мы постоянно слышим одну и ту же проблему.
Сценарий выверен идеально, но агент говорит с абсолютно одинаковой интонацией и с разъярённым клиентом, и в момент успешного закрытия сделки.
Живой человек в таких ситуациях неизбежно меняет голос, а когда этого не происходит, собеседник мгновенно понимает: «Опять AI» — и внутренне закрывается.
Именно для решения этой проблемы в ElevenLabs создали режим выразительности (Expressive mode).
⚠️ Сразу сделаем важную оговорку: это не новая функция.
В официальном блоге её анонсировали ещё в феврале 2026 года.
Однако на странице официальной документации дата не указана, поэтому многие видят её только сейчас, и во время написания этой серии статей нам задавали именно этот вопрос чаще всего.
Поэтому сегодня мы подробно расскажем, как настроить Expressive mode.
🎭 1. В Expressive mode задействованы сразу два механизма
Это не просто кнопка включения эмоций — изменения происходят одновременно на двух уровнях диалогового стека.
① Eleven v3 Conversational (синтез речи)
Это версия v3 с ультранизкой задержкой, оптимизированная для диалогов в реальном времени. Ключевая особенность — сохранение контекста разговора между репликами.
Если пользователь говорит с тревогой, агент отвечает спокойнее; в моментах, где информацию нужно донести с максимальной точностью, произносит слова более чётко.
② Новая система управления репликами (turn-taking) (распознавание речи)
Система определяет, когда начать говорить, а когда подождать, опираясь на потоковые сигналы от Scribe v2 Realtime.
Она анализирует не просто распознанный текст, но и то, как именно это было сказано (интонацию).
В официальной документации приведён наглядный пример.
Короткое «Да» может быть как окончательным ответом, так и сигналом продолжения фразы.
По тексту разницу не понять, но интонация всё расставляет по местам. Опираясь на неё, система точно выбирает момент, чтобы вступить в разговор.
Поэтому при включении Expressive mode вы получаете сразу два преимущества: голос наполняется живыми эмоциями, а случайные перебивания собеседника сводятся к минимуму.
⚙️ 2. Как включить: достаточно переключить модель
Отдельного переключателя нет. Если выбрать модель TTS V3 Conversational, Expressive mode включится по умолчанию.
В панели управления (Dashboard)
Откройте агента, перейдите на вкладку Agent Voice, смените модель Text to Speech на V3 Conversational и сохраните настройки. На этом всё.
В CLI
elevenlabs agents pull --agent "<имя-агента>"В полученном файле agent_configs/<имя-агента>.json измените conversation_config.tts.model_id следующим образом:
{
"conversation_config": {
"tts": {
"model_id": "eleven_v3_conversational"
}
}
}elevenlabs agents push --agent "<имя-агента>"
Через API
from elevenlabs import ElevenLabs
elevenlabs = ElevenLabs()
elevenlabs.conversational_ai.agents.update(
agent_id="ВАШ_ID_АГЕНТА",
conversation_config={
"tts": {"model_id": "eleven_v3_conversational"},
},
)
Начать бесплатно с ElevenAgents →
📝 3. Тональность задаётся в системном промпте
Если ограничиться только сменой модели, эмоциональный диапазон расширится, но где и как эти эмоции проявлять, модель будет решать сама.
Если у вас есть корпоративный Tone of Voice или регламенты обслуживания, их нужно зафиксировать в системном промпте, чтобы тон оставался стабильным.
Способ ①: задать общее направление
Вы — специалист службы поддержки. Если пользователь звучит раздражённо или
расстроенно, отвечайте спокойным и ободряющим тоном.
Сообщая хорошие новости, добавляйте в голос искреннюю теплоту.
В целом придерживайтесь профессионального, но открытого и доброжелательного стиля общения.
Способ ②: чётко зафиксировать правила под конкретные ситуации
Правила тональности:
- При недовольстве пользователя: спокойный, сочувствующий тон.
- При объяснении технических процедур: чёткая речь в размеренном темпе.
- При хороших новостях от пользователя: тёплая, радостная реакция.
- При обработке претензий: спокойный тон с акцентом на решение проблемы.
В официальной документации прямо говорится: нет нужды снабжать тегами каждую фразу.
Достаточно составить инструкции обычным текстом, как показано выше, и модель сама интерпретирует контекст.
На практике надёжнее вариант ②: для компаний с регламентами обслуживания понятные формулировки «в такой ситуации — такой тон» гораздо проще проверять и контролировать.
🏷️ 4. Точечные акценты с помощью тегов
Поверх общей контекстной настройки можно явно выделять нужные места.
Для этого LLM должна напрямую выводить теги прямо в своём ответе.
[laughs]добавляет лёгкий смех[whispers]понижает голос до шёпота[sighs]передаёт вздох[slow]замедляет темп речи[excited]придаёт воодушевлённый тон
★Здесь чаще всего возникает недопонимание. Один тег не меняет звучание всего предложения целиком.
Каждый тег действует только примерно на следующие 4–5 слов, после чего голос возвращается к обычному тону.
Поэтому подход «поставить один тег в начале предложения» нужного эффекта не даст.
Тег необходимо ставить непосредственно перед тем местом, которое вы хотите окрасить эмоцией.
Вот пример из официальной документации:
"That's great to hear! [laughs] I'm glad we could sort that out for you."
Если вы ещё не сталкивались с тегами, рекомендуем сначала изучить наше полное руководство по промптам в ElevenLabs, посвящённое модели v3.
Там подробно разобраны теги эмоций и звуковых эффектов, а также управление произношением и расстановкой пауз.
⚠️ 5. Ограничения, которые важно учесть перед включением
В официальной документации указаны три ключевых ограничения, и первое из них — самое важное.
① Не сохраняются уникальные характеристики профессионального клонирования (PVC)
Если вы потратили ресурсы и время на создание профессионального клона голоса (PVC) для руководителя компании или диктора, это ограничение станет решающим при принятии решения.
Eleven v3 Conversational на данный момент плохо воспроизводит тонкие индивидуальные тембры PVC.
На выходе голос может звучать не совсем так, как оригинальный голос.
Рекомендация в официальной документации однозначна: если ключевое значение имеет точная идентичность голоса PVC, продолжайте использовать Flash v2.
Иными словами, прямо сейчас приходится выбирать: живые эмоции или точное сходство с конкретным человеком. Получить и то, и другое одновременно пока не удастся.
② Действие тега ограничено 4–5 словами
Мы уже упоминали об этом выше: теги не предназначены для изменения тональности длинных предложений целиком.
③ Разница в качестве между голосами и языками
Количество поддерживаемых языков превышает 70 — это заметный шаг вперёд по сравнению с примерно 32 языками у линейки Flash.
В документации отдельно подчёркивается, что звучание языков вроде японского, где раньше не хватало выразительных интонаций, заметно улучшилось.
Однако там же прямо указано, что выразительность неодинакова для разных языков.
Если вы создаёте агента для работы на русском языке, обязательно протестируйте выбранный голос на реальных фразах на русском языке, прежде чем принимать решение. То, что отлично звучит в англоязычных демо, на русском языке может звучать иначе.
💰 6. Стоимость не увеличивается
Этот вопрос возникает удивительно часто, но официальный ответ в FAQ — однозначное «Нет».
Для Eleven v3 Conversational действует такой же базовый тариф, как и для остальных моделей агентов — от $0.08 за минуту. За включение Expressive mode дополнительная плата не взимается.
Оценить ежемесячные расходы в зависимости от ожидаемого объёма звонков можно в нашем калькуляторе тарифов, указав нужное количество минут.
✍️ В заключение
Подведём краткий итог:
Как включить: переключите модель TTS на V3 Conversational — и всё готово.
Как настроить: опишите интонации для конкретных ситуаций обычным текстом в системном промпте.
Как расставить акценты: ставьте тег непосредственно перед нужным местом (он действует только на 4–5 слов).
Когда быть внимательнее: если в проекте используется PVC, сначала сравните результаты и только потом принимайте решение.
Спасибо за внимание! ⚡