ElevenLabs выпустила v4: голос клонируется по записи в 10 секунд

28 сентября 2026 года ElevenLabs выпустила Eleven v4 и v4 Turbo — клон голоса по 10-секундной записи вместо прежних полутора минут, 90+ языков вместо 70. Я прогнал API на своём ключе: клонировать голос не вышло, потому что это платная функция от тарифа Starter — а как звучит готовый клон, показываю на чужих примерах.

28 сентября 2026 года ElevenLabs выпустила две новые модели озвучки - Eleven v4 и Eleven v4 Turbo. Главное обещание: клонировать голос теперь можно по десятисекундной записи, а для приличного результата раньше советовали минуту-две чистого звука. Заодно модель заговорила на 90 с лишним языках вместо прежних 70.

Я попробовал клонировать голос по десяти секундам

Ключ ElevenLabs у меня рабочий, а в роликах я всегда озвучиваю сам, без синтеза. Проверить обещание в 10 секунд решил на себе: взял десятисекундный кусок своей голосовой записи и отправил в API на клонирование.

Не вышло. API вернул отказ:

api.elevenlabs.io — ответ на клонирование
{
  "detail": {
    "type": "payment_required",
    "code": "paid_plan_required",
    "message": "Your subscription does not include instant voice cloning. Please upgrade your plan."
  }
}

Проверил тариф - у меня оплата по факту использования, и клонирование голоса в неё не входит вообще, ни в каком виде.

⚠️
Клонирование — платная кнопка тарифа

Десять секунд записи технически хватает по документации ElevenLabs, но сама возможность клонировать голос не входит ни в бесплатный тариф, ни в оплату по факту использования. Она появляется отдельной строкой с тарифа Starter, около 500 рублей в месяц. Точная профессиональная копия голоса открывается только с тарифа Creator, это уже около 1850 рублей.

Клонирование голоса — платная кнопка
Замок с волной звука внутри — клонирование голоса закрыто тарифом

Что реально поменялось

По числу языков я сверился напрямую по API: у старой модели Eleven Multilingual v2 в карточке значится 29 языков, у новой v4 - уже 85. Сама ElevenLabs округляет это до «90+», заметный скачок качества компания отметила отдельно для японского, бразильского португальского, мандаринского и кантонского.

Клонированный голос ElevenLabs на длинном тексте раньше плыл: интонация в начале ролика и в конце не совпадала. В v4 это чинит «сшивка контекста» - модель держит темп и подачу по всему тексту, и, по описанию ElevenLabs, аудиокнига на пятнадцать минут звучит так, будто её записали один раз, от первой до последней страницы.

Профессиональные клоны голоса - платная и самая точная копия конкретного голоса - в третьей версии не работали вообще, ElevenLabs сама написала об этом у себя на сайте. В v4 их вернули, и теперь профессиональный клон говорит с тем же эмоциональным диапазоном, что и обычная модель, на любом из поддерживаемых языков.

Вставки-подсказки для эмоций вроде [laughs], [whispers], [door slams] были и в третьей версии, но модель путала порядок. В v4 можно поставить несколько подсказок подряд, и модель отрабатывает их по очереди.

У Turbo-версии задача другая - скорость для голосовых ассистентов и колл-центров, где на счету каждая сотая секунды ответа. ElevenLabs меряла у себя медианную задержку до начала синтеза в 100 миллисекунд и время до первого звука в 150: для сравнения, у модели конкурента Cartesia Sonic 3.6 это 262 миллисекунды, у голосовой модели OpenAI - 814.

Как звучит готовый клон — примеры с русского рынка

Раз свой клон не получился, слушать пришлось чужие. В рунете есть открытые видео, где авторы клонируют голос в ElevenLabs по этой же инструкции и рядом дают услышать оригинал и копию - целыми роликами, без монтажной склейки в одну минуту.

Оба клона сделаны по обычной инструкции ElevenLabs, без специальных настроек - ровно тот путь, который мне не открылся из-за тарифа.

Скорость озвучки без клонирования

Голос клонировать не вышло, зато можно было сравнить, как v4 звучит и как быстро отвечает рядом со старой моделью - на одной и той же фразе с эмоциональными вставками и одном и том же голосе из библиотеки ElevenLabs.

Взял фразу на русском с двумя эмоциональными тегами и прогнал её через старую модель Eleven Multilingual v2, новую v4 и v4 Turbo:

  • в потоковом режиме Turbo начала отдавать звук за 0,67 секунды, обычная v4 - за 1,52, старая модель - за 1,63;

  • весь файл целиком (обычный запрос без потока) Turbo собрала за 1,54 секунды, старая модель - за 2,28, а вот обычная v4 неожиданно оказалась медленнее всех - 5,97 секунды на ту же фразу: похоже, здесь время уходит на выразительность, ради скорости и сделали отдельный Turbo;

  • текст на выходе программа распознавания речи Whisper разобрала все три файла слово в слово, а теги [laughs] и [sighs] ни разу не прозвучали как прочитанные вслух слова - модель отработала их как режиссёрскую пометку, без озвучивания текстом.

Сколько это стоит на практике

Для ролика про команду обычно хватает пары минут озвучки. По моей тестовой фразе вышло 14 символов на секунду звука - то есть минута начитанного текста это примерно 850 символов.

На тарифе Starter, около 500 рублей в месяц, дают 30 тысяч символов - при таком расходе это около 35 минут готового звука, с запасом на повторные прогоны и правки. Кредиты тратятся одинаково что на старой модели, что на v4 - переход на новую модель сам по себе дороже не делает.

Если текст для ролика сейчас начитывают сами перед микрофоном - несколько попыток, паузы, сведение звука, - вечер работы на десять-пятнадцать минут озвучки дело обычное. У модели та же задача занимает секунды на файл: в моём тесте старая модель и v4 отдавали готовый звук за 2-6 секунд, без единой повторной попытки перед микрофоном.

Десять секунд записи для клона голоса - цифра из документации самой ElevenLabs, и она заметно меньше прежних полутора минут. Но это платная кнопка: без тарифа Starter и выше её в аккаунте просто нет, как бы коротко ни была запись.

Нужна озвучка или клон голоса для своего проекта — напишите мне

Подписаться на @kursorai