Alibaba снизила цены на озвучку и распознавание речи на 70-95%
22 сентября 2026 года подешевели голосовые модели Qwen, 23 сентября вышли Qwen-Audio-3.1 и Gemini 3.8 TTS с голосом по описанию. Проверил, что из этого берётся по одному ключу, и прогнал русскую фразу с датой и процентом через прошлые версии обеих моделей за 3 цента.
22 сентября 2026 года в 00:00 по пекинскому времени Alibaba Cloud пересчитала прайс на голосовые модели Qwen, а 23 сентября 2026 года команда Qwen показала сам набор - Qwen-Audio-3.1 из пяти моделей. В тот же день Google выложил в Gemini API и AI Studio две модели озвучки, где голос собирается описанием словами. Я прошёлся по площадкам-посредникам, посмотрел, что из этого берётся по одному ключу, прогнал через найденное одну русскую фразу и посмотрел по счёту, во что выходит минута звука.
Что подешевело и с какого числа
Проценты снижения называет сам вендор, независимой проверки прайса нет. По цифрам the-decoder:
распознавание речи (ASR) - до 95%. Это перевод записи в текст;
озвучка (TTS) - около 70%. Это чтение текста голосом;
живой разговор (Realtime) - около 85%. Это когда модель слушает и отвечает голосом в реальном времени.
Снижение коснулось регионов Пекин и Сингапур и двух конкретных моделей в прайсе - qwen-audio-3.1-tts-flash и qwen-audio-3.0-realtime-flash. После пересчёта озвучка Flash стоит 1,5 юаня за миллион входных токенов и 12 юаней за миллион выходных. В минуты звука этот прайс не переводится: сколько токенов даёт минута речи, Alibaba не публикует, поэтому цену минуты я узнавал своим прогоном по счёту. AI Weekly отдельно отмечает, что в самом релизе Qwen даты вступления новых цен нет - она появилась только на сайте Alibaba Cloud.
Новая ASR-Next разбирает запись по говорящим
Три старых модели в наборе обновились, к ним добавились две новые.
ASR-Next разбирает запись по говорящим с таймкодами, ловит эмоции, фоновые звуки и шум техники. Пригодится, когда надо расшифровать созвон на три голоса и понять, какую фразу сказал каждый;
TTS-Next за один проход отдаёт голос, звуковые эффекты и фоновую подложку. Внутри языковая модель плюс диффузия - та же механика, что рисует картинки, только тут она собирает звук;
обычный ASR сам вычищает из расшифровки слова-паразиты и повторы;
манера чтения у TTS задаётся текстовой командой. В релизе показан пример: «прочитай резко, требовательно, с расчётом на уважение».
У Google голос описывается словами
Gemini 3.8 Flash TTS и Flash-Lite TTS собирают голос по описанию: роль, акцент, характер речи - больше 100 языков и диалектов. Готовая библиотека выросла с 30 голосов до 2000 с лишним. Клон модель снимает с 30 секунд записи и сверяет отдельную запись согласия с голосом на образце.
Google метит каждый файл двумя способами. SynthID - невидимая метка внутри самого звука, по ней потом видно, что файл синтезирован. C2PA - приложенная к файлу справка о происхождении, её Google ставит на клоны.
Google померил себя сам: в релизе он ставит обе модели на первое и второе место чужого бенчмарка Hume AI. Цену не назвал, независимых замеров пока никто не публиковал.

На посредниках лежит прошлое поколение
Брать модель у вендора напрямую значит открывать отдельный аккаунт и привязывать карту. Поэтому сначала я посмотрел площадки, где модели берутся по одному ключу. Проверка 24 сентября 2026 года:
Runware - 29 аудио-моделей, ни одной Qwen-Audio-3.1. Лежит Qwen3-TTS 1.7B в трёх вариантах и Gemini 3.1 Flash TTS. Распознавания речи нет ни одного - значит подешевевший на 95% ASR отсюда не взять;
fal - Qwen Audio 3.0 TTS Flash, 5 центов за 1000 входных знаков. Версии 3.1 нет;
OpenRouter - 458 моделей, из звука только две от OpenAI.
Список голосов у Gemini 3.1 Flash TTS на Runware - ровно тридцать имён, от Achernar до Zubenelgenubi, по умолчанию Zephyr. Это те самые тридцать, от которых Google теперь отсчитывает рост до двух тысяч.
Одна русская фраза, два голоса, три цента
Взял фразу с тем, на чём русская озвучка спотыкается: дата цифрами, процент значком, десятичная дробь через запятую и латинское название. 123 знака:
22 сентября 2026 года Alibaba срезала цены на озвучку на 95%: большая часть счёта - это теперь 0,2 цента за минуту речи.
Результат снимал машиной: каждый файл прогнал обратно через whisper-cli с моделью large-v3-turbo на маке и смотрел, что она услышала. Голос у Qwen задал описанием - «спокойный женский голос, ровная дикторская манера, средний темп».
Qwen3-TTS 1.7B VoiceDesign: 3,2 секунды на прогон, 0,18 цента, 17 секунд звука. Дату модель переврала во всех трёх прогонах - «20 сентября 2026 года», «22 сентября 2000 Райс года», «20 сентября, не 26 года». Название прочитала как «Али Баба». Процент, дробь и остальные слова вышли правильно.
Gemini 3.1 Flash TTS, голос Leda: 9,8 секунды на прогон, 0,9 цента в среднем, 13,3 секунды звука. Дата верна во всех трёх прогонах.
Цену минуты я считал от длины готового звука. У Qwen 0,0018 доллара за 16,96 секунды - это 0,6 цента за минуту. У Gemini в среднем 0,009 доллара за 13,28 секунды - 4 цента за минуту. На десять минут звука разница выходит в 6 центов против 41. За все шесть прогонов со счёта списалось 3 цента.
Расшифровка обратно через whisper ловит только перевранные слова: неверную дату, съеденное число, искажённое название. Ударения и тембр она не слышит, их читатель оценивает сам по двум файлам выше. Поэтому вывод из прогона узкий и проверяемый: дешёвая модель на 1,7 миллиарда параметров ломается на дате цифрами, модель побольше эту же дату читает верно.
Разделение по говорящим локально пока не делается
Вторую половину новости - расшифровку с разбором по говорящим - я проверил на своём ролике в 54 секунды. Локальный whisper-cli с моделью large-v3-turbo (1,6 ГБ) отработал за 5 секунд и разложил речь по таймкодам. Знаков препинания и заглавных букв он не ставит.
Разделение по говорящим у него включается ключом -di. На моно-записи с двумя явно разными голосами каждая строка вышла вот такой:
[00:00:00.000 --> 00:00:10.060] (speaker ?) 20 сентября 2026 года Alibaba [00:00:10.060 --> 00:00:16.660] (speaker ?) Большая часть счёта - это теперь [00:00:16.660 --> 00:00:24.660] (speaker ?) 22 сентября 2026 года Alibaba
Знак вопроса вместо номера говорящего стоит в каждой строке. На стереофайле, где голоса разложены по разным каналам, метка становится (speaker 1): ключ различает дорожки записи, а голоса внутри одной дорожки для него неотличимы. Второй ключ -tdrz требует отдельной модели tinydiarize, она существует только для английского. ASR-Next обещает ровно то, чего тут нет, и ни одна из трёх площадок его пока не выложила.
Что с этого брать
Подешевела та половина набора, которую пока негде взять по одному ключу. Доступна прошлая версия озвучки, и цена у неё уже такая, что минута звука обходится дешевле цента - служебные вставки, черновая начитка текста, проверка сценария на слух укладываются в копейки.
Дату и сумму цифрами дешёвая модель читает как хочет, и это видно с первого прогона. Проверять её надо на своём тексте с числами и названиями. Ровная фраза из примеров вендора этого не покажет.
Расшифровку созвонов на несколько голосов вы чем сейчас режете по говорящим?