Как выбрать синтез речи для озвучки видео: Gemini TTS или ElevenLabs?

Сравниваем Gemini TTS и ElevenLabs через Ofox на одном тексте: исходное аудио, длительность, настройки и критерии выбора озвучки без неподтвержденных оценок стоимости.

Рисунок рулетки на светлой карточке, оливково-серый фон, коралловые полосы и надпись Gemini TTS vs ElevenLabs.

Выбирайте модель для озвучки по тому, какую запись вы готовы принять, какие настройки доступны через ваш фактический API-маршрут и сколько работы потребуется, чтобы встроить результат в видео. Сравнение цены за символ с ценой за аудиотокены не покажет, какой вариант готовой озвучки обходится дешевле. А сравнение разных сценариев не скажет, какая модель лучше справляется с одной и той же задачей.

10 октября 2026 года мы отправили один оригинальный англоязычный сценарий через Ofox в elevenlabs/eleven_v4 и google/gemini-3.8-flash-tts. Оба запроса завершились успешно. Файл ElevenLabs длится 10,00 секунды, файл Gemini — 9,76 секунды. Оригиналы можно скачать по ссылкам ниже. Это результаты одного запуска каждой конфигурации, а не рейтинг естественности речи, поддерживаемых языков или надёжности в производстве.

Начните с задачи, а не с поиска универсального победителя

Критерии приёмки десятисекундного ролика о продукте отличаются от критериев для аудиокниги, голосового ассистента с живым диалогом или многоязычного учебного курса. Это сравнение касается заранее подготовленной озвучки для видео: текст известен до отправки запроса, в ответ возвращается аудиофайл, а перед публикацией его проверяет редактор.

Мы не проверяли потоковый диалог, клонирование голоса, эмоциональный диапазон или все голоса из каталогов обеих платформ. Это также не контролируемое исследование с группой слушателей. Мы проверили полученные файлы и их технические свойства; прослушайте именно эти записи и оцените их с учётом собственных требований к произношению и подаче.

Поэтому полезнее всего спросить себя: какую из этих конфигураций стоит первой проверить для следующего конкретного материала? Ответ может зависеть от вашего текущего речевого конвейера, целевых голосов, бюджета на монтаж и подтверждённых расходов, даже если обе модели способны произнести нужные слова.

Один и тот же сценарий и две фактически проверенные конфигурации

В обоих запросах использовался этот оригинальный текст. Его прочитали из одного UTF-8-файла, удалив пробелы в начале и конце:

A clear product video starts with a clear brief. Show the real interface, explain one useful task, and check the exported video before sharing it.

Текст не меняли, а для обеих моделей запросили скорость 1.0. Голоса и пресеты вывода отличаются, потому что через шлюз доступны разные настройки. Поэтому это практическое сравнение конфигураций, а не эксперимент, в котором изолированно сравниваются только модели при неизменных голосе и кодировании.

КонфигурацияElevenLabs через OfoxGemini через Ofox
Модельelevenlabs/eleven_v4google/gemini-3.8-flash-tts
ГолосJBFqnCBsd6RMkjVDRZzbKore
Запрошенный форматmp3_22050_32wav
Запрошенная скорость1.01.0
Фактическая длительность файла10.00 s9.76 s
Размер скачанного файла, байт40 456476 186
Время выполнения на клиенте2.861 s4.949 s
Результат HTTP200200

Время выполнения — это результат одного клиентского запроса с учётом сетевых условий. Это не измерение задержки до получения первого аудиобайта. На разницу в размере файлов сильно повлиял запрошенный формат: сжатый MP3 против WAV. Она не свидетельствует о том, что в более крупном файле речь лучше.

Сначала прослушайте оригиналы, ничего не нормализуя

Скачайте MP3-файл ElevenLabs и WAV-файл Gemini. В полном комплекте файлов есть сценарий, клиент, конфигурация и метаданные — тест можно воспроизвести, не копируя учётные данные из примера.

Аудиопример ElevenLabs

Аудиопример Gemini

Сохраните оригиналы, чтобы зафиксировать происхождение файлов. Если вы создаёте копии с выровненной громкостью для прослушивания, назовите и опишите их отдельно. Разница в громкости может влиять на предпочтения, поэтому для честного сравнения нужно обеспечить одинаковый уровень воспроизведения. Но нельзя незаметно обработать скачанные файлы, а затем описывать обработанные версии как неизменённый результат API.

Используйте наушники или то устройство, на котором аудитория будет смотреть видео. Проверьте, чётко ли звучат слова «API», название бренда, дата или важное действие. Прослушивайте всю фразу в контексте, а не только самые удачные две секунды. Голос, который хорошо звучит в коротком фрагменте, всё равно может потребовать слишком много правок для вашего сценария.

В этой статье мы не выставляем оценку естественности речи. Без чёткой методики прослушивания и записей реальных слушателей числовая оценка создала бы ложную точность. Мы предоставляем файлы, чтобы результат можно было проверить, а не полагаться на необоснованное утверждение «звучит лучше».

Как воспроизвести тест с одним и тем же сценарием

Настройте ключ Ofox и установите Python requests, FFmpeg и ffprobe. Затем распакуйте комплект файлов и по одному разу запустите запрос для каждого провайдера, указав новые имена выходных файлов:

python3 audio_api.py speech --engine elevenlabs \
  --text comparison.txt --output my-elevenlabs.mp3
python3 audio_api.py speech --engine gemini \
  --text comparison.txt --output my-gemini.wav

Эти команды отправляют два реальных запроса. Не запускайте их только ради ознакомления с опубликованными примерами: эти файлы уже входят в комплект. Клиент останавливается, если выбранный выходной файл уже существует. Ошибки API он сохраняет отдельно от аудио. При неизвестном результате запроса клиент не запускает автоматические повторные POST-запросы.

На страницах моделей показаны соответствующие интеграции Ofox: ElevenLabs и Gemini TTS. Ознакомьтесь с ними, прежде чем менять тело запроса. Справочные материалы по нативному API — документация ElevenLabs по синтезу речи и обзор TTS от Google. Но не следует считать, что адаптер без изменений поддерживает полный набор параметров этих API.

Если одна конфигурация не сработала, сначала разберитесь с причиной сбоя и только потом сравнивайте качество голосов. В предыдущих попытках маршрут ElevenLabs возвращал ошибку квоты на стороне провайдера; после восстановления работы он сгенерировал опубликованный файл. Этот операционный инцидент не говорит о том, что качество речи модели хуже, а последующий успешный запрос не доказывает её долгосрочную доступность.

Что означает разница в длительности 0,24 секунды для монтажа

В этих файлах ElevenLabs длиннее Gemini на 0,24 секунды — это 2,46% относительно записи Gemini длительностью 9,76 секунды. Это может иметь значение, если рядом проходит жёсткая граница видеомонтажа, но наблюдение касается лишь этих конфигураций. Другой запуск, голос, язык или предложение могут дать иной результат.

Если видео заканчивается ровно через десять секунд, проверьте последнее произнесённое слово и возможную тишину после него. Длительность контейнера не показывает, в какой момент заканчивается последнее слово. Согласно отдельной транскрипции образца ElevenLabs, выполненной Scribe, последнее слово заканчивается на отметке 9,78 секунды. Не переносите эту отметку на файл Gemini без отдельной проверки.

Для длинной презентации разбейте озвучку на сцены: тогда правка одной реплики не потребует заново генерировать всю запись. Сохраняйте фрагмент сценария, аудиодубль и длительность сцены вместе. Если вы заново генерируете предложение, пересчитайте его длительность и синхронизацию субтитров, а не полагайтесь на продолжительность старого файла.

В статье о рабочем процессе озвучки видео объясняется, как измерить аудио и объединить его с MP4. В руководстве по субтитрам на основе транскрипции Scribe показано, как получить субтитры по фактическим временным отметкам слов. Длительность аудио ни одной из моделей не гарантирует, что готовый ролик без изменений поместится в существующий таймлайн.

Практические критерии для прослушивания и монтажа

Перед выбором провайдера составьте короткий лист критериев приёмки. Выбирайте то, что проверяющий действительно может оценить, и указывайте временной интервал для каждой найденной проблемы. Так субъективное впечатление не превратится в неповторяемый производственный стандарт.

КритерийЧто именно проверитьКакие данные сохранить
Соответствие сценариюНе пропущены, не повторены и не изменены ли слова?Исходный текст и интервал аудио
ПроизношениеЧётко ли звучат названия брендов, сокращения и даты?Точная фраза и заметка проверяющего
ТемпУкладывается ли реплика в сцену, не обрывая речь?Проверенная длительность и хронометраж сцены
ПаузыПомогают ли паузы передать нужный смысл?Границы фрагментов в редакторе
Объём правокСколько изменений потребовалось, чтобы принять запись?Журнал дублей, а не воспоминания
Формат выдачиВоспроизводится ли экспортированное видео в целевой среде?Проверка фактического экспорта и плеера

Для внутреннего слепого сравнения скройте названия провайдеров в копиях для прослушивания, используйте одинаковые условия воспроизведения и попросите проверяющих записывать причины своих оценок. Затем раскройте конфигурации. Если в тесте участвовали только два проверяющих или использовалось одно предложение, укажите размер выборки, а не представляйте результат как предпочтение всего рынка.

Проверка по транскрипту полезна, но у неё есть ограничения. Scribe распознал предполагаемые слова в записи ElevenLabs, за исключением пунктуации. Это подтверждает восстановление текста для данного чистого примера, но не даёт оценки качества звучания и само по себе ничего не говорит о записи Gemini, для которой транскрипцию не делали.

Сравнивайте стоимость принятой озвучки, а не несопоставимые тарифные единицы

В текущем каталоге Ofox для этих моделей указаны разные типы тарифных полей: у ElevenLabs есть поле стоимости входного текста за символ, а у Gemini TTS — поля для текстовых входных и аудиовыходных токенов. Эти категории объясняют, почему сравнение необработанных чисел вводит в заблуждение. Но по ним нельзя определить итоговую стоимость конкретных запросов, использованных для скачанных примеров.

Мы не сверяли эти запросы с отдельными строками расчётных операций, поэтому в таблице намеренно не указываем «фактическую стоимость» или процент экономии. Тарифы из каталога, изменение баланса кошелька и итоговые начисления за конкретный запрос — это разные виды данных. Общий баланс может измениться из-за других операций, а двоичный ответ с аудио не обязательно включает все счётчики, влияющие на оплату.

Для собственной оценки используйте идентификаторы запросов и соответствующие им записи об использовании. Подсчитывайте текст по правилам тарификации шлюза, учитывайте возвращённое или зарегистрированное количество токенов, если оно применимо, и проверяйте соответствующий снимок тарифов и правила округления. Отдельно учитывайте цены провайдера и сумму, списанную с вашего аккаунта Ofox.

Затем включите в расчёт отклонённые дубли. Если провайдер A требует три запроса и ручную правку, чтобы получить одну принятую реплику, а провайдеру B достаточно одного запроса, стоимость полезного результата будет отличаться от цены одного вызова. Для практического расчёта можно использовать такую таблицу:

accepted_narration_cost = sum(verified charges for all takes)
editing_minutes = time spent reviewing and repairing those takes
acceptance_rate = accepted takes / generated takes

Указывайте объём аудио и правила проверки вместе с этими числами. Не переводите миллисекунды выполнения запроса в денежную сумму и не используйте размер скачанного файла вместо количества аудиовыходных токенов. Если данные о списаниях недоступны, честно сравнивайте операционные результаты и сами файлы, а стоимость помечайте как неподтверждённую.

Какую конфигурацию проверить первой?

Если в вашем текущем проекте уже используется определённый голос ElevenLabs, начните с совместимого маршрута и проверьте на нём фактический сценарий. Сохранение знакомого голоса может уменьшить объём редакторских правок, но этот пример не доказывает, что через Ofox доступен каждый голос, привязанный к отдельному аккаунту или клонированный голос.

Если вы продолжаете опубликованный многоязычный рабочий процесс Ofox с Gemini, начните с проверенной конфигурации Gemini, чтобы сохранить совместимость сценария и инструментов монтажа. Сравнивайте с другим провайдером, только если для этого есть конкретная причина — например, предпочтительный совместимый голос или проблема с произношением. Знакомый процесс удобен в реализации, но это не доказательство общего превосходства модели в синтезе речи.

Если вы начинаете новый проект и ещё не выбрали голос, проверьте короткий фрагмент с самыми сложными словами из реального сценария. Используйте обе версии в одной и той же сцене. Выберите вариант, который проходит ваши критерии приёмки и укладывается в подтверждённый бюджет; сохраните резервную конфигурацию и проверьте её фактическую работу, прежде чем на неё полагаться.

Для голосовых ассистентов с живым диалогом, клонирования голоса, редких языков или строгих требований к вещательному качеству проведите отдельную оценку. Этот пример заранее подготовленной англоязычной озвучки для видео не подтверждает наличие таких возможностей. Чтобы расширить выводы на другие задачи, нужны дополнительные данные, а не более категоричные слова в заголовке сравнения.

Как превратить эксперимент в повторяемый рабочий процесс

Храните версию исходного текста, идентификатор модели, голос, формат, сгенерированный файл и результат проверки как одну запись. Если изменился псевдоним модели или вы выбрали другой голос, считайте результат новой конфигурацией. Не присваивайте старому удачному дублю новое имя модели без явного указания.

Перед запуском серии запросов задайте небольшой бюджет и условие остановки. Если маршрут завершился неизвестной ошибкой тайм-аута, проверьте его статус, а не запускайте вслепую десятки повторов. Если подходят оба варианта, сохраняйте самый простой в сопровождении рабочий процесс, пока новые данные не оправдают переход на другой.

Следующий полезный тест — обычно самое сложное реальное предложение или второй целевой язык, а не более длинный список неподтверждённых заявлений о возможностях. В этом примере есть две записи, которые можно проверить, и способ определить, что считать успешной озвучкой.

Часто задаваемые вопросы

Какая модель в этом тесте звучала лучше?
Мы не проводили контролируемое прослушивание группой слушателей и не выставляли субъективных оценок. Мы предоставили оба оригинальных файла, чтобы вы могли оценить произношение и подачу по собственным критериям.
Означает ли более быстрое выполнение этого запроса, что ElevenLabs работает быстрее?
У единственного запроса ElevenLabs измеренное время выполнения на клиенте было меньше. По одному запросу на конфигурацию нельзя установить общее превосходство по задержке или сравнить скорость потоковой передачи первого аудио.
Почему файл Gemini намного больше?
В тесте у Gemini запрашивался WAV, а у ElevenLabs — сжатый пресет MP3. Кодирование и формат контейнера сильно влияют на размер, поэтому сам по себе он не позволяет сравнить качество речи.
Какой вариант дешевле?
Мы не сверяли итоговые начисления за конкретные запросы. Прежде чем заявлять, что один рабочий процесс дешевле, сравните сопоставимые единицы тарификации и учтите все дубли, необходимые для получения принятого результата.