Яндекс Метрика

Нейросеть для озвучки текста: 7 сервисов и ударения

Нейросеть для озвучки текста: семь сервисов синтеза речи, ударения и мультиязычная озвучка одного ролика

Один знак синтеза в SaluteSpeech стоит 0,000186 ₽, а бесплатный тариф ElevenLabs даёт 10 000 кредитов в месяц: по цене символа и лицензии сегодня и выбирают нейросеть для озвучки текста. Ниже — семь сервисов, которые закрывают эту задачу в 2026 году: облачные SaluteSpeech и Yandex SpeechKit, зарубежный ElevenLabs, редакторный CapCut, рублёвый Zvukogram и две открытые модели для своего сервера. Дальше — таблица сравнения, цена за символ, пошаговый пример и приёмы для ударений.

Что изменилось в озвучке роликов
Студия: недели согласованийСинтез: версия за час
Оплата за минуты записиОплата за символы текста
10 000 кредитов на Free30 000 кредитов на Starter за $6

Какие нейросети озвучивают текст на русском?

Озвучку на русском закрывают семь инструментов: облачные Yandex SpeechKit и SaluteSpeech, зарубежный ElevenLabs, редакторный CapCut, сервис с рублёвой оплатой Zvukogram и две открытые модели для своего сервера — Silero и XTTS-v2. Отличаются они ценой символа, условиями бесплатного режима и коммерческой лицензией.

Начинать выбор стоит с лицензии, а не с демо-записи. По документации SaluteSpeech, на бесплатном режиме контент разрешён только для личного некоммерческого использования, а коммерческое — после покупки платного пакета. У открытых моделей Silero опубликованы под некоммерческой лицензией CC-NC-BY все модели, кроме базовых моделей cis-tts: те выходят под MIT.

СервисЗадачаРусский и ударенияБесплатно или ценаКоммерческое использованиеДоступ из РФ
Yandex SpeechKitСинтез и распознавание речи через API или веб-панель Yandex CloudРусские голоса, расширенная разметка: паузы, ударения, скоростьТарифы считаются в символах, есть демо-режим для теста звучанияПроверяется в договоре; для бизнеса есть Brand Voice и Hybrid на своих серверахДоступен из РФ
SaluteSpeechСинтез и распознавание речи, управление интонацией, скоростью и паузамиРусские голоса, разметка акцентов и пауз200 000 символов и 100 минут распознавания в месяц; пакет для физлиц 1 000 000 символов — 1 000 ₽, продажа новых пакетов физлицам закрыта с 15.07.2026На бесплатном режиме запрещено, с платного пакета — разрешеноДоступен из РФ
ElevenLabsСинтез, клонирование голоса, дубляжСильные интонации; русский — один из поддерживаемых языковFree — 10 000 кредитов в месяц, Starter — $6 за 30 000 кредитовТолько на платных тарифах, начиная со StarterОплата российской картой недоступна (на сентябрь 2026)
CapCutОзвучка текста внутри видеоредактораCapCut заявляет более 200 голосов, включая своиБазовые голоса бесплатно, полная библиотека — в платной версии ProПо условиям сервиса, отдельная лицензия не документируетсяДоступ из РФ ограничен: приложение работает, часть облачных ИИ-функций недоступна
ZvukogramОзвучка текста, книг и диалогов, клонирование голосаРусские голоса, до 150 языков и акцентовОдин токен равен одному рублю, баланс пополняется по фактуКоммерческая лицензия включена в тарифДоступен из РФ
SileroЛокальные модели синтеза на своём сервереРусская модель ставится локально, права настраиваются разметкойОткрытый код, расходы — только своё железоБазовые модели cis-tts под MIT, остальные под CC-NC-BY — без коммерческого использованияРаботает без внешнего сервиса
XTTS-v2Локальный синтез и клонирование голоса17 языков, включая русский; клон по шестисекундному образцуОткрытая модель, нужен свой GPUЛицензия модели — Coqui Public Model License, условия проверяют перед проектомРаботает без внешнего сервиса

Демо-запись на сайте сервиса ничего не доказывает: она сделана на тексте, который модель знает хорошо. Голос проверяют на своём скрипте — с артикулами, названием бренда и числами, как это делал обзор синтеза речи на Habr, где сервисы прогоняли через один и тот же сложный абзац с фамилией, суммой и сокращением.

Yandex SpeechKit: разметка пауз, ударений и скорости

SpeechKit — облачный сервис Яндекса: синтез и распознавание речи работают через API или веб-панель Yandex Cloud. Голоса различаются тембром и стилем, есть расширенная разметка для тонкой настройки пауз, ударений и скорости, а для быстрого теста есть демо-режим, чтобы оценить звучание на своём тексте. Для бизнеса предусмотрены отдельные решения: Brand Voice и SpeechKit Hybrid.

SpeechKit полезен тем, что произношение правят руками. Там, где модели угадывают ударение по статистике, разметка позволяет задать его прямо в тексте: паузы, ударения и скорость правятся до генерации, а не после. Здесь качество русской озвучки держится на подготовке текста сильнее, чем на выбранном голосе.

Что проверить перед подключением: тарифы SpeechKit считаются в символах, и до старта проекта стоит посчитать объём по своему контент-плану. Если запись не должна уходить во внешнее облако, смотрите на Hybrid — развёртывание обработки речи на своих серверах.

SaluteSpeech: сколько стоит символ и что с бесплатным лимитом?

SaluteSpeech тарифицирует синтез за символ: 0,000186 ₽ за знак, включая пробелы и символы разметки. По официальной документации, обновлённой 31 августа 2026 года, пакет на 55 000 000 символов стоит 10 230 ₽, то есть 186 ₽ за миллион знаков, а минимальная стоимость использования сервиса — 15 000 ₽ в месяц.

186 ₽стоит один миллион символов синтеза в пакете SaluteSpeech — 55 000 000 знаков за 10 230 ₽ по прайсу, обновлённому 31 августа 2026 года

Бесплатный режим рассчитан на физлиц: 200 000 символов синтеза и 100 минут распознавания в месяц, остаток на следующий месяц не переносится. Коммерческое использование на нём запрещено: в разделе о коммерческом использовании документации сервиса сказано, что бесплатный доступ даётся исключительно для личного некоммерческого использования, а распространение и продажа допускаются только после покупки платного пакета. Озвученный ролик с бесплатного тарифа формально нельзя ставить в рекламу бренда.

Для физлиц есть и предоплаченный пакет: 1 000 000 символов за 1 000 ₽ и 1 000 минут распознавания за 1 200 ₽. Одно важное условие: по документации сервиса 15 июля 2026 года прекращена продажа новых пакетов и продление Freemium для физических лиц — ранее купленные пакеты работают до исчерпания лимита. Для юрлиц порядок покупки тоже менялся, и в документации он описан противоречиво: пакеты и оплата по факту названы недоступными новым клиентам и одновременно доступными корпоративным. Поэтому прайс и договор сверяйте на дату проекта, а не по прошлогоднему обзору.

Озвучка сотен роликов упирается в поток. Контент-завод на ИИ закрывает весь путь — от текста до готового файла и публикации — от 119 ₽ за публикацию на 10+ площадках.

Контент-завод на ИИ под ключ →

ElevenLabs: где он сильнее и что мешает работать из РФ?

ElevenLabs сильнее конкурентов в интонации и клонировании голоса, но коммерческая лицензия начинается только с платного тарифа. По официальной странице тарифов: Free — $0 и 10 000 кредитов в месяц без права коммерческого использования, Starter — $6 и 30 000 кредитов уже с коммерческой лицензией и мгновенным клонированием голоса, Creator — $22, Business — $990 за шесть миллионов кредитов и десять рабочих мест.

Для российского бизнеса главное ограничение — оплата: по состоянию на сентябрь 2026 года оплата российской картой недоступна, тарифы сервиса указаны в долларах. Расход считается в кредитах, и на мультиязычных моделях v2 один символ текста списывает один кредит. Поэтому бесплатный режим ElevenLabs — это тест на 10 000 знаков, примерно десять коротких реплик, а не рабочий объём.

Сколько символов даёт бесплатный режим за месяц

SaluteSpeech
200 000
ElevenLabs

Бесплатные режимы: символы синтеза у SaluteSpeech и кредиты у ElevenLabs, где один символ текста списывает один кредит. Официальные страницы тарифов, проверено 17 сентября 2026 года.

CapCut, Zvukogram и открытые модели: когда хватает редактора

Для точечной озвучки без потока выгоднее инструменты без API. CapCut озвучивает текст прямо в видеоредакторе: заявлено более 200 голосов, включая свои; базовые голоса бесплатны, полная библиотека — в платной версии Pro, а часть облачных ИИ-функций из РФ недоступна. Zvukogram работает с рублёвой оплатой — один токен равен одному рублю, коммерческая лицензия включена в тариф, поддерживается до 150 языков и до двух миллионов символов за один проход.

Открытые модели — третий путь: Silero и XTTS-v2 ставятся на свой сервер и не зависят от внешнего сервиса и его оплаты. XTTS-v2 поддерживает 17 языков, включая русский, и клонирует голос по шестисекундному образцу; лицензия модели — Coqui Public Model License, и её условия проверяют до старта коммерческого проекта.

На чём спотыкаются при выборе открытой модели

  • Некоммерческая лицензия. У Silero под CC-NC-BY опубликованы все модели, кроме базовых cis-tts под MIT: озвучка такой моделью не годится для рекламы.
  • Своё железо. Локальный синтез требует GPU и времени инженера — на десяти роликах это дороже облака.
  • Обновления вручную. Качество облачного сервиса растёт без вашего участия, локальную модель обновляете вы сами.

Синтез, клон голоса или дубляж: что выбрать под задачу?

Три задачи решаются разными инструментами. Синтез по тексту берут для потока, когда голос не часть бренда: один и тот же текст озвучивается десятки раз без потери качества. Клонирование голоса нужно, когда в эфире должен звучать конкретный человек — диктор, основатель, ведущий. Дубляж — когда один снятый ролик расходится по нескольким языковым рынкам.

Дубляж окупается на объёме: по разбору vc.ru о мультиязычной озвучке, ИИ-дубляж занимает часы вместо недель, а студийное производство обходится примерно на порядок дороже. Мультиязычные версии закладывают на этапе сценария. Быстрая разговорная речь и шутки на игре слов переносятся плохо, нейтральный темп и паузы — хорошо. Один ролик, озвученный на пять языков, дешевле повторной съёмки. Но только если паузы и темп заложены заранее.

×10во столько раз ИИ-дубляж дешевле студийного производства — оценка vc.ru для локализации видео
Кейс

Селлер косметики на Wildberries: 60 аккаунтов, около 17 000 публикаций в месяц, 10+ площадок. Результат на второй месяц работы — +307% к внешнему трафику на карточки и +53% к продажам. Формат — полезный контент четырёх типов, а не реклама в лоб. Для видеоверсий этого объёма озвучка в студии была бы отдельной статьёй бюджета и сроков.

Как озвучить ролик на 30–60 секунд: 7 шагов

Озвучка вертикального ролика занимает семь шагов: подготовить текст под речь, разметить ударения и паузы, выбрать голос и темп, сгенерировать файл, свести его с музыкой, добавить субтитры и прослушать целиком. Первый и последний шаг — человеческие: текст и приёмка решают больше, чем выбор сервиса. Ниже — порядок, который экономит две-три переозвучки на каждом ролике.

1

Текст под речь

Короткие фразы, числа и аббревиатуры словами, никаких скобок и слэшей. То, что легко читается глазами, синтез произносит хуже всего.

2

Разметка ударений и пауз

Профессиональные слова и названия брендов проверяются в первую очередь. Где сервис поддерживает разметку — акценты и паузы задаются прямо в тексте.

3

Выбор голоса и темпа

Два-три голоса прогоняются на своём скрипте, а не на демо. Темп подбирается под площадку: в ленте коротких видео речь быстрее, чем в обзоре карточки товара.

4

Генерация

Файл собирается целиком, а не фрагментами. На бесплатном тарифе сразу проверяются права: у части сервисов коммерческое использование начинается только с платного тарифа.

5

Сведение со звуком

Голос ставится над музыкой, фоновый трек убирается в минус. Речь не должна конкурировать с битом.

6

Субтитры

Текст для субтитров берётся из того же скрипта, а не распознаётся заново: так подписи совпадают с речью по словам.

7

Проверка на слух

Ролик слушается целиком до публикации. Ошибка в названии товара заметна раньше, чем красивая склейка кадров.

Как заставить нейросеть верно ставить ударения: 5 приёмов

Ударения правят текстом, а не настройками: слово переписывают так, чтобы модель прочитала его верно, числа и аббревиатуры пишут словами, длинные фразы разбивают на короткие. Там, где сервис поддерживает разметку — как SpeechKit с паузами, ударениями и скоростью или SaluteSpeech с разметкой акцентов, — ударение задают символом разметки, и он учитывается в тарификации.

Пять приёмов, которые убирают переозвучку
  1. Перепишите спорное слово. Если модель ставит ударение не туда, помогает синоним или написание с «ё»: «все» и «всё» читаются по-разному.
  2. Задайте ударение разметкой. В сервисах с разметкой акцент ставится прямо в тексте — это надёжнее, чем надеяться на автоопределение.
  3. Числа и артикулы — словами. «1 190 ₽» синтез читает по-разному, «тысяча сто девяносто рублей» — всегда одинаково. Артикул лучше проговорить по буквам.
  4. Разбейте длинную фразу. Синтез не понимает, где заканчивается мысль: две короткие фразы звучат естественнее одной длинной с запятыми.
  5. Слушайте партию, а не один файл. Качество одного ролика ничего не доказывает: проверяйте двадцать файлов подряд, чтобы увидеть, где модель стабильно ломается.

Отдельная проверка — имена и латиница внутри русского текста. Названия брендов, артикулы и сокращения читаются буквально, и для обзоров это самая дорогая ошибка: ролик уходит в ленту с неверным названием товара. Автор обзора на Habr отмечает: сервис угадывает ударение не всегда, зато даёт поправить его руками — этой возможностью и стоит пользоваться до генерации, а не после.

Нужны ли права на озвученный голос?

Да: синтез не отменяет прав. Коммерческая лицензия сервиса нужна для любой озвучки в рекламе, а для клонирования голоса человека — его письменное согласие, отдельное от согласия на использование старой записи. Отдельной статьи об охране голоса в Гражданском кодексе пока нет: законопроект внесён в Госдуму и обсуждается, а защита пока идёт через общие нормы.

По данным «Коммерсанта», проект поправок вводил бы согласие человека на обнародование и использование его голоса, в том числе через синтез речи, и отдельную статью об охране голоса в Гражданском кодексе. Второй трек — компенсации: Национальная федерация музыкальной индустрии и Союз дикторов предложили штраф за использование голоса без разрешения владельца.

  • Проверьте лицензию сервиса: коммерческое использование часто начинается только с платного тарифа.
  • Возьмите письменное согласие на синтез голоса — отдельно от права использовать старую запись.
  • Зафиксируйте срок и площадки, где голос можно использовать: право отозвать согласие уже обсуждается в индустрии.
  • Оставьте в договоре порядок отзыва: так обе стороны защищены от разбирательства через суд.
  • Проверьте, что голос не копирует узнаваемый голос третьего лица: претензии по голосу рассматриваются через общие нормы.

Итоги: что запомнить про нейросети для озвучки

Для озвучки на русском в 2026 году хватает трёх путей: облако с рублёвой оплатой (SpeechKit и SaluteSpeech), облако с сильной интонацией (ElevenLabs) и инструменты без API (CapCut, Zvukogram, открытые модели). Выбор начинается с лицензии и единицы тарификации, а не с демо-записи на сайте сервиса.

Коротко: главное
  1. Единица тарификации — символ: у SaluteSpeech знак стоит 0,000186 ₽, у ElevenLabs расход идёт в кредитах.
  2. Проверьте коммерческую лицензию до первой публикации: бесплатный режим почти всегда некоммерческий.
  3. Прогоняйте голос на своём скрипте с артикулами и числами — демо на сайте ничего не показывает.
  4. Ударения и паузы правьте в тексте до генерации, а не после неё.
  5. Клон голоса человека — только с письменного согласия, зафиксированного по сроку и площадкам.

Что делать дальше: возьмите скрипт ближайшего ролика, прогоните его через два-три сервиса из таблицы и посчитайте, сколько файлов каждый отдаёт без правки. Дальше считайте объём: десять роликов в месяц закрывает бесплатный режим, тысяча — только конвейер, где скрипт, синтез и публикация идут одним процессом.

Частые вопросы

Можно ли озвучивать ролики бесплатными нейросетями?+

Для пробы — да. У SaluteSpeech бесплатный режим даёт 200 000 символов синтеза и 100 минут распознавания в месяц, у ElevenLabs — 10 000 кредитов. Для работы — только с платного тарифа: на бесплатном коммерческое использование запрещено, и озвученный ролик формально нельзя ставить в рекламу бренда. Учтите и другое: продажа новых пакетов физлицам в SaluteSpeech закрыта с 15 июля 2026 года, так что бесплатный режим там теперь скорее тест, чем стартовая площадка. Считайте бесплатный режим тестом голоса, а не производственным инструментом.

Какая нейросеть лучше ставит ударения в русских словах?+

Точнее та, где ударение можно задать вручную. Yandex SpeechKit поддерживает расширенную разметку пауз, ударений и скорости, SaluteSpeech — управление интонацией, скоростью, акцентами и паузами. Если сервис не даёт разметки, ударение правят текстом: синонимом или написанием с буквой «ё». Проверять нужно на своей лексике — названиях брендов, артикулах и профессиональных терминах.

Нужно ли согласие человека, если его голос синтезирован?+

Да. Отдельной статьи об охране голоса в Гражданском кодексе пока нет, но согласие на использование голоса обсуждается как обязательное условие в законопроекте, а индустрия ссылается на общие нормы ГК и закон о персональных данных. Практический вывод: берите письменное согласие на синтез голоса сотрудника или подрядчика, отдельно от согласия на использование старой записи.

Сколько стоит озвучить десять роликов?+

По тарифу SaluteSpeech 0,000186 ₽ за символ десять роликов примерно по тысяче знаков — меньше двух рублей за весь объём синтеза. Но для юрлиц в документации указана минимальная стоимость использования 15 000 ₽ в месяц, а с 15 июля 2026 года условия покупки пакетов для новых клиентов менялись. Поэтому при малых объёмах экономику определяют минимальный чек, доступность тарифа на дату подключения и стоимость подготовки текстов, а цена символа уходит на второй план.

Русские голоса хуже зарубежных?+

Зависит от того, на каком языке модель обучалась изначально. Зарубежные платформы часто сильнее на английском, а русский у них входит в список поддерживаемых языков — отсюда ошибки в ударениях и интонации. Локальные модели, обученные на русском, ровнее держат базовую лексику, но проверять их нужно на своём скрипте: результат зависит от текста, а не от страны разработчика.

Сколько роликов в месяц реально озвучивать нейросетью?+

Узкое место — редакторский отбор: прослушать и поправить партию должен человек. На бесплатных режимах добавляется лимит символов: 200 000 у SaluteSpeech и 10 000 кредитов у ElevenLabs закрывают тесты, но не серийное производство. Поэтому объём озвучки держится на конвейере, где весь путь от текста до публикации идёт одним процессом, а не на трёх отдельных подрядчиках.

Евгений Карасев — основатель ЗАПУСКИ
Евгений Карасев
Основатель компании «ЗАПУСКИ». Строит контент-заводы на ИИ для крупных брендов и компаний, которым нужен масштабный контент в соцсетях.
Узнать подробнее

Полезные материалы:

Готовы запустить поток роликов
с озвучкой от 119 ₽ за публикацию вместо очереди к диктору?

Оставьте заявку — покажем примеры роликов для вашей ниши, посчитаем объём озвучки под ваши каналы и запустим публикации на 10+ площадках обычно за 5–7 дней

или напишите в Telegram

Читайте также

Нейросети для контента: хаб

Все инструменты по задачам — от текста до видео.

Нейросети для бизнеса

Что умеют и как применять в 2026.

Производство контента: варианты

Сколько стоит каждый способ и что выбрать.