Нейросеть для озвучки текста: 7 сервисов и ударения
Один знак синтеза в SaluteSpeech стоит 0,000186 ₽, а бесплатный тариф ElevenLabs даёт 10 000 кредитов в месяц: по цене символа и лицензии сегодня и выбирают нейросеть для озвучки текста. Ниже — семь сервисов, которые закрывают эту задачу в 2026 году: облачные SaluteSpeech и Yandex SpeechKit, зарубежный ElevenLabs, редакторный CapCut, рублёвый Zvukogram и две открытые модели для своего сервера. Дальше — таблица сравнения, цена за символ, пошаговый пример и приёмы для ударений.
Какие нейросети озвучивают текст на русском?
Озвучку на русском закрывают семь инструментов: облачные Yandex SpeechKit и SaluteSpeech, зарубежный ElevenLabs, редакторный CapCut, сервис с рублёвой оплатой Zvukogram и две открытые модели для своего сервера — Silero и XTTS-v2. Отличаются они ценой символа, условиями бесплатного режима и коммерческой лицензией.
Начинать выбор стоит с лицензии, а не с демо-записи. По документации SaluteSpeech, на бесплатном режиме контент разрешён только для личного некоммерческого использования, а коммерческое — после покупки платного пакета. У открытых моделей Silero опубликованы под некоммерческой лицензией CC-NC-BY все модели, кроме базовых моделей cis-tts: те выходят под MIT.
| Сервис | Задача | Русский и ударения | Бесплатно или цена | Коммерческое использование | Доступ из РФ |
|---|---|---|---|---|---|
| Yandex SpeechKit | Синтез и распознавание речи через API или веб-панель Yandex Cloud | Русские голоса, расширенная разметка: паузы, ударения, скорость | Тарифы считаются в символах, есть демо-режим для теста звучания | Проверяется в договоре; для бизнеса есть Brand Voice и Hybrid на своих серверах | Доступен из РФ |
| SaluteSpeech | Синтез и распознавание речи, управление интонацией, скоростью и паузами | Русские голоса, разметка акцентов и пауз | 200 000 символов и 100 минут распознавания в месяц; пакет для физлиц 1 000 000 символов — 1 000 ₽, продажа новых пакетов физлицам закрыта с 15.07.2026 | На бесплатном режиме запрещено, с платного пакета — разрешено | Доступен из РФ |
| ElevenLabs | Синтез, клонирование голоса, дубляж | Сильные интонации; русский — один из поддерживаемых языков | Free — 10 000 кредитов в месяц, Starter — $6 за 30 000 кредитов | Только на платных тарифах, начиная со Starter | Оплата российской картой недоступна (на сентябрь 2026) |
| CapCut | Озвучка текста внутри видеоредактора | CapCut заявляет более 200 голосов, включая свои | Базовые голоса бесплатно, полная библиотека — в платной версии Pro | По условиям сервиса, отдельная лицензия не документируется | Доступ из РФ ограничен: приложение работает, часть облачных ИИ-функций недоступна |
| Zvukogram | Озвучка текста, книг и диалогов, клонирование голоса | Русские голоса, до 150 языков и акцентов | Один токен равен одному рублю, баланс пополняется по факту | Коммерческая лицензия включена в тариф | Доступен из РФ |
| Silero | Локальные модели синтеза на своём сервере | Русская модель ставится локально, права настраиваются разметкой | Открытый код, расходы — только своё железо | Базовые модели cis-tts под MIT, остальные под CC-NC-BY — без коммерческого использования | Работает без внешнего сервиса |
| XTTS-v2 | Локальный синтез и клонирование голоса | 17 языков, включая русский; клон по шестисекундному образцу | Открытая модель, нужен свой GPU | Лицензия модели — Coqui Public Model License, условия проверяют перед проектом | Работает без внешнего сервиса |
Демо-запись на сайте сервиса ничего не доказывает: она сделана на тексте, который модель знает хорошо. Голос проверяют на своём скрипте — с артикулами, названием бренда и числами, как это делал обзор синтеза речи на Habr, где сервисы прогоняли через один и тот же сложный абзац с фамилией, суммой и сокращением.
Yandex SpeechKit: разметка пауз, ударений и скорости
SpeechKit — облачный сервис Яндекса: синтез и распознавание речи работают через API или веб-панель Yandex Cloud. Голоса различаются тембром и стилем, есть расширенная разметка для тонкой настройки пауз, ударений и скорости, а для быстрого теста есть демо-режим, чтобы оценить звучание на своём тексте. Для бизнеса предусмотрены отдельные решения: Brand Voice и SpeechKit Hybrid.
SpeechKit полезен тем, что произношение правят руками. Там, где модели угадывают ударение по статистике, разметка позволяет задать его прямо в тексте: паузы, ударения и скорость правятся до генерации, а не после. Здесь качество русской озвучки держится на подготовке текста сильнее, чем на выбранном голосе.
SaluteSpeech: сколько стоит символ и что с бесплатным лимитом?
SaluteSpeech тарифицирует синтез за символ: 0,000186 ₽ за знак, включая пробелы и символы разметки. По официальной документации, обновлённой 31 августа 2026 года, пакет на 55 000 000 символов стоит 10 230 ₽, то есть 186 ₽ за миллион знаков, а минимальная стоимость использования сервиса — 15 000 ₽ в месяц.
Бесплатный режим рассчитан на физлиц: 200 000 символов синтеза и 100 минут распознавания в месяц, остаток на следующий месяц не переносится. Коммерческое использование на нём запрещено: в разделе о коммерческом использовании документации сервиса сказано, что бесплатный доступ даётся исключительно для личного некоммерческого использования, а распространение и продажа допускаются только после покупки платного пакета. Озвученный ролик с бесплатного тарифа формально нельзя ставить в рекламу бренда.
Для физлиц есть и предоплаченный пакет: 1 000 000 символов за 1 000 ₽ и 1 000 минут распознавания за 1 200 ₽. Одно важное условие: по документации сервиса 15 июля 2026 года прекращена продажа новых пакетов и продление Freemium для физических лиц — ранее купленные пакеты работают до исчерпания лимита. Для юрлиц порядок покупки тоже менялся, и в документации он описан противоречиво: пакеты и оплата по факту названы недоступными новым клиентам и одновременно доступными корпоративным. Поэтому прайс и договор сверяйте на дату проекта, а не по прошлогоднему обзору.
Озвучка сотен роликов упирается в поток. Контент-завод на ИИ закрывает весь путь — от текста до готового файла и публикации — от 119 ₽ за публикацию на 10+ площадках.
Контент-завод на ИИ под ключ →ElevenLabs: где он сильнее и что мешает работать из РФ?
ElevenLabs сильнее конкурентов в интонации и клонировании голоса, но коммерческая лицензия начинается только с платного тарифа. По официальной странице тарифов: Free — $0 и 10 000 кредитов в месяц без права коммерческого использования, Starter — $6 и 30 000 кредитов уже с коммерческой лицензией и мгновенным клонированием голоса, Creator — $22, Business — $990 за шесть миллионов кредитов и десять рабочих мест.
Для российского бизнеса главное ограничение — оплата: по состоянию на сентябрь 2026 года оплата российской картой недоступна, тарифы сервиса указаны в долларах. Расход считается в кредитах, и на мультиязычных моделях v2 один символ текста списывает один кредит. Поэтому бесплатный режим ElevenLabs — это тест на 10 000 знаков, примерно десять коротких реплик, а не рабочий объём.
Сколько символов даёт бесплатный режим за месяц
Бесплатные режимы: символы синтеза у SaluteSpeech и кредиты у ElevenLabs, где один символ текста списывает один кредит. Официальные страницы тарифов, проверено 17 сентября 2026 года.
CapCut, Zvukogram и открытые модели: когда хватает редактора
Для точечной озвучки без потока выгоднее инструменты без API. CapCut озвучивает текст прямо в видеоредакторе: заявлено более 200 голосов, включая свои; базовые голоса бесплатны, полная библиотека — в платной версии Pro, а часть облачных ИИ-функций из РФ недоступна. Zvukogram работает с рублёвой оплатой — один токен равен одному рублю, коммерческая лицензия включена в тариф, поддерживается до 150 языков и до двух миллионов символов за один проход.
Открытые модели — третий путь: Silero и XTTS-v2 ставятся на свой сервер и не зависят от внешнего сервиса и его оплаты. XTTS-v2 поддерживает 17 языков, включая русский, и клонирует голос по шестисекундному образцу; лицензия модели — Coqui Public Model License, и её условия проверяют до старта коммерческого проекта.
На чём спотыкаются при выборе открытой модели
- Некоммерческая лицензия. У Silero под CC-NC-BY опубликованы все модели, кроме базовых cis-tts под MIT: озвучка такой моделью не годится для рекламы.
- Своё железо. Локальный синтез требует GPU и времени инженера — на десяти роликах это дороже облака.
- Обновления вручную. Качество облачного сервиса растёт без вашего участия, локальную модель обновляете вы сами.
Синтез, клон голоса или дубляж: что выбрать под задачу?
Три задачи решаются разными инструментами. Синтез по тексту берут для потока, когда голос не часть бренда: один и тот же текст озвучивается десятки раз без потери качества. Клонирование голоса нужно, когда в эфире должен звучать конкретный человек — диктор, основатель, ведущий. Дубляж — когда один снятый ролик расходится по нескольким языковым рынкам.
Дубляж окупается на объёме: по разбору vc.ru о мультиязычной озвучке, ИИ-дубляж занимает часы вместо недель, а студийное производство обходится примерно на порядок дороже. Мультиязычные версии закладывают на этапе сценария. Быстрая разговорная речь и шутки на игре слов переносятся плохо, нейтральный темп и паузы — хорошо. Один ролик, озвученный на пять языков, дешевле повторной съёмки. Но только если паузы и темп заложены заранее.
Селлер косметики на Wildberries: 60 аккаунтов, около 17 000 публикаций в месяц, 10+ площадок. Результат на второй месяц работы — +307% к внешнему трафику на карточки и +53% к продажам. Формат — полезный контент четырёх типов, а не реклама в лоб. Для видеоверсий этого объёма озвучка в студии была бы отдельной статьёй бюджета и сроков.
Как озвучить ролик на 30–60 секунд: 7 шагов
Озвучка вертикального ролика занимает семь шагов: подготовить текст под речь, разметить ударения и паузы, выбрать голос и темп, сгенерировать файл, свести его с музыкой, добавить субтитры и прослушать целиком. Первый и последний шаг — человеческие: текст и приёмка решают больше, чем выбор сервиса. Ниже — порядок, который экономит две-три переозвучки на каждом ролике.
Текст под речь
Короткие фразы, числа и аббревиатуры словами, никаких скобок и слэшей. То, что легко читается глазами, синтез произносит хуже всего.
Разметка ударений и пауз
Профессиональные слова и названия брендов проверяются в первую очередь. Где сервис поддерживает разметку — акценты и паузы задаются прямо в тексте.
Выбор голоса и темпа
Два-три голоса прогоняются на своём скрипте, а не на демо. Темп подбирается под площадку: в ленте коротких видео речь быстрее, чем в обзоре карточки товара.
Генерация
Файл собирается целиком, а не фрагментами. На бесплатном тарифе сразу проверяются права: у части сервисов коммерческое использование начинается только с платного тарифа.
Сведение со звуком
Голос ставится над музыкой, фоновый трек убирается в минус. Речь не должна конкурировать с битом.
Субтитры
Текст для субтитров берётся из того же скрипта, а не распознаётся заново: так подписи совпадают с речью по словам.
Проверка на слух
Ролик слушается целиком до публикации. Ошибка в названии товара заметна раньше, чем красивая склейка кадров.
Как заставить нейросеть верно ставить ударения: 5 приёмов
Ударения правят текстом, а не настройками: слово переписывают так, чтобы модель прочитала его верно, числа и аббревиатуры пишут словами, длинные фразы разбивают на короткие. Там, где сервис поддерживает разметку — как SpeechKit с паузами, ударениями и скоростью или SaluteSpeech с разметкой акцентов, — ударение задают символом разметки, и он учитывается в тарификации.
- Перепишите спорное слово. Если модель ставит ударение не туда, помогает синоним или написание с «ё»: «все» и «всё» читаются по-разному.
- Задайте ударение разметкой. В сервисах с разметкой акцент ставится прямо в тексте — это надёжнее, чем надеяться на автоопределение.
- Числа и артикулы — словами. «1 190 ₽» синтез читает по-разному, «тысяча сто девяносто рублей» — всегда одинаково. Артикул лучше проговорить по буквам.
- Разбейте длинную фразу. Синтез не понимает, где заканчивается мысль: две короткие фразы звучат естественнее одной длинной с запятыми.
- Слушайте партию, а не один файл. Качество одного ролика ничего не доказывает: проверяйте двадцать файлов подряд, чтобы увидеть, где модель стабильно ломается.
Отдельная проверка — имена и латиница внутри русского текста. Названия брендов, артикулы и сокращения читаются буквально, и для обзоров это самая дорогая ошибка: ролик уходит в ленту с неверным названием товара. Автор обзора на Habr отмечает: сервис угадывает ударение не всегда, зато даёт поправить его руками — этой возможностью и стоит пользоваться до генерации, а не после.
Нужны ли права на озвученный голос?
Да: синтез не отменяет прав. Коммерческая лицензия сервиса нужна для любой озвучки в рекламе, а для клонирования голоса человека — его письменное согласие, отдельное от согласия на использование старой записи. Отдельной статьи об охране голоса в Гражданском кодексе пока нет: законопроект внесён в Госдуму и обсуждается, а защита пока идёт через общие нормы.
По данным «Коммерсанта», проект поправок вводил бы согласие человека на обнародование и использование его голоса, в том числе через синтез речи, и отдельную статью об охране голоса в Гражданском кодексе. Второй трек — компенсации: Национальная федерация музыкальной индустрии и Союз дикторов предложили штраф за использование голоса без разрешения владельца.
- Проверьте лицензию сервиса: коммерческое использование часто начинается только с платного тарифа.
- Возьмите письменное согласие на синтез голоса — отдельно от права использовать старую запись.
- Зафиксируйте срок и площадки, где голос можно использовать: право отозвать согласие уже обсуждается в индустрии.
- Оставьте в договоре порядок отзыва: так обе стороны защищены от разбирательства через суд.
- Проверьте, что голос не копирует узнаваемый голос третьего лица: претензии по голосу рассматриваются через общие нормы.
Итоги: что запомнить про нейросети для озвучки
Для озвучки на русском в 2026 году хватает трёх путей: облако с рублёвой оплатой (SpeechKit и SaluteSpeech), облако с сильной интонацией (ElevenLabs) и инструменты без API (CapCut, Zvukogram, открытые модели). Выбор начинается с лицензии и единицы тарификации, а не с демо-записи на сайте сервиса.
- Единица тарификации — символ: у SaluteSpeech знак стоит 0,000186 ₽, у ElevenLabs расход идёт в кредитах.
- Проверьте коммерческую лицензию до первой публикации: бесплатный режим почти всегда некоммерческий.
- Прогоняйте голос на своём скрипте с артикулами и числами — демо на сайте ничего не показывает.
- Ударения и паузы правьте в тексте до генерации, а не после неё.
- Клон голоса человека — только с письменного согласия, зафиксированного по сроку и площадкам.
Что делать дальше: возьмите скрипт ближайшего ролика, прогоните его через два-три сервиса из таблицы и посчитайте, сколько файлов каждый отдаёт без правки. Дальше считайте объём: десять роликов в месяц закрывает бесплатный режим, тысяча — только конвейер, где скрипт, синтез и публикация идут одним процессом.
Частые вопросы
Можно ли озвучивать ролики бесплатными нейросетями?+
Для пробы — да. У SaluteSpeech бесплатный режим даёт 200 000 символов синтеза и 100 минут распознавания в месяц, у ElevenLabs — 10 000 кредитов. Для работы — только с платного тарифа: на бесплатном коммерческое использование запрещено, и озвученный ролик формально нельзя ставить в рекламу бренда. Учтите и другое: продажа новых пакетов физлицам в SaluteSpeech закрыта с 15 июля 2026 года, так что бесплатный режим там теперь скорее тест, чем стартовая площадка. Считайте бесплатный режим тестом голоса, а не производственным инструментом.
Какая нейросеть лучше ставит ударения в русских словах?+
Точнее та, где ударение можно задать вручную. Yandex SpeechKit поддерживает расширенную разметку пауз, ударений и скорости, SaluteSpeech — управление интонацией, скоростью, акцентами и паузами. Если сервис не даёт разметки, ударение правят текстом: синонимом или написанием с буквой «ё». Проверять нужно на своей лексике — названиях брендов, артикулах и профессиональных терминах.
Нужно ли согласие человека, если его голос синтезирован?+
Да. Отдельной статьи об охране голоса в Гражданском кодексе пока нет, но согласие на использование голоса обсуждается как обязательное условие в законопроекте, а индустрия ссылается на общие нормы ГК и закон о персональных данных. Практический вывод: берите письменное согласие на синтез голоса сотрудника или подрядчика, отдельно от согласия на использование старой записи.
Сколько стоит озвучить десять роликов?+
По тарифу SaluteSpeech 0,000186 ₽ за символ десять роликов примерно по тысяче знаков — меньше двух рублей за весь объём синтеза. Но для юрлиц в документации указана минимальная стоимость использования 15 000 ₽ в месяц, а с 15 июля 2026 года условия покупки пакетов для новых клиентов менялись. Поэтому при малых объёмах экономику определяют минимальный чек, доступность тарифа на дату подключения и стоимость подготовки текстов, а цена символа уходит на второй план.
Русские голоса хуже зарубежных?+
Зависит от того, на каком языке модель обучалась изначально. Зарубежные платформы часто сильнее на английском, а русский у них входит в список поддерживаемых языков — отсюда ошибки в ударениях и интонации. Локальные модели, обученные на русском, ровнее держат базовую лексику, но проверять их нужно на своём скрипте: результат зависит от текста, а не от страны разработчика.
Сколько роликов в месяц реально озвучивать нейросетью?+
Узкое место — редакторский отбор: прослушать и поправить партию должен человек. На бесплатных режимах добавляется лимит символов: 200 000 у SaluteSpeech и 10 000 кредитов у ElevenLabs закрывают тесты, но не серийное производство. Поэтому объём озвучки держится на конвейере, где весь путь от текста до публикации идёт одним процессом, а не на трёх отдельных подрядчиках.