Почему модель ошибается
Синтез речи учится на английском больше, чем на русском, а русское ударение подвижное и не видно на письме. Модель угадывает его по контексту и чаще всего ошибается в редких словах, фамилиях, топонимах и омографах — словах, которые пишутся одинаково: зáмок и замóк, мýка и мукá.
Официального способа ставить ударение именно в русском тексте ElevenLabs не описывает. Поэтому ниже — приёмы, которые проверены пользователями, и инструменты из документации сервиса. Работают они по-разному в разных моделях и голосах, так что проверяйте каждое трудное слово на короткой фразе.
Способ 1. Знак ударения над гласной
После ударной гласной ставят комбинируемый знак ударения (символ U+0301): получается «замо́к». В Windows его вводят Alt+0769 на цифровом блоке или копируют из таблицы символов, в Word — набирают 301 и жмут Alt+X.
Во многих голосах и моделях знак срабатывает, но не везде: иногда модель просто игнорирует его. Если слово всё равно читается неверно, переходите к следующим способам.
Способ 2. Заглавная ударная гласная
Второй народный приём — написать ударную гласную заглавной: «замОк», «мукА». Модель часто выделяет такую букву голосом. Минус — иногда она произносит слово с лишним нажимом или будто по буквам, поэтому приём годится для отдельных слов, а не для всего текста.
Способ 3. Ё и переписывание
Буква ё сама задаёт ударение, поэтому ставьте её везде, где она есть: «всё», «берёт», «осуждённый». Это самый надёжный из простых приёмов.
Если слово упорно звучит неправильно, перепишите его так, как оно слышится, или замените синонимом. Для фамилий и названий помогает разбить слово дефисом или написать фонетически. Цель — чтобы в файле звучало верно, текст для озвучки читателю не показывают.
Способ 4. Словарь произношения
Для длинных проектов, где одно и то же название встречается десятки раз, в ElevenLabs есть словари произношения — файлы .pls, которые загружают в Studio и Dubbing Studio. В них для слова указывают замену (alias): «пишется так — читай так». Для русского проще всего использовать именно замену на фонетическое написание.
Учтите две оговорки из документации: поиск в словаре чувствителен к регистру, и срабатывает только первая подходящая замена. Поэтому добавляйте слово во всех формах, в которых оно встречается в тексте.
Способ 5. Транскрипция в Eleven v4
По документации ElevenLabs, модель Eleven v4 понимает транскрипцию IPA без XML-тегов — её пишут между косыми чертами. Это самый точный способ указать произношение, но и самый трудоёмкий: нужно знать фонетические символы, а результат, как предупреждает сама документация, всё равно зависит от голоса и фразы. Теги phoneme в старом синтаксисе работают только в модели eleven_flash_v2 и только для отдельных слов.
Порядок, который экономит лимит
Подготовьте текст
Расставьте ё, распишите цифры и сокращения словами.
Найдите трудные слова
Фамилии, топонимы, термины, омографы — выпишите их списком.
Проверьте каждое на короткой фразе
Одна фраза стоит несколько десятков кредитов, весь текст — тысячи.
Выберите приём
Знак ударения или заглавная гласная; если не помогло — переписывание или словарь.
Озвучьте текст целиком
И только после этого — по частям на весь сценарий.
Когда быстрее через ИИ-агента
ИИ-агент LeanTech (app.leantech.ai) озвучивает текст и отдаёт готовый MP3 без VPN, оплата российской картой, кредит равен рублю. Он заранее подготовит текст к озвучке: распишет цифры, сокращения и трудные названия, расставит ё, а заодно переведёт текст или сделает субтитры.
Чего агент не делает: не гарантирует идеальное ударение в каждом редком слове — это ограничение любого синтеза речи — и не клонирует голос по вашей записи. Он не работает внутри других программ, а видео делает только на тарифах Pro и Power.