Текст в голос: TTS-движки для русского на Android | mirabel.tech

Текст в голос: TTS-движки для русского на Android

23 сентября 2026 · обзор · 6 минут чтения

Text-to-speech (TTS) — зеркальная операция к распознаванию: из текста делается звук. Кажется, задача решённая — но попробуй послушать три разных движка подряд, и разница проступит мгновенно. Обзор основных вариантов с русским языком — и где они уместны.

Системный Google TTS

Живёт в каждом Android, звучит по-русски прилично, работает офлайн (голоса скачиваются). Главный минус — темп и интонация «диктора новостей»: для навигации и доступности норм, для живого диалога — синтетика в чистом виде.

Silero TTS

Открытые русские голоса, генерация на обычном CPU, качество заметно выше системного. Отличный выбор для озвучки текстов и скриптов на русском — там, где важно, чтобы слушатель не страдал.

RHVoice и Piper

RHVoice — ветеран открытой русской озвучки: очень лёгкий, полностью офлайн, звучит роботизированно, но разборчиво — стандарт доступности на Linux и Android. Piper — новое поколение локальных движков: нейросетевые голоса на устройстве, качественнее RHVoice, требует чуть больше ресурсов.

Fish Audio drama-3

Облачная нейросетевая модель — та самая, что озвучивает Амалию. Главное отличие от всех перечисленных — живая интонация: она не «читает», а говорит, с паузами и настроением. Работает стримом: первый звук — через ~500 мс, не дожидаясь всей реплики. Облако — плата за качество: без интернета не звучит.

Матрица выбора

Почему в ассистентах TTS — не «просто озвучка»

В диалоге голос — часть характера: интонация решает, воспринимается ли ответ как живая речь или как справка. Плюс критична скорость: реплика, которая начинается через две секунды, убивает ощущение разговора. Поэтому в Амалии TTS — это стриминг с первого чанка, а не «сконвертировали файл — сыграли».

Услышать разницу между «читает» и «говорит» проще всего вживую: APK Амалии — и спроси её о чём-нибудь.