Fish Audio: живая озвучка текста на русском
26 сентября 2026 · обзор · 5 минут чтения
Большинство TTS-движков читают текст. Fish Audio — говорит: с паузами, настроением и той интонацией, с которой человек рассказывает историю, а не зачитывает прогноз погоды. Разбираемся, чем берёт модель drama-3, как устроены reference-голоса и где это слышно вживую — Fish Audio озвучивает Амалию, открытый голосовой ассистент для Android.
Что это такое
Fish Audio — облачный text-to-speech с нейросетевыми моделями нового поколения. Ключевая для нас — drama-3: она синтезирует речь стримингом, то есть первый фрагмент звука отдаётся до того, как сгенерирована вся реплика. В Амалии это даёт ~500 мс до первого звука при полном цикле «слух → мозг → голос» за 0,87 секунды — анатомия задержки с реальными цифрами.
Почему звучит живо, а не «диктор новостей»
Классические синтезаторы ставят интонацию по правилам: ударение — пауза — конец фразы. Результат узнаваем и утомителен. Drama-3 обучена на живой драматической речи, поэтому она:
- меняет темп внутри фразы — важное произносит медленнее, связки проглатывает;
- держит настроение реплики: ирония остаётся иронией, усталость — усталостью;
- делает честные паузы там, где человек сделал бы паузу, а не там, где стоит запятая.
Именно поэтому в диалоге разница между «читает» и «говорит» слышна с первой секунды: стриминг без ожидания всей реплики превращает ответ в разговор.
Русский язык и reference-голоса
Русский — из коробки, без танцев с фонемами. Вторая сильная сторона — reference-голоса: в библиотеке Fish Audio тысячи голосов от сообщества — персонажи, актёры озвучки, дикторы; каждый подключается своим идентификатором: ищешь по имени, слушаешь превью, берёшь в проект. Нужен свой голос — загрузи образец записи, и движок будет говорить им. Для персонажей, аудиокниг и ассистентов «с характером» это меняет всё: голос и промпт вместе создают личность.
Как попробовать: API в два счёта
У Fish Audio простой HTTP API: регистрируешься на fish.audio, берёшь API-ключ, отправляешь POST-запрос на эндпоинт синтеза с текстом и идентификатором голоса — получаешь аудиопоток, который можно воспроизводить по мере поступления. На старте есть бесплатные лимиты для проб. Три строчки интеграции в Android-приложение (OkHttp + потоковый плеер) описаны в гайде про стриминг TTS, а тонкости аудио-слоя — в разборе AudioRecord и AudioTrack.
Где услышать без единой строчки кода
В Амалии drama-3 уже стоит как голосовой движок: скачай APK, введи ключ в настройках — и спроси её о чём-нибудь. Ответ вернётся вслух, с интонацией, которую не спутаешь с системной озвучкой. Сравнить с другими движками для русского (Silero, RHVoice, Piper, Google TTS) можно в обзоре TTS-движков.
Коротко: кому подходит
- живой голос в реальном времени, диалоги, ассистенты — лучший выбор;
- персонажи и озвучка с настроением — да, берите;
- полный офлайн без интернета — нет, это облако; тогда смотри офлайн-варианты;
- озвучка книг на слабом телефоне — проще локальные движки из сравнения.
Слышать лучше, чем читать: APK Амалии — и попроси её рассказать что-нибудь с настроением.