Fish Audio: живая озвучка текста на русском

26 сентября 2026 · обзор · 5 минут чтения

Большинство TTS-движков читают текст. Fish Audio — говорит: с паузами, настроением и той интонацией, с которой человек рассказывает историю, а не зачитывает прогноз погоды. Разбираемся, чем берёт модель drama-3, как устроены reference-голоса и где это слышно вживую — Fish Audio озвучивает Амалию, открытый голосовой ассистент для Android.

Что это такое

Fish Audio — облачный text-to-speech с нейросетевыми моделями нового поколения. Ключевая для нас — drama-3: она синтезирует речь стримингом, то есть первый фрагмент звука отдаётся до того, как сгенерирована вся реплика. В Амалии это даёт ~500 мс до первого звука при полном цикле «слух → мозг → голос» за 0,87 секунды — анатомия задержки с реальными цифрами.

Почему звучит живо, а не «диктор новостей»

Классические синтезаторы ставят интонацию по правилам: ударение — пауза — конец фразы. Результат узнаваем и утомителен. Drama-3 обучена на живой драматической речи, поэтому она:

Именно поэтому в диалоге разница между «читает» и «говорит» слышна с первой секунды: стриминг без ожидания всей реплики превращает ответ в разговор.

Русский язык и reference-голоса

Русский — из коробки, без танцев с фонемами. Вторая сильная сторона — reference-голоса: в библиотеке Fish Audio тысячи голосов от сообщества — персонажи, актёры озвучки, дикторы; каждый подключается своим идентификатором: ищешь по имени, слушаешь превью, берёшь в проект. Нужен свой голос — загрузи образец записи, и движок будет говорить им. Для персонажей, аудиокниг и ассистентов «с характером» это меняет всё: голос и промпт вместе создают личность.

Как попробовать: API в два счёта

У Fish Audio простой HTTP API: регистрируешься на fish.audio, берёшь API-ключ, отправляешь POST-запрос на эндпоинт синтеза с текстом и идентификатором голоса — получаешь аудиопоток, который можно воспроизводить по мере поступления. На старте есть бесплатные лимиты для проб. Три строчки интеграции в Android-приложение (OkHttp + потоковый плеер) описаны в гайде про стриминг TTS, а тонкости аудио-слоя — в разборе AudioRecord и AudioTrack.

Где услышать без единой строчки кода

В Амалии drama-3 уже стоит как голосовой движок: скачай APK, введи ключ в настройках — и спроси её о чём-нибудь. Ответ вернётся вслух, с интонацией, которую не спутаешь с системной озвучкой. Сравнить с другими движками для русского (Silero, RHVoice, Piper, Google TTS) можно в обзоре TTS-движков.

Коротко: кому подходит

Слышать лучше, чем читать: APK Амалии — и попроси её рассказать что-нибудь с настроением.