Речь в текст на Android: как работает speech-to-text | mirabel.tech

Речь в текст на Android: как работает speech-to-text

23 сентября 2026 · разбор · 5 минут чтения

Диктовка сообщений, субтитры, голосовые команды — везде под капотом одна операция: speech-to-text (STT). Разберём, как она устроена, почему точность на русском у всех разная и что выбрать под свою задачу.

Что происходит между твоим «привет» и словом на экране

Звук — это волна. Модель STT режет её на короткие окна, превращает в спектрограммы (как звук выглядит) и предсказывает, какие фонемы следуют друг за другом. Дальше — языковая часть: превращение фонем в слова с учётом языка. На выходе — текст с вероятностями, из которого собирается финальная строка.

Облако или на устройстве

Что убивает точность распознавания (и как чинить)

Кому это нужно кроме диктовки

Тот же STT-слой — основа голосовых ассистентов (сначала услышать, потом понять), субтитров в звонках, конспектирования лекций и голосового поиска в заметках. Если твоя задача — именно «сказал → получил текст» без ассистентства, тебе достаточно любого STT-движка из списка выше.

Хочешь слышать, как распознавание работает в связке с живым голосом? Амалияскачай APK и сравни со своей клавиатурной диктовкой.