Vosk: офлайн-распознавание речи на русском
23 сентября 2026 · гайд разработчика · 6 минут чтения
Vosk — самый известный открытый офлайн-движок распознавания речи с русской поддержкой: без сети, без сервера, на любом железе от Raspberry Pi до телефона. Разберём, как он устроен и когда его стоит выбирать вместо облачных моделей.
Внутри: Kaldi, укороченный до мобильного
Vosk — обёртка над Kaldi — классическим фреймворком распознавания. Технически это не трансформер, а комбинация акустической модели и произносительного словаря — прошлый стандарт индустрии до эры Whisper. Плата за архитектуру: стриминговое распознавание — Vosk отдаёт промежуточные гипотезы прямо во время речи (Whisper так не умеет — он ждёт всей фразы). Плюс: крошечные модели от 50 МБ, CPU вместо GPU, полная приватность.
Модели для русского
- vosk-model-small-ru (~45 МБ) — команды и короткие фразы на телефоне;
- vosk-model-ru (~1,3 ГБ) — заметно точнее, для серверов и подкастов;
- vosk-model-ru-0.42 — актуальное поколение с лучшей точностью.
Интеграция за вечер
- Микрофонный поток подаётся в распознаватель чанками — есть готовые биндинги для Android (Java/Kotlin), Python, Node, C#;
- Стриминг гипотез: показывай текст пользователю ещё до конца фразы;
- Грамматика-фильтр: для узких команд (только список действий) можно ограничить словарь — точность подскочит кратно.
Про смежный путь с нейросетевым Whisper локально — гайд про whisper.cpp на телефоне.
Vosk vs облако: где кто
- Vosk выигрывает: офлайн-сценарии, приватность, стриминг гипотез, нулевая стоимость на объёмы;
- Облако (Whisper на Groq — замеры) выигрывает: точность на живой разговорной речи, скорость (~0,2 с против секунд локальной модели), устойчивость к шуму.
Именно поэтому в Амалии гибрид: детекция речи — локальная, распознавание — облачное, а темп всего разговора — меньше секунды.
Собери свой пайплайн по гайду сборки ассистента — или возьми готовый: код Амалии и APK.