Как работает Whisper: модель, которая слышит всё
23 сентября 2026 · техно-разбор · 6 минут чтения
Whisper от OpenAI — модель, на которой разговаривают почти все современные ассистенты, включая Амалию. Почему именно она: читаем устройство без страшной математики.
Идея: treats аудио как иностранный язык
Whisper построен на архитектуре трансформера и работает как переводчик, только переводит «с аудио на текст». Внутри две части:
- Энкодер — превращает спектрограмму звука (картинку того, как звучит фраза) во внутреннее представление: кто говорит, какие звуки, где паузы;
- Декодер — превращает это представление в текст, генерируя слова по одному и глядя на контекст, чтобы «семь» не превратилось в «семьдесят».
Почему Whisper хорош на русском
Модель обучена на 680 000 часов аудио — и значительная часть не англоязычна. Русского там десятки тысяч часов: разговорного, с акцентами, фоновым шумом. Отсюда три суперсилы:
- устойчивость к фону (улица, кафе, музыка);
- понимание «неправильной» речи: запинки, самопоправки, «э-э»;
- пунктуация и заглавные в выводе — текст сразу читабельный.
large-v3 и large-v3-turbo: в чём разница
Полная large-v3 — точность максимум, за скорость придётся платить: 0,33 с на фразу. large-v3-turbo — облегчённая версия: в декодере вдвое меньше слоёв, на бытовых фразах качество почти то же, а скорость — 0,17–0,22 с. Для голосового ассистента turbo — правильный выбор: там нужен темп, а не судебная точность.
Что Whisper не умеет
- Он не понимает «намерения» — только текст. Превращение текста в действия — работа LLM и tool calling;
- Не отличает спикеров — в диалоге нескольких людей раскладка «кто сказал» не его задача;
- Он стационарный: работает там, где есть инференс — на чипах вроде Groq LPU или локально (об этом — отдельный гайд).
Послушать Whisper в реальном времени проще всего вживую: Амалия — APK и фраза на проверку.