Как работает Whisper: модель, которая слышит всё | mirabel.tech

Как работает Whisper: модель, которая слышит всё

23 сентября 2026 · техно-разбор · 6 минут чтения

Whisper от OpenAI — модель, на которой разговаривают почти все современные ассистенты, включая Амалию. Почему именно она: читаем устройство без страшной математики.

Идея: treats аудио как иностранный язык

Whisper построен на архитектуре трансформера и работает как переводчик, только переводит «с аудио на текст». Внутри две части:

Почему Whisper хорош на русском

Модель обучена на 680 000 часов аудио — и значительная часть не англоязычна. Русского там десятки тысяч часов: разговорного, с акцентами, фоновым шумом. Отсюда три суперсилы:

large-v3 и large-v3-turbo: в чём разница

Полная large-v3 — точность максимум, за скорость придётся платить: 0,33 с на фразу. large-v3-turbo — облегчённая версия: в декодере вдвое меньше слоёв, на бытовых фразах качество почти то же, а скорость — 0,17–0,22 с. Для голосового ассистента turbo — правильный выбор: там нужен темп, а не судебная точность.

Что Whisper не умеет

Послушать Whisper в реальном времени проще всего вживую: АмалияAPK и фраза на проверку.