Groq Whisper API на практике: скорость, лимиты, форматы | mirabel.tech

Groq Whisper API на практике: скорость, лимиты, подводные камни

23 сентября 2026 · по опыту интеграции · 6 минут чтения

Groq прославился как «самый быстрый инференс» — но hype и реальность проверяются только интеграцией. Мы прогнали через Groq Whisper весь разговорный трафик Амалии и собрали факты, которых нет в маркетинге: реальные замеры, поведение бесплатного тарифа и грабли форматов. Всё ниже — из живого приложения.

Что за зверь

Groq — API-платформа инференса на собственных LPU-чипах. Whisper — модель распознавания речи от OpenAI. Groq хостит её открытым API: отправляешь аудио multipart-запросом, получаешь текст. Две модели на выбор: whisper-large-v3-turbo (по умолчанию) и полная whisper-large-v3.

Живые замеры (бесплатный тариф)

Именно эта разница делает разговор «в реальном времени» реальным: в пайплайне Амалии распознавание — самый дешёвый по времени этап.

Лимиты бесплатного тарифа: чему учит заголовок x-ratelimit

Ответы Groq честно несут лимиты в заголовках. Цифры бесплатного тарифа:

Важная арифметика: если одна фраза — один запрос (а не стриминг кусков), то даже непрерывная болтовня по 20 секунд на фразу упирается в ~360 фраз в сутки по аудиолимиту. Для персонального ассистента этого хватает с запасом — 7200 секунд аудио нельзя выговорить за день, даже если орать в телефон весь рабочий день.

Грабли форматов, о которых молчат доки

Когда Groq Whisper — не твой вариант

Если нужен полный офлайн — это не про API вообще (см. гайд про офлайн-движки). Если нужен диаризации спикеров или timestamps-транскрипты подкастов — смотри полные версии Whisper с word-level timestamps. Для голосового ассистента — идеальное попадание: короткие фразы, разговорная речь, жёсткий потолок задержки.

Так это и работает в проде: Амалия открыта под MIT — исходники интеграции смотри в GroqWhisperStt.kt и GroqSttClient.kt.