Groq Whisper API на практике: скорость, лимиты, подводные камни
23 сентября 2026 · по опыту интеграции · 6 минут чтения
Groq прославился как «самый быстрый инференс» — но hype и реальность проверяются только интеграцией. Мы прогнали через Groq Whisper весь разговорный трафик Амалии и собрали факты, которых нет в маркетинге: реальные замеры, поведение бесплатного тарифа и грабли форматов. Всё ниже — из живого приложения.
Что за зверь
Groq — API-платформа инференса на собственных LPU-чипах. Whisper — модель распознавания речи от OpenAI. Groq хостит её открытым API: отправляешь аудио multipart-запросом, получаешь текст. Две модели на выбор: whisper-large-v3-turbo (по умолчанию) и полная whisper-large-v3.
Живые замеры (бесплатный тариф)
- whisper-large-v3-turbo: 0,17–0,22 с на запрос короткой бытовой фразы;
- whisper-large-v3: ~0,33 с — точнее на сложном аудио, но вдвое медленнее;
- для сравнения: тот же Whisper на обычных облачных GPU отвечает за 0,5–0,8 с.
Именно эта разница делает разговор «в реальном времени» реальным: в пайплайне Амалии распознавание — самый дешёвый по времени этап.
Лимиты бесплатного тарифа: чему учит заголовок x-ratelimit
Ответы Groq честно несут лимиты в заголовках. Цифры бесплатного тарифа:
- 2000 запросов в сутки;
- 7200 секунд аудио в сутки;
- сброс — динамический, окно около 43 секунд между пачками запросов.
Важная арифметика: если одна фраза — один запрос (а не стриминг кусков), то даже непрерывная болтовня по 20 секунд на фразу упирается в ~360 фраз в сутки по аудиолимиту. Для персонального ассистента этого хватает с запасом — 7200 секунд аудио нельзя выговорить за день, даже если орать в телефон весь рабочий день.
Грабли форматов, о которых молчат доки
- Сырой PCM сервис не принимает — отвечает 400. Обязательно контейнер: WAV принимается в 8/16/44,1 кГц, mono/stereo, 8/16 бит — поэтому Амалия всегда пакует фразу в WAV перед отправкой;
- Частота семплирования микрофона Android (обычно 48 кГц) не совпадает с рекомендованными — пересемплируй или конфигурируй AudioRecord на 16/44,1 кГц;
- Одна фраза = один POST. Не стримь куски: целая фраза даёт Whisper полный контекст — и качество, и скорость лучше, а логика проще.
Когда Groq Whisper — не твой вариант
Если нужен полный офлайн — это не про API вообще (см. гайд про офлайн-движки). Если нужен диаризации спикеров или timestamps-транскрипты подкастов — смотри полные версии Whisper с word-level timestamps. Для голосового ассистента — идеальное попадание: короткие фразы, разговорная речь, жёсткий потолок задержки.
Так это и работает в проде: Амалия открыта под MIT — исходники интеграции смотри в GroqWhisperStt.kt и GroqSttClient.kt.