LPU: почему Groq быстрый — чипы для инференса | mirabel.tech

LPU: почему Groq такой быстрый

23 сентября 2026 · техно-разбор · 4 минуты чтения

Whisper в Амалии отвечает за 0,2 секунды не потому, что модель маленькая, — а потому, что она работает не на GPU. Разбираемся, что такое LPU и почему это важно именно для голосовых ассистентов.

Что такое LPU

LPU (Language Processing Unit) — специализированный чип компании Groq, спроектированный с нуля под одну задачу: инференс языковых моделей. Не обучение, не графику — только прогон готовой модели над данными, максимально быстро и предсказуемо.

Чем это отличается от GPU

GPU — универсальный солдат: тысячи ядер гоняют любые вычисления, включая инференс. Плата за универсальность — непредсказуемость: время ответа «плавает» в зависимости от загрузки, планировщика и батчинга чужих запросов. Для чата — незаметно. Для голосового ассистента — фатально: там каждый ответ должен уложиться в жёсткий бюджет времени.

LPU решает это иначе: модель целиком помещается в сверхбыструю память на чипе, вычисления идут конвейером с предсказуемым тактом. В результате два свойства, критичных для голоса:

Почему для ассистента это решает всё

Полный голосовой цикл — сумма задержек всех этапов (анатомия 0,87 с). В этой сумме два слагаемых дают LPU: распознавание (Whisper) и генерация (Qwen3). Замени их на медленный инференс — и даже идеальный аудио-конвейер не спасёт: пауза в ответе растянется до неестественной. Быстрый инференс — это не «приятный бонус», а фундамент живого разговора.

Где LPU не нужен

Массовая пакетная обработка (транскрибировать архив подкастов за ночь) — там важен throughput за деньги, и обычные GPU-провайдеры уместнее. Реалтайм-разговор — территория LPU: Амалия гоняет через него и слух, и мозг — вот почему она успевает отвечать быстрее, чем ты убираешь телефон от уха.

Проверить на своих ушах: скачать APK и сравнить с любым ассистентом, которым пользуешься сейчас.