LPU: почему Groq такой быстрый
23 сентября 2026 · техно-разбор · 4 минуты чтения
Whisper в Амалии отвечает за 0,2 секунды не потому, что модель маленькая, — а потому, что она работает не на GPU. Разбираемся, что такое LPU и почему это важно именно для голосовых ассистентов.
Что такое LPU
LPU (Language Processing Unit) — специализированный чип компании Groq, спроектированный с нуля под одну задачу: инференс языковых моделей. Не обучение, не графику — только прогон готовой модели над данными, максимально быстро и предсказуемо.
Чем это отличается от GPU
GPU — универсальный солдат: тысячи ядер гоняют любые вычисления, включая инференс. Плата за универсальность — непредсказуемость: время ответа «плавает» в зависимости от загрузки, планировщика и батчинга чужих запросов. Для чата — незаметно. Для голосового ассистента — фатально: там каждый ответ должен уложиться в жёсткий бюджет времени.
LPU решает это иначе: модель целиком помещается в сверхбыструю память на чипе, вычисления идут конвейером с предсказуемым тактом. В результате два свойства, критичных для голоса:
- низкая задержка до первого токена — у Whisper это 0,17–0,22 с;
- стабильность — время ответа предсказуемо, конвейер не «дёргается».
Почему для ассистента это решает всё
Полный голосовой цикл — сумма задержек всех этапов (анатомия 0,87 с). В этой сумме два слагаемых дают LPU: распознавание (Whisper) и генерация (Qwen3). Замени их на медленный инференс — и даже идеальный аудио-конвейер не спасёт: пауза в ответе растянется до неестественной. Быстрый инференс — это не «приятный бонус», а фундамент живого разговора.
Где LPU не нужен
Массовая пакетная обработка (транскрибировать архив подкастов за ночь) — там важен throughput за деньги, и обычные GPU-провайдеры уместнее. Реалтайм-разговор — территория LPU: Амалия гоняет через него и слух, и мозг — вот почему она успевает отвечать быстрее, чем ты убираешь телефон от уха.
Проверить на своих ушах: скачать APK и сравнить с любым ассистентом, которым пользуешься сейчас.