Почему голосовые ассистенты отвечают медленно: разбор 0,87 с | mirabel.tech

Почему голосовые ассистенты отвечают медленно — и как добиться 0,87 секунды

23 сентября 2026 · разбор · 7 минут чтения

Задержка в голосовом диалоге ощущается нелинейно. До ~1 секунды мозг собеседника ещё воспринимает паузу как естественную. После 1,5 секунд — уже как «он что-то заметил и молчит». Большие ассистенты сидят в зоне 2–4 секунд и потому всегда звучат «через голову». Разберём, из чего складывается задержка и где она режется — с реальными цифрами Амалии.

Анатомия паузы: четыре этапа

1. Тишина → конец фразы (VAD). Пока ты говоришь, запись продолжается. Проблема в другом: как понять, что фраза закончилась? Отсекают по тишине — детектор голоса Silero VAD на устройстве засекает 600 мс без речи. Это честная плата: если отрезать раньше, перережешь полфразы. Как он устроен внутри — отдельный разбор.

2. Распознавание (STT). Записанный звук уезжает на Whisper v3 Turbo — и возвращает текст. На Groq LPU, железе под инференс, средний ответ — ~220 мс для короткой бытовой фразы.

3. Мозг (LLM). Текст реплики попадает в Qwen3 27B вместе с системным промптом и контекстом. До первого токена — ~150 мс на Groq. Но заметь: это токен, не готовый ответ. Полная генерация реплики из двух-трёх предложений занимает дольше.

4. Голос (TTS). Классическая ошибка — ждать готового текста и потом синтезировать всё аудио. Fish Audio drama-3 отдаёт первый PCM-чанк за ~500 мс с начала синтеза.

Три трюка, которые сокращают сумму

Наивная арифметика: 600 + 220 + 150 + (генерация) + 500 = унылые 3+ секунды. Но каждый этап можно перекрывать:

Сводка реальных цифр

Что замедляет «нормальных» ассистентов

Три типовых виновника: большой системный промпт, который пересылается целиком на каждый запрос; очередь на общем инференсе без выделенных LPU; и последовательный пайплайн, где каждый этап ждёт полного завершения предыдущего. Убери любое из трёх — и задержка падает в разы без смены моделей.

Проверь сам

Схема воспроизводима на любом стеке: детектор тишины + быстрый STT + LLM с низким временем до токена + потоковый TTS. Либо просто возьми готовое: Амалия открыта под MIT, полный исходники и разбор архитектуры — на GitHub. А список голосовых команд для телефона — в гайде по управлению Android голосом.