Как работают голосовые ассистенты: путь от «Амалия» до ответа
23 сентября 2026 · базовый разбор · 6 минут чтения
Голосовой ассистент кажется монолитом, но на самом деле это конвейер из четырёх независимых машин. Каждая решает одну задачу, у каждой — свои сроки и свои способы провалиться. Понимание конвейера сразу объясняет, почему ассистенты «тупят» и что с этим делать.
Этап 1. Детектор речи: услышать, что говорят
Микрофон ассистента включён всегда, но писать в облако всё подряд нельзя — ни по приватности, ни по деньгам. Работает детектор активности речи (VAD): крошечная нейросеть, которая отличает голос от шума и решает, когда началась фраза и когда закончилась. У Амалии это Silero VAD — работает офлайн на процессоре телефона. Полная теория — в разборе VAD.
Этап 2. Распознавание: звук → текст (STT)
Записанную фразу нужно превратить в текст. Это делает модель вроде Whisper — ей скармливают аудио, она возвращает слова. Качество на русском языке у больших моделей уже превосходное, а скорость зависит от железа: обычный облачный сервер отвечает за 500–800 мс, специализированные чипы Groq LPU — за 200 мс.
Этап 3. Мозг: текст → ответ (LLM)
Дальше текст попадает в языковую модель вместе с системным промптом (кто ассистент, как говорить) и контекстом разговора (что было минуту назад). Модель решает два вопроса сразу: что ответить и какие действия выполнить — включить Wi-Fi, поставить таймер. У Амалии ответ приходит строго в JSON: реплика для голоса плюс список инструментов. Это называется tool calling.
Этап 4. Голос: текст → звук (TTS)
Синтез речи превращает ответ в аудио. Главная оптимизация — не ждать готового ответа целиком: синтез стартует на первых токенах, а звук едет в динамик чанками, без декодирования и буферизации. Почему это критично — в разборе стриминга PCM.
Почему важна сумма, а не слагаемые
Каждый этап по отдельности может быть быстрым, но конвейер складывает всё: пауза на «ты закончил?» + распознавание + генерация + синтез. У типичных ассистентов сумма — 2–4 секунды, у Амалии — ~0,87 с. Разница не в магии, а в перекрытии этапов и выборе быстрых провайдеров на каждом шаге.
Одна схема, тысячи применений
Это тот же скелет, что у Алисы, Siri и Gemini — отличаются модели на каждом этапе и то, что ассистент делает с результатом: управляет колонкой, телефоном или умным домом. Скелет настолько честный, что его можно собрать самому — как, написано в отдельном гайде.
Не хочешь собирать сам? Амалия — этот же пайплайн, упакованный в APK: скачай и сравни со своим ассистентом по скорости.