Silero VAD: как ассистент понимает, что ты закончил говорить
23 сентября 2026 · техно-разбор · 5 минут чтения
Самая недооценённая часть голосового ассистента — не мозг и не голос, а момент, когда запись решает, что фраза закончилась. Раньше для этого ждали «настоящего» сигнала — уровня громкости. Сейчас это делает крошечная нейросеть — и от неё зависит половина ощущения скорости. Разберём, как устроен Voice Activity Detector и почему в Амалии порог тишины — 600 миллисекунд.
Почему «детектора тишины по громкости» недостаточно
Наивный подход: замеряй RMS уровня сигнала — упало ниже порога, значит молчание. Ломается на первом же «эм»: пауза внутри фразы звучит тише слова, но это не конец фразы. А шёпот наоборот тихий — наивный детектор его выбросит. Человеческая речь — это и паузы, и вздохи, и шёпот, и «ну-у-у» на растяжке.
Как работает нейросетевой VAD
Silero VAD — компактная нейросеть, обученная отличать речь от всего остального. На вход идут короткие куски аудио (чанки), на выходе — вероятность «здесь речь» от 0 до 1. Важные свойства:
- работает на CPU обычного телефона — не нужен GPU и не нужен интернет;
- весит мегабайты, а не сотни мегабайт;
- устойчива к шуму, музыке на фоне, шёпоту — обучена на разном аудио.
Логика сверху простая: пока вероятность высокая — пишем и копим буфер фразы. Как только вероятность упала и продержалась низкой заданное время — фраза закончилась, буфер уезжает на распознавание.
Математика порога тишины
Порог тишины — это ставка на человеческую речь. Возьмёшь 300 мс — ассистент рубит фразы на полуслове: любой «э-э…» он примет за конец, отправит обрывок в распознавание и ответит не на то. Возьмёшь 1200 мс — после каждого ответа ждёшь лишнюю секунду: суммарно разговор длинного дня растянется на минуты ожидания. 600 мс — рабочая точка Амалии: нативно для коротких команд («выключи блютуз») и не режет вдумчивые фразы. Это константа в настройках, а не закон физики — под себя можно подстроить.
Что это даёт приватности
Второй бонус VAD — он же фильтр приватности. Аудио до начала речи и после конца фразы не уезжает никуда: детектор работает на устройстве, в облако отправляется только осмысленный кусок. Подробнее — в разборе приватности ассистентов.
Как попробовать
Silero VAD открыт и интегрируется за вечер: любой аудиопоток, порог, буфер — готов детектор конца фразы. Или возьми готовый пайплайн: Амалия открыта под MIT, внутри — VAD, стриминговый TTS и управление телефоном, а время отклика и его анатомия — в разборе 0,87 секунды.