Об этом и речь и тогда теряется весь смысл от speech to speech который я вижу в отсутствии задержек в общении. Остальные преимущества в виде человеческого голоса... Мне кажется сомнительным, может ошибаюсь.
Человеческого голоса там нет и это даже хорошо. А по задержкам всё зависит от "расстояния" между узлами.
Я сегодня немного покопался с этим сипом. Так вот там только сигнализация, звук в виде события response.audio.delta получаешь через ws подключения и дальше его надо транслировать
Не нашел пока информацию про то можно ли использовать векторные хранилища openai для базы знаний, чтобы функция потом к ним обращалась
А так пока получается что как минимум два узла :
1. Сервер опенаи (где по факту stt - ai - tts)
2. Локальный скрипт который получает аудио и даёт инструкции боту
И дальше если условный RAG или MCP - это еще одна внешняя система (та же CRM) , то вот ещё один географически удалённый узел дающий + к задержкам