Дмитрий подводит к выбору рабочей конфигурации: по демозаписи K-средние и спектральная кластеризация дали одинаковую картину и метрики, а VBx оказался чуть лучше по частоте, DR и confusion, поэтому в итоге выбрали именно его. Отдельно он отмечает важный практический момент: в open-source есть готовые варианты с PLDA, но тюнинг обычно завязан на конкретный эмбеддер, поэтому PLDA от одной модели не всегда корректно переносится на другую — и это может повлиять на качество, если заменить Redimnet на ResNet101.
Подключайтесь к прямой трансляции по ссылке: https://voxlink.ru/webinars/kak-obognat-kommerческие-api
Задавайте спикеру вопросы в чате с хэштэгом #вопрос
#вопрос а точнее вопросы:
- при сравнении RTF фактора на VAD указывалось что Pyannote VAD запускался на GPU, получается, сравнение не корректное с производительностью остальных моделей, которые запускались на CPU?
- VAD всегда использовали с параметрами по умолчанию или каким-то образом подстраивали их? если подстраивали то как подбирали наиболее универсальные параметры
- производится ли какая-либо нормализация аудио перед обработкой?
- как вы боретесь с тем, что еще и сама модель STT дает неверные временные метки слов? отдельный прогон aligment модели поверх результата STT или как-то еще?
ну и главный #вопрос: как объяснить людям далеким от всех этих тонкостей, почему для диаризации не достаточно просто разделить аудио на левый и правый каналы и распознать их по отдельности, а надо заморачиваться с этими всеми VAD, векторами, кластеризацией и прочими страшными для рядового гражданина словами? систематически сталкиваюсь с тем, что люди искренне не верят что нельзя так просто взять и распознать все поканально и получить идеальную траснкрибацию с диаризацией (даже без VAD, просто разрезать аудио на два канала и скормить условному висперу отдельно левый и отдельно правый)