Игорь, крутой кейс, респект за инициативу! ?
К сожалению, очень узнаваемая история - когда сам собираешь MVP «на коленке», чтобы снять боль бизнеса, а потом упираешься в железо и организационные «ну давайте потом» ?
По сути вы уже сделали первый шаг к тому, что в мире контакт-центров становится must-have — речевой аналитике. Но тут сразу два классических затыка:
Whisper без GPU — серверу тяжело тянуть даже средние нагрузки, транскрибация превращается в узкое горлышко.
Ручной контроль качества — откровенно становится всё бОльшим костылём. Руководитель в наушниках 8 часов в день — отличная иллюстрация, почему рынок уходит в сторону автоматизированной аналитики.
В CallForce мы решили это комплексно:
Используем оптимизированные модели для быстрого speech-to-text на GPU (опять же, в отличие от яндекса, работающего только с 4*H100, мы можем работать и с видеокартами по-проще, как 1*V100)
✅ Дальше автоматическая аналитика уже метит «подозрительные» диалоги по ключевым словам и тд, чтобы супервайзер не слушал всё подряд.
✅ В результате человек тратит время только на действительно проблемные кейсы, а не на 8 часов сплошных записей.
И вопрос не только в транскрибационной части, комплект генеративных нейронок даёт сжатую суть и возможность заранее задать структуру категоризации каждого диалога
Разумеется, мало сделать просто транскрибацию, нужна также система уведомлений по триггерам и тд
И да, тут без GPU никуда — даже у нас для AI-модуля минимальная конфигурация с NVIDIA V100 или аналогом (32GB+). Хоть мы и работаем над альтернативными исследованиями, чтобы решить вопрос «удешевления оборудования» и сделать решение в целом более доступным в будущем.
да подсветка ключевых слов, и автопоиск ругательств или "интересных" разговоров можно было бы подключить, но я забил. ибо ну нафиг, пусть страдают в Б24, там можно вручную по одному разговору анализировать. Или робота настроить, тоже кстати одна из задач, которую никто делать не хочет.
Ибо даром нужно роботов делать.

