Модератор: Glukinho
тут мне нужно пояснение
куча компонентов между собой связанных, везде многое может пойти не так.
+ если хоть где-то в пайпайне есть LLM, то ее нужно проверять, как она делает то, что должна делать.
Совсем просто - e2e тестирование, например. Т.е. тестовые вызовы в течении дня, которые вызывают бота, запрашивают переводы и эмулируют более сложные юз кейсы, потом перевод и сравнения того, что отправили с тем, куда перевело. Если речь про транскрибацию, то отправляем голос, получаем транскрибацию и считаем WER на счет того, как это было сделано.
Если где то есть RAG, то задача еще более важная, но и более сложная.
Самое важное в работе с LLM загнать ее в рамки и по любому поводу мучать тестами.
готов пойти к вам креатором за 5% от дохода за продукт.
вместо УГМ придумаем что-то более благозвучное))
ща речь чисто за креатив. за сейлз обсудим позже
Нет, так мы не заморачиваемся. У нас у всего есть логи, считаем конверсию по роботам. Есть отдел для анализа работы роботов (там работа с диалогами)
у нас предполагается 500к+ портов и большой объем звонков. Несколько моделей на failover, и нужно, что бы все модели соответствовали. Без постоянного мониторинга тяжело будет. А evaluation нужен, что бы весь пайплайн тестировать каждый раз, когда есть какие либо, даже минорные, изменения. Это важно, особенно учитывая, что на ASR уходят куски голоса. Куча мест где всё может пойти не по сценарию)
ну, откровенно, его стоит попробовать)