Работает достойно на уровне домашнего чайника, но и конечно далеко до передовых моделей, что логично, те уже на реакторах напрямую скоро работать будут. Хотя сравнивать наверное вообще некорректно. Пробовал телефонные разговоры диаризировать, распознавать через gigachat-max (облачный вариант), и там как будто товарищ майор каждое слово записал в тетрадочку, со всеми придыханиями.
еще есть модели для локального использования gigachat audio или vibevoice - но у меня на домашней видеокарте не завелось, кто-нибудь пробовал?
мне надо было чтобы показало проблемные звонки с какими-то конфликтами (не сходится баланс, изменить тариф), и звонки с намерениями и обещаниями (типа отправлю договор, подключу услугу) - это локальная llm вытаскивает из локально распознанного звонка. имена, бренды - это не всегда, но мне и не надо, обычно звонок привязан к номеру, который принадлежит какой-то организации или физлицу в CRM. еще бы посчитать там WER...
gigachat3-10B - это маленькая llm - здесь видно что она квантованная, целая 10B на 16Гб VRAM не входит - обрабатывает полученный диалог. по сути кто что сказал нас не интересует. нам важно знать надо ли этот звонок эскалировать руководителю, есть ли маты, обещал ли менеджер что-то сделать (можно в CRM задачу-напоминание поставить) - это все может дать llm по диалогу. т.е. это summary-call - саммари по звонку. по пачке summary-call можно вообще получить аналитику за день - например, "часто звонили по аварии на ММТС (120 звонков)" - это тоже дает llm.
gemma получше если llm. но там нужно понимать что галлюцинируют они все маленькие
получше? мне не зашла. перебрал gemma, qwen, t-lite, gigachat - максимально доступные варианты для карты. вот сначала t-lite норм по саммари был, но gigachat менее прожорливый, что позволяет ему сделать контекст побольше