Российские модели распознавания речи обошли зарубежные на русскоязычных задачах, рассказали «Токсичной цифре» в MWS AI. Они развивают технологии распознавания речи с 2019 года и кажется что-то в этом понимают.
По результатам тестирования российские модели совершили вдвое меньше ошибок, чем зарубежные решения OpenAI и Nvidia и продемонстрировали достаточную точность для применения в основных специализированных бизнес-сценариях в ключевых
отраслях экономики России.
В сравнении участвовали две открытые модели Сбера, а также решения Alpha Cephei, Nvidia и OpenAI. Лучший средний результат показала российская GigaAM от Сбера. Тестирование проводилось на более чем 12 тыс. размеченных аудиозаписей общей длительностью около 38 часов. Выборка включала речь без выраженных помех, а
также записи с акустическим шумом и фоновой речью. Модели сравнивали по WER (Word Error Rate) — показателю, который отражает количество ошибок при распознавании слов относительно числа слов в эталонной расшифровке.
По итогам тестирования средний WER для GigaAM составил 7,4% — около 7,4 ошибки на каждые 100 слов эталонной расшифровки. Это более чем вдвое меньше, чем у Nvidia Parakeet с результатом 15,8%, и более чем втрое меньше, чем у Nvidia Nemotron с результатом 25,5%.
Детали в табличке. Кажется это весьма занятно.
По результатам тестирования российские модели совершили вдвое меньше ошибок, чем зарубежные решения OpenAI и Nvidia и продемонстрировали достаточную точность для применения в основных специализированных бизнес-сценариях в ключевых
отраслях экономики России.
В сравнении участвовали две открытые модели Сбера, а также решения Alpha Cephei, Nvidia и OpenAI. Лучший средний результат показала российская GigaAM от Сбера. Тестирование проводилось на более чем 12 тыс. размеченных аудиозаписей общей длительностью около 38 часов. Выборка включала речь без выраженных помех, а
также записи с акустическим шумом и фоновой речью. Модели сравнивали по WER (Word Error Rate) — показателю, который отражает количество ошибок при распознавании слов относительно числа слов в эталонной расшифровке.
По итогам тестирования средний WER для GigaAM составил 7,4% — около 7,4 ошибки на каждые 100 слов эталонной расшифровки. Это более чем вдвое меньше, чем у Nvidia Parakeet с результатом 15,8%, и более чем втрое меньше, чем у Nvidia Nemotron с результатом 25,5%.
Детали в табличке. Кажется это весьма занятно.