🔍 Nemotron 3 Diarization: «-40% ошибок» — это средняя по восьми тестам, а не одна цифра
NVIDIA заявляет: новая модель диаризации (кто и когда говорил) заняла 1-е место в Voice Arena Diarization-Bench с DER 14,72% против 19,3% у второго места — это и есть заявленные ~24% относительного улучшения.
Дальше вендор сравнивает новинку со своей же прошлой моделью Streaming Sortformer (4 говорящих) и пишет про «в среднем 40% относительное снижение DER» на восьми бенчмарках при задержке 1,04 сек. Но это невзвешенное среднее по разбросу от 9% (CALLHOME-Part2) до 65,2% (NOTSOFAR1 MHM) — то есть где-то улучшение почти отсутствует, где-то огромное.
Есть и обратный пример: на двухговорящем подмножестве CALLHOME новая модель показала 5,98% DER против 5,68% у старой — то есть хуже. Прирост появляется именно там, где говорящих больше четырёх: модель поддерживает до 8 каналов, и на многоголосых записях (DIHARD III, NOTSOFAR1) разница действительно значительная.
Заявленный throughput (15 113× RTFx против 2 619×) измерен батчем 32 на RTX PRO 5000 — это пропускная способность обработки, а не задержка одного живого разговора в продакшене.
Выгода реальна для колл-центров и групповых звонков с 5+ участниками. Для обычных двусторонних диалогов новая модель не даёт заметного прироста, а где-то оказывается чуть хуже прежней.
Источник
💬 Telegram | 💬 MAX
#разбор #нейросети #для_бизнеса
NVIDIA заявляет: новая модель диаризации (кто и когда говорил) заняла 1-е место в Voice Arena Diarization-Bench с DER 14,72% против 19,3% у второго места — это и есть заявленные ~24% относительного улучшения.
Дальше вендор сравнивает новинку со своей же прошлой моделью Streaming Sortformer (4 говорящих) и пишет про «в среднем 40% относительное снижение DER» на восьми бенчмарках при задержке 1,04 сек. Но это невзвешенное среднее по разбросу от 9% (CALLHOME-Part2) до 65,2% (NOTSOFAR1 MHM) — то есть где-то улучшение почти отсутствует, где-то огромное.
Есть и обратный пример: на двухговорящем подмножестве CALLHOME новая модель показала 5,98% DER против 5,68% у старой — то есть хуже. Прирост появляется именно там, где говорящих больше четырёх: модель поддерживает до 8 каналов, и на многоголосых записях (DIHARD III, NOTSOFAR1) разница действительно значительная.
Заявленный throughput (15 113× RTFx против 2 619×) измерен батчем 32 на RTX PRO 5000 — это пропускная способность обработки, а не задержка одного живого разговора в продакшене.
Выгода реальна для колл-центров и групповых звонков с 5+ участниками. Для обычных двусторонних диалогов новая модель не даёт заметного прироста, а где-то оказывается чуть хуже прежней.
Источник
💬 Telegram | 💬 MAX
#разбор #нейросети #для_бизнеса