Nvidia выпустила открытую модель для распознавания до восьми собеседников
Nemotron 3 Diarization размечает говорящих в записи и живом аудио, включая одновременную речь. Модель насчитывает около 100 млн параметров; шум и большое число участников ухудшают точность.
Метки говорящих для аудио
Nvidia представила Nemotron 3 Diarization — модель, которая определяет, кто говорит в каждый момент разговора. По данным The Decoder, в ней около 100 млн параметров, а веса доступны бесплатно. Модель различает до восьми собеседников и может отмечать перекрывающуюся речь.
Результаты и ограничения
На тестах VoiceArena Diarization Benchmark v1 модель показала долю ошибок 14,72% против 19,3% у следующей системы. В восьми тестовых сценариях при буфере 1,04 секунды её средняя доля ошибок была на 41% ниже, чем у предшественницы Streaming Sortformer.
Записи и живое аудио
Модель работает как с готовыми записями, так и с потоком аудио. В сочетании с системой распознавания речи, например Parakeet, она позволяет получить расшифровку с анонимными метками вроде «speaker_2». Это помогает разделить реплики, но само по себе не устанавливает личности говорящих.