NVIDIA представила открытую модель, способную распознавать, кто именно говорит и в какой момент времени.
28 Сентября 2026 года
NVIDIA представила Nemotron 3 Diarization — компактную модель для распознавания говорящих в аудиопотоке.
Всего около 100 миллионов параметров, и она уверенно справляется как с прямыми эфирами, так и с готовыми записями. Модель различает до восьми участников диалога и не теряет нить даже тогда, когда несколько голосов звучат одновременно.
Веса и инструкции по запуску Nemotron 3 Diarization опубликованы на Hugging Face по лицензии OpenMDW 1.1, и модель допускается использовать как в коммерческих, так и в некоммерческих проектах
