L’ANALISI
Nemotron 3 Diarization: otto speaker, streaming e limiti da testare
NVIDIA rilascia un modello open-weight da 100M parametri per diarizzazione live e offline fino a otto speaker. Requisiti, latenza, benchmark e checklist pratica.

In breve: Il cambiamento concreto è un checkpoint scaricabile che usa un solo modello per diarizzazione offline e streaming, gestisce fino a otto speaker e conserva le identità tra blocchi audio. È pronto per test commerciali e non commerciali, ma precisione e latenza dichiarate vanno riprodotte su registrazioni, accenti e hardware propri.
Cosa si può scaricare ed eseguire
Il checkpoint nvidia/Nemotron-3-Diarization è disponibile su Hugging Face e si carica con SortformerEncLabelModel di NeMo Speech. La scheda lo dichiara utilizzabile in ambito commerciale e non commerciale e fornisce un esempio che restituisce segmenti con inizio, fine e indice dello speaker.
Streaming e memoria degli speaker
Il modello ordina i canali in base alla prima comparsa delle voci. In streaming usa una cache degli speaker e una coda FIFO per mantenere le identità tra blocchi. La stessa rete copre audio live e offline, con buffer configurabile e inferenza chunked per registrazioni lunghe.
Latenza, speaker e requisiti
La scheda dichiara buffer fino a 80 ms, ma raccomanda almeno 0,32 secondi; la configurazione simile all’offline usa 30,4 secondi. Sono supportati fino a otto speaker e parlato sovrapposto. Servono Python 3.12 o successivo, Cython, PyTorch recente, NeMo Speech, ffmpeg e libsndfile.
Come leggere il benchmark
NVIDIA riporta 14,72% di Diarization Error Rate e il primo posto nel leaderboard iniziale VoiceArena. DER più basso è migliore, ma il valore aggregato non sostituisce prove su microfoni, riverbero, lingue, turni brevi e numero reale di partecipanti. La qualità del testo richiede inoltre un sistema ASR separato.
Checklist di prova
- Scaricare il checkpoint dalla pagina ufficiale e registrare revisione, licenza e hash locale.
- Preparare audio con uno, quattro e otto speaker, includendo sovrapposizioni e silenzi lunghi.
- Confrontare modalità offline e streaming con gli stessi file e la stessa metrica DER.
- Provare almeno il buffer raccomandato di 0,32 secondi prima della configurazione minima da 80 ms.
- Misurare latenza reale, memoria e throughput sull’hardware di destinazione.
- Separare errori di diarizzazione dagli errori dell’eventuale ASR abbinato.
- Controllare manualmente impegni, obiezioni e interruzioni prima di usare i risultati in automazioni.