L’ANALISI
Whistle: cosa offre davvero l’ASR locale da 16,9 MB
Architettura, limiti e checklist pratica per provare Whistle, il modello ASR locale da 16,9 MB che gira su CPU.

In breve: Whistle rende scaricabile un ASR compatto che gira localmente su CPU e restituisce testo, timestamp parola per parola ed embedding vocali. È adatto a prove su telefoni, wearable e piccoli dispositivi, ma i risultati pubblicati sono del produttore e vanno verificati sul proprio hardware, soprattutto con rumore, accenti e clip vicine al limite di 30 secondi.
Il delta verificato
Cactus ha pubblicato Whistle come file modello da 16,9 MB eseguibile sulla propria runtime C++ per CPU. La pagina ufficiale include una demo nel browser e descrive trascrizione, timestamp parola per parola ed embedding vocali.
Che cosa si può eseguire
Il modello accetta audio mono a 16 kHz, elabora fino a 30 secondi per passaggio e riconosce sette lingue. Può rilevare automaticamente la lingua oppure riceverla come parametro. L’output comprende probabilità e intervalli temporali per ogni parola.
Perché è rilevante in locale
Un singolo file compatto e una runtime senza dipendenze riducono l’attrito su telefoni, wearable, robot e microcontrollori più capaci. L’audio può restare sul dispositivo, evitando per quel flusso l’invio obbligatorio a un servizio cloud.
Architettura e prestazioni dichiarate
La descrizione tecnica indica un encoder a otto blocchi e un decoder a otto blocchi con cross-attention. Cactus dichiara il primo token in 11 ms, ma questa misura dipende dall’hardware e non sostituisce un benchmark riproducibile sul dispositivo destinazione.
Condizioni e limiti
La durata massima dichiarata è 30 secondi per clip. Mancano nel materiale consultato prove indipendenti su rumore, accenti, consumo, memoria e accuratezza comparata; il supporto linguistico è limitato alle sette lingue elencate.
Checklist per una prova controllata
- Verificare licenza, checksum e versione del file modello scaricato.
- Provare prima clip pulite in italiano con trascrizione nota.
- Ripetere con rumore, accenti, numeri e nomi propri.
- Misurare tempo al primo token, tempo totale, RAM e consumo sul dispositivo reale.
- Controllare timestamp e probabilità parola per parola, non solo il testo finale.
- Provare clip brevi e clip prossime al limite di 30 secondi.
- Confermare con il monitor di rete che l’audio non lasci il dispositivo.
- Gestire esplicitamente audio non supportato e lingua errata.
- Conservare un modello alternativo o un fallback per i casi critici.