Vai al contenuto

Architettura, limiti e checklist pratica per provare Whistle, il modello ASR locale da 16,9 MB che gira su CPU.

L’ANALISI

Whistle: cosa offre davvero l’ASR locale da 16,9 MB

Architettura, limiti e checklist pratica per provare Whistle, il modello ASR locale da 16,9 MB che gira su CPU.

2 min di letturaFatti, limiti e fonti primarie
Pagina ufficiale Whistle con demo del modello speech to text locale da 16,9 MB
La pagina ufficiale di Whistle mostra il modello ASR locale da 16,9 MB e la demo eseguita nel browser.

In breve: Whistle rende scaricabile un ASR compatto che gira localmente su CPU e restituisce testo, timestamp parola per parola ed embedding vocali. È adatto a prove su telefoni, wearable e piccoli dispositivi, ma i risultati pubblicati sono del produttore e vanno verificati sul proprio hardware, soprattutto con rumore, accenti e clip vicine al limite di 30 secondi.

Il delta verificato

Cactus ha pubblicato Whistle come file modello da 16,9 MB eseguibile sulla propria runtime C++ per CPU. La pagina ufficiale include una demo nel browser e descrive trascrizione, timestamp parola per parola ed embedding vocali.

Che cosa si può eseguire

Il modello accetta audio mono a 16 kHz, elabora fino a 30 secondi per passaggio e riconosce sette lingue. Può rilevare automaticamente la lingua oppure riceverla come parametro. L’output comprende probabilità e intervalli temporali per ogni parola.

Perché è rilevante in locale

Un singolo file compatto e una runtime senza dipendenze riducono l’attrito su telefoni, wearable, robot e microcontrollori più capaci. L’audio può restare sul dispositivo, evitando per quel flusso l’invio obbligatorio a un servizio cloud.

Architettura e prestazioni dichiarate

La descrizione tecnica indica un encoder a otto blocchi e un decoder a otto blocchi con cross-attention. Cactus dichiara il primo token in 11 ms, ma questa misura dipende dall’hardware e non sostituisce un benchmark riproducibile sul dispositivo destinazione.

Condizioni e limiti

La durata massima dichiarata è 30 secondi per clip. Mancano nel materiale consultato prove indipendenti su rumore, accenti, consumo, memoria e accuratezza comparata; il supporto linguistico è limitato alle sette lingue elencate.

Checklist per una prova controllata

  • Verificare licenza, checksum e versione del file modello scaricato.
  • Provare prima clip pulite in italiano con trascrizione nota.
  • Ripetere con rumore, accenti, numeri e nomi propri.
  • Misurare tempo al primo token, tempo totale, RAM e consumo sul dispositivo reale.
  • Controllare timestamp e probabilità parola per parola, non solo il testo finale.
  • Provare clip brevi e clip prossime al limite di 30 secondi.
  • Confermare con il monitor di rete che l’audio non lasci il dispositivo.
  • Gestire esplicitamente audio non supportato e lingua errata.
  • Conservare un modello alternativo o un fallback per i casi critici.

Fonti primarie

Radar AI · a cura di Francesco Gruner

Chiedi al sito.

Assistente OpenAI

Le domande vengono inviate a OpenAI. Non inserire dati personali o riservati. Privacy.

Verifica le risposte nelle fonti. 16 messaggi al giorno per rete.

Cosa cerchi? Ti indico le pagine utili.