L’ANALISI
Ollaya 0.5: modelli decisionali locali con app desktop e API TypeSafe
Ollaya 0.5 esegue classificazione e decisioni tipizzate in locale con modelli aperti. Architettura, compatibilità, confini hardware e checklist di prova.

In breve: Ollaya non è un chatbot locale: esegue modelli specializzati che restituiscono scelte, punteggi e probabilità in un solo forward pass. La versione 0.5 rende il runtime più accessibile con app desktop e Windows, mantenendo CLI, Docker, API locali e compatibilità con il formato TypeSafe. È interessante per routing e triage privati, ma prestazioni e calibrazione vanno misurate sui propri dati.
Che cosa sono i modelli decisionali
A differenza di un modello generativo, un decision model legge uno stato, per esempio un ticket o un messaggio, e risponde a domande tipizzate come scelta, sì o no e punteggio. Ollaya serve questi modelli attraverso un demone locale e restituisce probabilità calibrate, senza generare testo token per token.
Che cosa aggiunge la versione 0.5
La release del 25 settembre introduce l’app desktop e il supporto Windows. Gli asset ufficiali includono binari per macOS Apple silicon, Linux x86-64 e ARM64, pacchetti deb, rpm e AppImage, installer Windows e immagini Docker, comprese varianti CUDA per Linux.
Compatibilità e integrazione
Il server espone endpoint nativi e le rotte TypeSafe /v1/systemone, /v1/decisions e /v1/models. Il progetto dichiara che il relativo SDK può puntare al server locale cambiando la base URL. Un server MCP permette inoltre di usare le decisioni tipizzate da client agentici compatibili.
Pesi, licenze e catena di fornitura
Il runtime è Apache 2.0. I pesi restano nei repository Hugging Face degli autori e sono associati a commit e hash dichiarati dal progetto; Ollaya pubblica piccoli grafi ONNX derivati. Ogni modello conserva però la propria licenza, quindi runtime aperto e diritto d’uso dei singoli pesi vanno verificati separatamente.
Hardware, privacy e limiti
Il server ascolta su 127.0.0.1 per impostazione predefinita e può funzionare su CPU o GPU NVIDIA. La località dipende comunque dalla configurazione effettiva, dai download iniziali e da eventuali client collegati. I dati non vanno considerati automaticamente protetti senza controllare binding di rete, log, telemetria, permessi e provenienza dei modelli.
Checklist per una prova riproducibile
- Installare la release 0.5 da un asset ufficiale e verificare checksum, piattaforma e licenza.
- Avviare il server solo su localhost e controllare porte, log e processi attivi.
- Provare prima un modello piccolo con un set di ticket anonimizzati e classi già etichettate.
- Misurare latenza p50 e p95, accuratezza, calibrazione e tasso di astensione sul proprio hardware.
- Confrontare CPU e, se disponibile, CUDA senza riutilizzare risultati dichiarati dal fornitore.
- Verificare che l’SDK TypeSafe mantenga schema, errori e soglie attese.
- Provare il server MCP con permessi minimi e senza dati sensibili.
- Registrare commit dei pesi, hash, modello, precisione e configurazione per rendere il test ripetibile.