Vai al contenuto

Analisi di Holo4 27B e 35B-A3B: formati disponibili, licenze differenti, benchmark dichiarati, requisiti pratici e checklist per un test locale riproducibile.

L’ANALISI

Holo4 porta GUI, codice e tool in due modelli con pesi scaricabili

Analisi di Holo4 27B e 35B-A3B: formati disponibili, licenze differenti, benchmark dichiarati, requisiti pratici e checklist per un test locale riproducibile.

3 min di letturaFatti, limiti e fonti primarie
Tabella ufficiale dei benchmark Holo4 per computer use, automazione e tool
La tabella ufficiale Holo4 confronta risultati e costi dichiarati sui benchmark di computer use, automazione e uso di tool.

In breve: Holo4 è una famiglia di modelli agentici visuali che può alternare clic, codice, MCP e API. Il rilascio include pesi in più formati, un harness, API e traiettorie dei benchmark. Prima dell’uso servono però un controllo della licenza, una misura di memoria e velocità sul proprio hardware e test isolati su task GUI reali.

Che cosa viene rilasciato

La famiglia comprende Holo4 27B dense e Holo4 35B-A3B, un MoE da 35 miliardi di parametri totali e 3 miliardi attivi. H Company pubblica BF16, FP8, NVFP4 e GGUF Q4, oltre a un servizio API e alle traiettorie usate per i risultati dichiarati.

Un solo modello per più interfacce

Il modello riceve screenshot e risultati dei tool, poi richiede clic, digitazione, esecuzione di codice o chiamate funzione. L’obiettivo è evitare un agente separato per desktop, web, Android e API. Questa flessibilità aumenta però il perimetro operativo e rende indispensabili sandbox, permessi ed egress controllato.

Licenze e confini diversi

Il checkpoint 35B-A3B è pubblicato con Apache 2.0, mentre il 27B è CC BY-NC 4.0 e quindi non è equivalente per un uso commerciale. Pesi aperti non significano runtime interamente locale: harness, servizi collegati ed eventuale API hosted restano componenti distinti.

Come leggere benchmark e costi

H Company dichiara per il 27B 85,2% su OSWorld a 0,08 dollari per task e pubblica le traiettorie. Sul più lungo OSWorld 2.0 dichiara 61,7% a 1,22 dollari. Sono risultati del produttore, con harness e numero di run specifici; alcuni confronti frontier provengono da esecuzioni e livelli di effort differenti.

Condizioni e limiti

Non è stato eseguito un test end-to-end su hardware locale. Il contesto massimo configurato di 262.144 token non dimostra che una quantizzazione Q4 sia pratica su ogni GPU, né che mantenga i risultati BF16. Le traiettorie aumentano l’ispezionabilità, ma non sostituiscono una replica indipendente.

Checklist per provarlo

  • Scegliere 27B o 35B-A3B dopo avere verificato la licenza applicabile.
  • Registrare hash del checkpoint, formato e quantizzazione.
  • Misurare memoria a riposo, picco, token al secondo e tempo per task.
  • Eseguire l’harness in una sandbox senza credenziali di produzione.
  • Limitare filesystem, rete, applicazioni e tool disponibili.
  • Preparare task ripetibili per GUI, codice, MCP e API.
  • Confrontare successo, passaggi, errori e costo con una baseline.
  • Ispezionare traiettorie e conservare log e screenshot per la replica.

Fonti primarie

Radar AI · a cura di Francesco Gruner

Chiedi al sito.

Assistente OpenAI

Le domande vengono inviate a OpenAI. Non inserire dati personali o riservati. Privacy.

Verifica le risposte nelle fonti. 16 messaggi al giorno per rete.

Cosa cerchi? Ti indico le pagine utili.