Vai al contenuto

Analisi della pre-release llama.cpp b11243: migrazione a oneAPI 2026.1, benchmark Arc B570, limiti della misura e checklist per replicarla.

L’ANALISI

llama.cpp b11243: cosa cambia con oneAPI 2026.1 sulle GPU Intel Arc

Analisi della pre-release llama.cpp b11243: migrazione a oneAPI 2026.1, benchmark Arc B570, limiti della misura e checklist per replicarla.

3 min di letturaFatti, limiti e fonti primarie
Pagina della release llama.cpp b11243 con note oneAPI 2026.1 e benchmark Intel Arc B570
Release ufficiale llama.cpp b11243 con aggiornamento a oneAPI 2026.1 e benchmark dichiarato su Intel Arc B570.

In breve: Il delta pratico è nelle build SYCL per GPU Intel: llama.cpp b11243 usa il nuovo toolkit unificato oneAPI 2026.1, conserva oneDNN e aggiorna Level Zero. Il maintainer misura 1331 token al secondo di prompt processing contro 434 con la build basata su oneAPI 2025.3, ma il dato resta un test singolo da replicare prima di attribuire un vantaggio generale al backend.

Che cosa cambia nella toolchain Intel

La release sposta CI, pacchetti e documentazione SYCL dal percorso Deep Learning Essentials al toolkit unificato oneAPI 2026.1. Il motivo è operativo: da oneAPI 2026.0 il vecchio pacchetto non include più oneDNN, quindi un semplice incremento di versione avrebbe potuto produrre build prive di quel componente.

Il benchmark pubblicato

Il confronto usa lo stesso codice llama.cpp b10899 compilato con oneAPI 2026.1 e con la build di rilascio basata su 2025.3 su una Intel Arc B570. La nota riporta 1331 contro 434 token al secondo nel prompt processing e 50,1 contro 45,3-48,0 nella generazione.

Perché prompt e generazione reagiscono diversamente

Il prompt processing sfrutta parallelismo e moltiplicazioni matriciali in modo diverso dalla generazione token per token. Un cambiamento nelle librerie e nel backend può quindi produrre un salto molto più evidente nella fase di ingestione del contesto, mentre il decode resta vicino al valore precedente.

Che cosa si può scaricare oggi

La pre-release include pacchetti Linux SYCL FP32 e FP16 e un pacchetto Windows x64 SYCL, insieme alle altre build ufficiali. La pipeline aggiorna inoltre Level Zero SDK a 1.33.1 e adegua librerie e nomi dei pacchetti per Linux e Windows.

Condizioni e limiti

Il dato è del maintainer, su una singola Arc B570, e la release non espone nel riepilogo modello, quantizzazione, dimensione del prompt, driver e comandi completi. b11243 è marcata pre-release: serve una replica controllata e conviene conservare la build precedente per il confronto e il rollback.

Checklist di replica

  • Registrare GPU, driver, sistema operativo e versione esatta di llama.cpp.
  • Conservare una build oneAPI 2025.3 e compilare lo stesso commit con oneAPI 2026.1.
  • Usare identici modello, quantizzazione, prompt, context size e batch size.
  • Separare prompt processing e token generation nei risultati.
  • Eseguire warm-up e più ripetizioni, riportando mediana e dispersione.
  • Controllare nei log che oneDNN e il dispositivo SYCL atteso siano realmente attivi.
  • Misurare anche VRAM, RAM, consumo e stabilità oltre ai token al secondo.
  • Provare il pacchetto b11243 in staging prima di sostituire una build stabile.

Fonti primarie

Radar AI · a cura di Francesco Gruner

Chiedi al sito.

Assistente OpenAI

Le domande vengono inviate a OpenAI. Non inserire dati personali o riservati. Privacy.

Verifica le risposte nelle fonti. 16 messaggi al giorno per rete.

Cosa cerchi? Ti indico le pagine utili.