L’ANALISI
Open-weight al 56% dei token su Vercel: cosa misura davvero il dato
Analisi del Production Index Vercel di settembre 2026: quota token open-weight, riduzione del costo medio, limiti metodologici e checklist per valutare il routing multi-modello.

In breve: Nel perimetro di Vercel AI Gateway, i modelli open-weight hanno elaborato il 56% dei token di agosto 2026, prima maggioranza nella serie pubblicata. Il dato indica uno spostamento reale dei workload su quella piattaforma, ma non prova che gli open-weight dominino l’intero mercato: misura traffico aggregato Vercel, usa una classificazione aggiornata e stima la spesa dai listini.
Che cosa cambia nei dati di agosto
Vercel dichiara che la quota open-weight è salita dal 7% dei token a dicembre 2025 al 56% in agosto 2026. È la prima volta in cui questa famiglia supera sul gateway il volume combinato dei modelli closed-weight. La quota di spesa resta invece concentrata sui modelli frontier, segnale che volume e valore economico non coincidono.
Costo per token e selezione del modello
Il report stima una riduzione del 23,2% del prezzo medio per token in agosto, terzo calo mensile consecutivo. Tra i team sopra dieci milioni di token in entrambi i mesi, la mediana del costo per token scende del 7,6%. L’interpretazione pratica è usare modelli meno costosi sui task ordinari e riservare quelli premium ai casi che ne giustificano il prezzo.
Un riscontro operativo separato
AT&T descrive un gateway proprietario che valuta a ogni turno velocità, costo e qualità attesa, con routing sensibile alla cache e possibilità di cambiare modello durante una conversazione. L’azienda dichiara risparmi fino al 90% su 45 miliardi di token al giorno. È un caso aziendale dichiarato, non una validazione indipendente del campione Vercel, ma mostra la stessa logica di segmentazione dei workload.
Cosa non dimostra il 56%
Il campione include soltanto applicazioni che passano da Vercel AI Gateway. Token volume somma input, output, reasoning, cache input e cache creation; la spesa è calcolata dai prezzi pubblici e può divergere dalle fatture reali. Inoltre Vercel avverte che la propria definizione open-weight è stata ampliata e che i dati storici possono essere ricalcolati.
Condizioni e limiti
Prima di trasferire il dato a un’architettura propria servono distribuzione dei task, requisiti di qualità, latenza, residenza dei dati e costi reali. Open-weight non significa automaticamente locale o self-hosted: sul gateway l’inferenza può restare erogata da provider cloud. Le percentuali descrivono adozione sulla piattaforma, non prestazioni assolute dei singoli modelli.
Checklist per testare il routing
- Classificare i workload per rischio, complessità, latenza e sensibilità dei dati.
- Misurare qualità e tasso di escalation su un set rappresentativo prima di cambiare modello.
- Separare costo di input, output, reasoning e cache invece di usare un’unica media.
- Verificare dove gira realmente l’inferenza: open-weight, API cloud e locale sono confini diversi.
- Definire un modello di fallback per i task che non superano le soglie di qualità.
- Registrare versione del modello, provider, prezzo e regole di routing per ogni prova.
- Confrontare il costo totale, inclusi gateway, osservabilità, cache e gestione operativa.
- Rieseguire il test quando cambiano listini, quantizzazioni o composizione dei task.