Vai al contenuto

Analisi del Production Index Vercel di settembre 2026: quota token open-weight, riduzione del costo medio, limiti metodologici e checklist per valutare il routing multi-modello.

L’ANALISI

Open-weight al 56% dei token su Vercel: cosa misura davvero il dato

Analisi del Production Index Vercel di settembre 2026: quota token open-weight, riduzione del costo medio, limiti metodologici e checklist per valutare il routing multi-modello.

3 min di letturaFatti, limiti e fonti primarie
Grafica ufficiale Vercel del Production Index AI Gateway di settembre 2026
Il grafico ufficiale del Production Index Vercel di settembre 2026 visualizza il cambio nel mix dei modelli sul gateway.

In breve: Nel perimetro di Vercel AI Gateway, i modelli open-weight hanno elaborato il 56% dei token di agosto 2026, prima maggioranza nella serie pubblicata. Il dato indica uno spostamento reale dei workload su quella piattaforma, ma non prova che gli open-weight dominino l’intero mercato: misura traffico aggregato Vercel, usa una classificazione aggiornata e stima la spesa dai listini.

Che cosa cambia nei dati di agosto

Vercel dichiara che la quota open-weight è salita dal 7% dei token a dicembre 2025 al 56% in agosto 2026. È la prima volta in cui questa famiglia supera sul gateway il volume combinato dei modelli closed-weight. La quota di spesa resta invece concentrata sui modelli frontier, segnale che volume e valore economico non coincidono.

Costo per token e selezione del modello

Il report stima una riduzione del 23,2% del prezzo medio per token in agosto, terzo calo mensile consecutivo. Tra i team sopra dieci milioni di token in entrambi i mesi, la mediana del costo per token scende del 7,6%. L’interpretazione pratica è usare modelli meno costosi sui task ordinari e riservare quelli premium ai casi che ne giustificano il prezzo.

Un riscontro operativo separato

AT&T descrive un gateway proprietario che valuta a ogni turno velocità, costo e qualità attesa, con routing sensibile alla cache e possibilità di cambiare modello durante una conversazione. L’azienda dichiara risparmi fino al 90% su 45 miliardi di token al giorno. È un caso aziendale dichiarato, non una validazione indipendente del campione Vercel, ma mostra la stessa logica di segmentazione dei workload.

Cosa non dimostra il 56%

Il campione include soltanto applicazioni che passano da Vercel AI Gateway. Token volume somma input, output, reasoning, cache input e cache creation; la spesa è calcolata dai prezzi pubblici e può divergere dalle fatture reali. Inoltre Vercel avverte che la propria definizione open-weight è stata ampliata e che i dati storici possono essere ricalcolati.

Condizioni e limiti

Prima di trasferire il dato a un’architettura propria servono distribuzione dei task, requisiti di qualità, latenza, residenza dei dati e costi reali. Open-weight non significa automaticamente locale o self-hosted: sul gateway l’inferenza può restare erogata da provider cloud. Le percentuali descrivono adozione sulla piattaforma, non prestazioni assolute dei singoli modelli.

Checklist per testare il routing

  • Classificare i workload per rischio, complessità, latenza e sensibilità dei dati.
  • Misurare qualità e tasso di escalation su un set rappresentativo prima di cambiare modello.
  • Separare costo di input, output, reasoning e cache invece di usare un’unica media.
  • Verificare dove gira realmente l’inferenza: open-weight, API cloud e locale sono confini diversi.
  • Definire un modello di fallback per i task che non superano le soglie di qualità.
  • Registrare versione del modello, provider, prezzo e regole di routing per ogni prova.
  • Confrontare il costo totale, inclusi gateway, osservabilità, cache e gestione operativa.
  • Rieseguire il test quando cambiano listini, quantizzazioni o composizione dei task.

Fonti primarie

Radar AI · a cura di Francesco Gruner

Chiedi al sito.

Assistente OpenAI

Le domande vengono inviate a OpenAI. Non inserire dati personali o riservati. Privacy.

Verifica le risposte nelle fonti. 16 messaggi al giorno per rete.

Cosa cerchi? Ti indico le pagine utili.