Aggiornato il 23 settembre 2026. Analisi di documentazione e risultati pubblicati dai produttori: non ho ancora eseguito un benchmark testa a testa.
Se stai usando Opus 5 in un agente, Opus 5.5 non è soltanto un modello più economico da selezionare nel menu. La tariffa base passa da 5 a 4 dollari per milione di token in input e da 25 a 20 in output. Ma il valore reale dipende dai token di ragionamento, dalla cache, dai tentativi necessari per concludere un task e da alcune incompatibilità dell’API. Il confronto sensato è costo per task riuscito, non soltanto prezzo per milione di token. Anthropic, scheda modello · Anthropic, annuncio
Visual di lancio pubblicato da Anthropic. Non è una schermata di benchmark né un test indipendente.
Prezzi, cache e limiti: i numeri verificati
Opus 5.5 usa l’ID API claude-opus-5-5. La finestra di contesto è di un milione di token e l’output massimo della Messages API è di 128.000 token; il batch può arrivare a 300.000 token con un header beta specifico. Accetta testo e immagini in input e produce testo. Il listino API Anthropic indica $4 input e $20 output per milione di token, $5 per la scrittura cache di 5 minuti, $8 per quella di un’ora e $0,20 per la lettura cache. Il batch sconta input e output del 50%. Sono prezzi base in dollari, prima di eventuali costi del tuo provider e senza confonderli con i limiti di abbonamento dell’app Claude. Specifiche ufficiali
Per confronto, Opus 5 era a $5/$25 per milione di token input/output; Fable 5.1 è a $10/$50; Sonnet 5 a $2/$10. Opus 5.5 riduce il listino rispetto a Opus 5 del 20%, mentre il 40% in meno su workload tipici è una stima di Anthropic sul costo d’esecuzione, non un ulteriore sconto fisso in fattura. L’azienda dichiara inoltre output oltre il 30% più veloce rispetto a Opus 5: non è una misura della latenza nel tuo stack. Annuncio Anthropic · Schede dei modelli
Per stimare una migrazione, salva per ogni esecuzione i token input non in cache, i cache read/write, i token output inclusi quelli di ragionamento, le chiamate ai tool, il tempo e il risultato verificato. Applica poi il listino di ciascun modello alle rispettive quantità: il prezzo unitario da solo non dice quanti tentativi serviranno. Non ho ancora un log comparabile di questi due modelli su uno stesso repository, quindi non pubblico una percentuale di risparmio «reale» come se l’avessi misurata.
Cosa cambia davvero in un’integrazione
Il thinking adattivo di Opus 5.5 è sempre attivo e non può essere disabilitato. L’effort predefinito è medium, mentre su Opus 5 era high: confrontare due chiamate senza fissarlo esplicitamente cambia le condizioni del test. A uno stesso effort, Anthropic segnala che 5.5 può usare più ragionamento per turno, soprattutto ai livelli alti. Lascia quindi spazio sufficiente in max_tokens, misura il consumo e rifai la tua sweep di effort. Novità e differenze
C’è poi una vera incompatibilità: il forced tool use con tool_choice any o un tool nominato non è supportato; usa auto ed eventualmente strict tool use o structured outputs se ti serve uno schema valido. I blocchi di thinking sono legati al modello e alla conversazione: non riscriverli mentre fai passare una sessione fra modelli. Su Claude API e Google Cloud, il vecchio tool computer_20251124 non è accettato: occorre il toolset computer_toolset_20260801. Anche il testo fra chiamate ai tool può arrivare nei blocchi thinking anziché nei normali blocchi testuali, lasciando vuota un’interfaccia che lo mostrava come avanzamento. Sono casi da provare in staging con la tua implementazione, non da scoprire su un agente in produzione. Guida alla migrazione · What’s new
È migliore di GPT-6 Sol?
Non c’è un vincitore dimostrato dai soli annunci. GPT-6 Sol costa $2/$10 per milione di token input/output nella sua API, la metà del listino base di Opus 5.5, e offre 1.050.000 token di contesto, con massimo 922.000 token di input e 128.000 di output. Oltre 272.000 token di input OpenAI applica alla richiesta intera il doppio della tariffa input/cache e 1,5 volte quella output; anche questo incide sul costo di un task lungo. Le due API hanno semantiche di tool, caching ed effort diverse. Una tabella di benchmark dei produttori con harness o budget differenti non è una prova che uno completi meglio il tuo lavoro. Scheda OpenAI di Sol · Scheda Anthropic di Opus
Se il tuo collo di bottiglia è il prezzo, prova anche Sonnet 5 o GPT-6 Luna sui task semplici prima di scegliere il modello di punta per tutto. Se invece il lavoro è una migrazione lunga o una review complessa, metti Opus 5.5 e Sol sullo stesso repository, con identici permessi, test e criteri di accettazione. Ripeti i task e registra successi, correzioni umane, latenza e costo totale. Il verdetto va dato dopo, non prima.
Il mio criterio di adozione
Aggiornerei un agente Opus 5 solo dopo un test di regressione dei tool, dei blocchi di risposta e del consumo con effort fissato. Terrei un fallback e un limite di spesa per task. Non darei autonomia irreversibile solo perché un audit di sicurezza del produttore migliora: la verifica dello stato reale dopo una modifica resta necessaria. L’articolo su Opus 5 fornisce il riferimento precedente; per il quadro dei modelli OpenAI e del computer use, vedi GPT-6 Astra.
Domande frequenti e fonti
Opus 5.5 costa il 40% in meno di Opus 5?
Non come listino per token: l’input e l’output scendono del 20%. Il 40% è il risparmio dichiarato da Anthropic per workload tipici, che va verificato sulla tua distribuzione di prompt, cache ed effort.
Posso sostituire l’ID del modello senza toccare il codice?
Non darlo per scontato se forzi tool, disabiliti thinking, usi il vecchio computer tool o presenti come testo i progress update tra tool call. Prova il percorso completo in staging.
Un milione di token significa che il modello leggerà perfettamente ogni documento?
No: è la capacità massima della finestra, non una garanzia di recupero accurato o di economicità. Misura richiamo, costo e latenza sui tuoi documenti.
Quando usare Sonnet 5 anziché Opus 5.5?
Se la qualità richiesta si mantiene nel tuo set di valutazione, Sonnet 5 parte da un listino base inferiore. La scelta va fatta per task riuscito, non per nome della famiglia.
Fonti verificate
Schede dei produttori; i benchmark citati non sono prove indipendenti.










