L’ANALISI
Qwen3.8-Omni-Flash: input multimodale, strumenti e contesto da 1M
Alibaba rende disponibile via Model Studio un modello nativamente multimodale con input testo, immagini, audio e video, output testuale, tool calling, ricerca web e contesto fino a un milione di token.

In breve: La novità è riunire più modalità e strumenti in un solo endpoint, con una finestra molto ampia. Questo abilita analisi di video, audio multicanale e documenti senza pipeline separate, ma resta un servizio cloud.
Modalità e output
Accetta testo, immagini, audio e video; restituisce testo e può usare strumenti personalizzati.
Contesto e ragionamento
La documentazione indica 1M token di contesto, output fino a 131.072 token e sforzo di ragionamento regolabile.
Audio e regioni
Supporta 113 lingue e dialetti e audio spaziale multicanale; è disponibile in più regioni Model Studio.
Condizioni e limiti
Contesto massimo non garantisce qualità uniforme; costi multimodali, caching e latenza dipendono dalla regione e dal formato.
Checklist pratica
- Scegliere la regione prima di creare la chiave.
- Provare clip con trascrizione verificabile.
- Misurare token, latenza e costo reale.
- Disattivare dati sensibili finché retention e log non sono chiari.