Vai al contenuto

Alibaba rende disponibile via Model Studio un modello nativamente multimodale con input testo, immagini, audio e video, output testuale, tool calling, ricerca web e contesto fino a un milione di token.

L’ANALISI

Qwen3.8-Omni-Flash: input multimodale, strumenti e contesto da 1M

Alibaba rende disponibile via Model Studio un modello nativamente multimodale con input testo, immagini, audio e video, output testuale, tool calling, ricerca web e contesto fino a un milione di token.

1 min di letturaFatti, limiti e fonti primarie
Qwen3.8-Omni-Flash analizza testo, immagini, audio e video fino a 1M token
Schermata o grafica ufficiale collegata alla fonte primaria: annuncio Qwen3.8-Omni-Flash.

In breve: La novità è riunire più modalità e strumenti in un solo endpoint, con una finestra molto ampia. Questo abilita analisi di video, audio multicanale e documenti senza pipeline separate, ma resta un servizio cloud.

Modalità e output

Accetta testo, immagini, audio e video; restituisce testo e può usare strumenti personalizzati.

Contesto e ragionamento

La documentazione indica 1M token di contesto, output fino a 131.072 token e sforzo di ragionamento regolabile.

Audio e regioni

Supporta 113 lingue e dialetti e audio spaziale multicanale; è disponibile in più regioni Model Studio.

Condizioni e limiti

Contesto massimo non garantisce qualità uniforme; costi multimodali, caching e latenza dipendono dalla regione e dal formato.

Checklist pratica

  • Scegliere la regione prima di creare la chiave.
  • Provare clip con trascrizione verificabile.
  • Misurare token, latenza e costo reale.
  • Disattivare dati sensibili finché retention e log non sono chiari.

Fonti primarie

Radar AI · a cura di Francesco Gruner

Chiedi al sito.

Assistente OpenAI

Le domande vengono inviate a OpenAI. Non inserire dati personali o riservati. Privacy.

Verifica le risposte nelle fonti. 16 messaggi al giorno per rete.

Cosa cerchi? Ti indico le pagine utili.