Vai al contenuto

MAI-Transcribe-2: diarizzazione, timestamp, 60 lingue, prezzo promozionale e limiti da misurare prima di usarlo in produzione.

L’ANALISI

MAI-Transcribe-2 porta diarizzazione e timestamp in 60 lingue

Microsoft AI ha reso disponibile in anteprima pubblica MAI-Transcribe-2, un modello speech-to-text con diarizzazione, timestamp a livello di parola e copertura dichiarata di 60 lingue.

2 min di letturaFatti, limiti e fonti primarie
Visual ufficiale Microsoft AI con il testo Transcribe-2, speed, accuracy, efficiency
Microsoft AI, visual ufficiale di MAI-Transcribe-2 ↗

Risposta diretta: MAI-Transcribe-2 è un aggiornamento concreto per pipeline vocali e archivi audio: aggiunge struttura al testo, amplia le lingue e parte da 0,10 dollari per ora. Il prezzo è promozionale fino a fine 2026 e accuratezza e velocità derivano soprattutto dai test pubblicati da Microsoft.

Che cosa cambia nella trascrizione

Il modello restituisce segmenti attribuiti ai parlanti e timestamp di inizio e fine per ogni parola. Questi dati permettono ricerca puntuale nell’audio, sottotitoli sincronizzati, redazione di passaggi e revisione delle conversazioni.

Copertura linguistica e stili

Microsoft dichiara supporto per 60 lingue, identificazione della lingua, code switching, keyword biasing e output pulito oppure verbatim. La copertura nominale non garantisce la stessa qualità per ogni lingua o dominio.

Il benchmark da leggere correttamente

Nel confronto FLEURS pubblicato da Microsoft, MAI-Transcribe-2 ottiene un Word Error Rate medio del 5,2%. L’azienda lo colloca inoltre al secondo posto nella classifica WER di Artificial Analysis e sulla frontiera tra accuratezza e latenza.

Prezzo e disponibilità

Il modello è disponibile in anteprima pubblica tramite Microsoft Foundry e Azure Speech, oltre al playground indicato da Microsoft. Il prezzo iniziale di 0,10 dollari per ora vale come offerta limitata fino al 31 dicembre 2026.

Dove può essere utile

Diarizzazione e timestamp sono utili per riunioni, interviste, contact center, sottotitoli e archivi ricercabili. Nei flussi regolati servono comunque controlli umani, politiche di conservazione e verifica del trattamento dei dati audio.

Condizioni e limiti

Le affermazioni comparative arrivano dal produttore. Prima della produzione vanno misurati errori per lingua, accento, sovrapposizione delle voci, rumore, nomi propri e lessico tecnico; l’anteprima pubblica non equivale a una disponibilità generale con SLA.

Checklist pratica

  1. Preparare un campione audio rappresentativo per lingua, accento e rumore.
  2. Misurare WER e correttezza della diarizzazione separatamente.
  3. Verificare timestamp, nomi propri, sigle e lessico di dominio.
  4. Controllare regione, termini dell’anteprima, conservazione e trattamento dei dati.
  5. Ricalcolare il costo oltre la promozione e mantenere una procedura di revisione umana.

Fonti primarie

Documentazione ufficiale ↗
Radar AI · a cura di Francesco Gruner

Il sito, in una chat.

Servizi, guide e idee da approfondire

Sono l’assistente AI di questo sito. Ti aiuto a orientarti tra il lavoro di Francesco, il blog, Radar AI e i video, con i link alle fonti.

Risposte AI da verificare nelle fonti. 16 messaggi al giorno per rete.