L’ANALISI
MAI-Transcribe-2 porta diarizzazione e timestamp in 60 lingue
Microsoft AI ha reso disponibile in anteprima pubblica MAI-Transcribe-2, un modello speech-to-text con diarizzazione, timestamp a livello di parola e copertura dichiarata di 60 lingue.
Risposta diretta: MAI-Transcribe-2 è un aggiornamento concreto per pipeline vocali e archivi audio: aggiunge struttura al testo, amplia le lingue e parte da 0,10 dollari per ora. Il prezzo è promozionale fino a fine 2026 e accuratezza e velocità derivano soprattutto dai test pubblicati da Microsoft.
Che cosa cambia nella trascrizione
Il modello restituisce segmenti attribuiti ai parlanti e timestamp di inizio e fine per ogni parola. Questi dati permettono ricerca puntuale nell’audio, sottotitoli sincronizzati, redazione di passaggi e revisione delle conversazioni.
Copertura linguistica e stili
Microsoft dichiara supporto per 60 lingue, identificazione della lingua, code switching, keyword biasing e output pulito oppure verbatim. La copertura nominale non garantisce la stessa qualità per ogni lingua o dominio.
Il benchmark da leggere correttamente
Nel confronto FLEURS pubblicato da Microsoft, MAI-Transcribe-2 ottiene un Word Error Rate medio del 5,2%. L’azienda lo colloca inoltre al secondo posto nella classifica WER di Artificial Analysis e sulla frontiera tra accuratezza e latenza.
Prezzo e disponibilità
Il modello è disponibile in anteprima pubblica tramite Microsoft Foundry e Azure Speech, oltre al playground indicato da Microsoft. Il prezzo iniziale di 0,10 dollari per ora vale come offerta limitata fino al 31 dicembre 2026.
Dove può essere utile
Diarizzazione e timestamp sono utili per riunioni, interviste, contact center, sottotitoli e archivi ricercabili. Nei flussi regolati servono comunque controlli umani, politiche di conservazione e verifica del trattamento dei dati audio.
Condizioni e limiti
Le affermazioni comparative arrivano dal produttore. Prima della produzione vanno misurati errori per lingua, accento, sovrapposizione delle voci, rumore, nomi propri e lessico tecnico; l’anteprima pubblica non equivale a una disponibilità generale con SLA.
Checklist pratica
- Preparare un campione audio rappresentativo per lingua, accento e rumore.
- Misurare WER e correttezza della diarizzazione separatamente.
- Verificare timestamp, nomi propri, sigle e lessico di dominio.
- Controllare regione, termini dell’anteprima, conservazione e trattamento dei dati.
- Ricalcolare il costo oltre la promozione e mantenere una procedura di revisione umana.
