Mistral AI presenta Voxtral, una suite innovativa di modelli open source di comprensione vocale progettati per trasformare l'interazione uomo-macchina attraverso la voce. Considerando la voce come l'interfaccia originaria dell'umanità, Voxtral mira a superare i limiti dei sistemi attuali, siano essi inaffidabili o proprietari, offrendo strumenti vocali robusti, multilingui e profondamente intelligenti. I modelli sono disponibili in due versioni: una variante da 24B pensata per applicazioni su scala di produzione, e una variante più compatta da 3B, Voxtral Mini, adatta a deployment locali ed edge. Entrambe sono rilasciate con licenza permissiva Apache 2.0 e accessibili tramite l'API di Mistral AI, con Voxtral Mini Transcribe, ottimizzato per la trascrizione, che offre un'efficienza costo/latenza senza pari.

Architettura a due livelli e vantaggio di costo

Voxtral si distingue colmando il divario tra i sistemi ASR open source con tassi di errore elevati e le costose API proprietarie. Offre accuratezza allo stato dell'arte e comprensione semantica nativa all'interno di un framework aperto, a meno della metà del prezzo delle soluzioni proprietarie comparabili. Questa efficienza di costo rende l'intelligenza vocale di alta qualità accessibile e controllabile su larga scala per un'ampia gamma di applicazioni.

Capacità avanzate oltre la trascrizione

I modelli offrono diverse capacità avanzate oltre la semplice trascrizione. Supportano contesti audio lunghi, fino a 30 minuti per la trascrizione e 40 minuti per la comprensione, consentendo l'elaborazione completa di conversazioni o registrazioni estese. Una caratteristica distintiva: Q&A e riassunto integrati, che permettono di interrogare direttamente il contenuto audio o generare riassunti strutturati senza concatenare modelli ASR e linguistici separati. Voxtral è nativamente multilingue, con rilevamento automatico della lingua e prestazioni allo stato dell'arte su numerose lingue ampiamente utilizzate: inglese, spagnolo, francese, portoghese, hindi, tedesco, olandese, italiano. Consente inoltre il function-calling direttamente dalla voce, traducendo le intenzioni vocali degli utenti in comandi di sistema azionabili. I modelli mantengono le solide capacità di comprensione testuale del loro modello di base, il modello linguistico Mistral Small 3.1.

Benchmark competitivi

I risultati dei benchmark evidenziano le prestazioni superiori di Voxtral. Supera complessivamente Whisper large-v3, il modello open source di trascrizione di riferimento, e supera GPT-4o mini Transcribe e Gemini 2.5 Flash su vari task. Voxtral Small raggiunge risultati allo stato dell'arte su short-form inglese e Mozilla Common Voice, dimostrando solide capacità multilingui, e eguaglia ElevenLabs Scribe per casi d'uso premium a un costo significativamente ridotto. Voxtral Mini Transcribe supera OpenAI Whisper a meno della metà del prezzo.

Roadmap e visione

Mistral AI prevede di introdurre diarizzazione dei parlanti, annotazioni audio (età, emozione), timestamp a livello di parola e riconoscimento di audio non vocale. L'azienda sta ampliando il proprio team audio e incoraggia gli sviluppatori a integrare Voxtral tramite download locale su Hugging Face, tramite l'API, o provandolo nella modalità vocale di Le Chat, con funzionalità enterprise avanzate: deployment privato, fine-tuning specifico per dominio e supporto di integrazione dedicato.