Mistral AI presenta Voxtral, una innovadora suite de modelos de comprensión del habla de código abierto diseñada para transformar la interacción humano-máquina mediante la voz. Considerando la voz como la interfaz original de la humanidad, Voxtral busca superar las limitaciones de los sistemas actuales, ya sean poco fiables o propietarios, ofreciendo herramientas de voz robustas, multilingües y profundamente inteligentes. Los modelos están disponibles en dos versiones: una variante de 24B diseñada para aplicaciones a escala de producción, y una variante más compacta de 3B, Voxtral Mini, adecuada para despliegues locales y en el borde (edge). Ambas se publican bajo la licencia permisiva Apache 2.0 y son accesibles a través de la API de Mistral AI, con Voxtral Mini Transcribe, optimizado para la transcripción, que ofrece una eficiencia de coste/latencia inigualable.
Arquitectura de dos niveles y ventaja de coste
Voxtral se distingue al cerrar la brecha entre los sistemas ASR de código abierto con altas tasas de error y las costosas API propietarias. Ofrece precisión de vanguardia y comprensión semántica nativa dentro de un marco abierto, a menos de la mitad del precio de las soluciones propietarias comparables. Esta eficiencia de coste hace que la inteligencia de voz de alta calidad sea accesible y controlable a escala para una amplia gama de aplicaciones.
Capacidades avanzadas más allá de la transcripción
Los modelos ofrecen varias capacidades avanzadas más allá de la simple transcripción. Admiten contextos de audio largos, hasta 30 minutos para transcripción y 40 minutos para comprensión, lo que permite el procesamiento completo de conversaciones o grabaciones extensas. Una característica destacada: preguntas y respuestas y resumen integrados, que permiten consultar directamente el contenido de audio o generar resúmenes estructurados sin encadenar modelos ASR y de lenguaje separados. Voxtral es nativamente multilingüe, con detección automática de idioma y rendimiento de vanguardia en numerosos idiomas ampliamente utilizados: inglés, español, francés, portugués, hindi, alemán, neerlandés, italiano. También permite la llamada a funciones directamente desde la voz, traduciendo las intenciones habladas de los usuarios en comandos de sistema accionables. Los modelos conservan las sólidas capacidades de comprensión de texto de su base, el modelo de lenguaje Mistral Small 3.1.
Puntos de referencia competitivos
Los resultados de los benchmarks confirman el rendimiento superior de Voxtral. Supera a Whisper large-v3 en general, el modelo de referencia de transcripción de código abierto, y supera a GPT-4o mini Transcribe y a Gemini 2.5 Flash en diversas tareas. Voxtral Small logra resultados de vanguardia en inglés de formato corto y en Mozilla Common Voice, demostrando sólidas capacidades multilingües, y iguala a ElevenLabs Scribe en casos de uso premium a un coste significativamente reducido. Voxtral Mini Transcribe supera a OpenAI Whisper a menos de la mitad del precio.
Hoja de ruta y visión
Mistral AI planea introducir diarización de hablantes, anotaciones de audio (edad, emoción), marcas de tiempo a nivel de palabra y reconocimiento de audio no hablado. La empresa está ampliando su equipo de audio y anima a los desarrolladores a integrar Voxtral mediante descarga local en Hugging Face, a través de la API, o probándolo en el modo de voz de Le Chat, con funciones empresariales avanzadas: despliegue privado, ajuste fino específico de dominio y soporte de integración dedicado.