# voxtral-mistral-ai-speech-understanding-2025-07-15

## Veille

Voxtral — modelos de comprensión del habla de código abierto de Mistral AI: transcripción multilingüe, preguntas y respuestas sobre audio, licencia Apache 2.0 (mistral.ai)

## Titre Article

Voxtral | Mistral AI

## Date

2025-07-15

## URL

https://mistral.ai/news/voxtral

## Keywords

Voxtral, Mistral AI, comprensión del habla, código abierto, reconocimiento de voz, modelos de lenguaje, transcripción, multilingüe, preguntas y respuestas, resumen automático, llamada a funciones, IA, interfaz de voz, Apache 2.0, modelo de 24B, Mini de 3B

## Authors

Mistral AI

## Ton

**Perfil:** Lanzamiento de producto técnico | Institucional | Informativo-promocional | Experto

Mistral AI adopta un tono de anuncio que posiciona a Voxtral como un lanzamiento importante de código abierto en modelos de voz. El énfasis en la licencia Apache 2.0 y las capacidades multilingües se dirige a la comunidad de código abierto. El lenguaje técnico preciso (modelo de 24B, Mini de 3B, llamada a funciones, preguntas y respuestas) demuestra la amplitud de las capacidades. El tono seguro y profesional es típico de una startup europea de IA que se posiciona frente a OpenAI/Google. La estructura centrada en las capacidades, con detalles de disponibilidad, facilita la adopción por parte de los desarrolladores. Típico de los lanzamientos de producto de laboratorios de IA (estilo Anthropic, Cohere) dirigidos a una comunidad de desarrolladores comprometida con el código abierto con capacidades de nivel comercial.

## Pense-betes

- **2 tamaños**: variante de 24B (producción), Mini de 3B (local/edge), bajo **licencia Apache 2.0**
- **Acceso vía API** + descarga de código abierto
- **Cierra la brecha** entre el ASR de código abierto con alta tasa de error y las API propietarias costosas
- **Precisión de vanguardia** + comprensión semántica nativa a **menos de la mitad del precio** de las soluciones propietarias
- **Contexto largo**: hasta **30-40 minutos de audio** (30 min transcripción, 40 min comprensión)
- **Preguntas y respuestas y resumen integrados**: consulta directa del audio sin encadenar ASR + LLM
- **Nativamente multilingüe**: detección automática de idioma, **8+ idiomas** (inglés, español, francés, portugués, hindi, alemán, neerlandés, italiano)
- **Llamada a funciones desde la voz**: intenciones habladas → comandos de sistema accionables
- **Voxtral Mini Transcribe**: **menos de la mitad del precio de OpenAI Whisper**, y lo supera
- **Voxtral Small iguala a ElevenLabs Scribe** por **menos de la mitad del precio**
- **Benchmarks**: supera a Whisper large-v3, competitivo con GPT-4o mini Transcribe y Gemini 2.5 Flash
- **Hoja de ruta**: diarización de hablantes, anotaciones de audio (edad, emoción), marcas de tiempo a nivel de palabra, reconocimiento de audio no hablado

## RésuméDe400mots

Mistral AI presenta **Voxtral**, una innovadora suite de modelos de comprensión del habla de código abierto diseñada para transformar la interacción humano-máquina mediante la voz. Considerando la voz como la interfaz original de la humanidad, Voxtral busca superar las limitaciones de los sistemas actuales, ya sean poco fiables o propietarios, ofreciendo herramientas de voz robustas, multilingües y profundamente inteligentes. Los modelos están disponibles en **dos versiones**: una variante de 24B diseñada para aplicaciones a escala de producción, y una variante más compacta de 3B, **Voxtral Mini**, adecuada para despliegues locales y en el borde (edge). Ambas se publican bajo la **licencia permisiva Apache 2.0** y son accesibles a través de la API de Mistral AI, con **Voxtral Mini Transcribe**, optimizado para la transcripción, que ofrece una eficiencia de coste/latencia inigualable.

**Arquitectura de dos niveles y ventaja de coste**

Voxtral se distingue al cerrar la brecha entre los sistemas ASR de código abierto con altas tasas de error y las costosas API propietarias. Ofrece **precisión de vanguardia y comprensión semántica nativa** dentro de un marco abierto, a **menos de la mitad del precio** de las soluciones propietarias comparables. Esta eficiencia de coste hace que la inteligencia de voz de alta calidad sea accesible y controlable a escala para una amplia gama de aplicaciones.

**Capacidades avanzadas más allá de la transcripción**

Los modelos ofrecen varias capacidades avanzadas más allá de la simple transcripción. Admiten **contextos de audio largos**, hasta **30 minutos para transcripción y 40 minutos para comprensión**, lo que permite el procesamiento completo de conversaciones o grabaciones extensas. Una característica destacada: **preguntas y respuestas y resumen integrados**, que permiten consultar directamente el contenido de audio o generar resúmenes estructurados **sin encadenar modelos ASR y de lenguaje separados**. Voxtral es nativamente multilingüe, con detección automática de idioma y rendimiento de vanguardia en numerosos idiomas ampliamente utilizados: **inglés, español, francés, portugués, hindi, alemán, neerlandés, italiano**. También permite la **llamada a funciones directamente desde la voz**, traduciendo las intenciones habladas de los usuarios en comandos de sistema accionables. Los modelos conservan las sólidas capacidades de comprensión de texto de su base, el modelo de lenguaje Mistral Small 3.1.

**Puntos de referencia competitivos**

Los resultados de los benchmarks confirman el rendimiento superior de Voxtral. **Supera a Whisper large-v3 en general**, el modelo de referencia de transcripción de código abierto, y supera a GPT-4o mini Transcribe y a Gemini 2.5 Flash en diversas tareas. **Voxtral Small logra resultados de vanguardia** en inglés de formato corto y en Mozilla Common Voice, demostrando sólidas capacidades multilingües, y **iguala a ElevenLabs Scribe** en casos de uso premium a un coste significativamente reducido. **Voxtral Mini Transcribe supera a OpenAI Whisper a menos de la mitad del precio**.

**Hoja de ruta y visión**

Mistral AI planea introducir **diarización de hablantes, anotaciones de audio (edad, emoción), marcas de tiempo a nivel de palabra y reconocimiento de audio no hablado**. La empresa está ampliando su equipo de audio y anima a los desarrolladores a integrar Voxtral mediante descarga local en Hugging Face, a través de la API, o probándolo en el modo de voz de Le Chat, con funciones empresariales avanzadas: despliegue privado, ajuste fino específico de dominio y soporte de integración dedicado.

## GrapheDeConnaissance

- Mistral AI —publie→ Voxtral (TECHNOLOGIE, 0.99)
- Voxtral —est_basé_sur→ Mistral Small 3.1 (TECHNOLOGIE, 0.97)
- Voxtral —utilise→ licence Apache 2.0 (CONCEPT, 0.99)
- Voxtral Small —surpasse→ Whisper large-v3 (TECHNOLOGIE, 0.96)
- Voxtral Small —surpasse→ GPT-4o mini Transcribe (TECHNOLOGIE, 0.95)
- Voxtral Small —surpasse→ Gemini 2.5 Flash (TECHNOLOGIE, 0.95)
- Voxtral Small —concurrence→ ElevenLabs Scribe (TECHNOLOGIE, 0.93)
- Voxtral Mini Transcribe —surpasse→ OpenAI Whisper (TECHNOLOGIE, 0.94)
- Voxtral —permet→ function-calling depuis la voix (CONCEPT, 0.97)
- Voxtral —permet→ Q&A et résumé audio intégrés (CONCEPT, 0.97)
- Voxtral —observé_dans→ Hugging Face (TECHNOLOGIE, 0.96)
- Le Chat —utilise→ Voxtral (TECHNOLOGIE, 0.95)
- Mistral AI —collabore_avec→ Inworld (ORGANISATION, 0.88)

---
Canonical: https://www.thekb.eu/es/fiches/voxtral-mistral-ai-speech-understanding-2025-07-15/
