# voxtral-mistral-ai-speech-understanding-2025-07-15

## Veille

Voxtral — Open-Source-Sprachverständnismodelle von Mistral AI: mehrsprachige Transkription, Audio-Q&A, Apache-2.0-Lizenz (mistral.ai)

## Titre Article

Voxtral | Mistral AI

## Date

2025-07-15

## URL

https://mistral.ai/news/voxtral

## Keywords

Voxtral, Mistral AI, Sprachverständnis, Open Source, Spracherkennung, Sprachmodelle, Transkription, mehrsprachig, Q&A, automatische Zusammenfassung, Function-Calling, KI, Sprachschnittstelle, Apache 2.0, 24B-Modell, Mini 3B

## Authors

Mistral AI

## Ton

**Profil:** Technischer Produktlaunch | Institutionell | Informativ-Werblich | Experte

Mistral AI schlägt einen Ankündigungston an, der Voxtral als bedeutende Open-Source-Veröffentlichung im Bereich Sprachmodelle positioniert. Die Betonung der Apache-2.0-Lizenz und der mehrsprachigen Fähigkeiten richtet sich an die Open-Source-Community. Präzise technische Sprache (24B-Modell, Mini 3B, Function-Calling, Q&A) zeigt die Breite der Fähigkeiten. Der selbstbewusste, professionelle Ton ist typisch für ein europäisches KI-Startup, das sich gegenüber OpenAI/Google positioniert. Die fähigkeitszentrierte Struktur mit Verfügbarkeitsdetails erleichtert die Übernahme durch Entwickler. Typisch für Produktlaunches von KI-Laboren (im Stil von Anthropic, Cohere), die sich an eine Entwicklergemeinschaft richten, die sich Open Source mit kommerzieller Leistungsfähigkeit verpflichtet fühlt.

## Pense-betes

- **2 Größen**: 24B-Variante (Produktion), 3B Mini (lokal/Edge), unter **Apache-2.0-Lizenz**
- **API-Zugang** + Open-Source-Download
- **Schließt die Lücke** zwischen fehleranfälligem Open-Source-ASR und kostspieligen proprietären APIs
- **State-of-the-Art-Genauigkeit** + natives semantisches Verständnis zu **weniger als der Hälfte des Preises** proprietärer Lösungen
- **Langer Kontext**: bis zu **30-40 Minuten Audio** (30 Min. Transkription, 40 Min. Verständnis)
- **Integrierte Q&A und Zusammenfassung**: direkte Audioabfrage ohne Verkettung von ASR + LLM
- **Nativ mehrsprachig**: automatische Spracherkennung, **8+ Sprachen** (Englisch, Spanisch, Französisch, Portugiesisch, Hindi, Deutsch, Niederländisch, Italienisch)
- **Function-Calling aus der Sprache**: gesprochene Absichten → umsetzbare Systembefehle
- **Voxtral Mini Transcribe**: **weniger als die Hälfte des Preises von OpenAI Whisper**, und übertrifft es
- **Voxtral Small erreicht das Niveau von ElevenLabs Scribe** zu **weniger als der Hälfte des Preises**
- **Benchmarks**: übertrifft Whisper large-v3, konkurrenzfähig mit GPT-4o mini Transcribe und Gemini 2.5 Flash
- **Roadmap**: Sprecherdiarisierung, Audio-Annotationen (Alter, Emotion), wortgenaue Zeitstempel, Erkennung von Nicht-Sprach-Audio

## RésuméDe400mots

Mistral AI stellt **Voxtral** vor, eine innovative Suite von Open-Source-Sprachverständnismodellen, die die Mensch-Maschine-Interaktion über Sprache verändern soll. Sprache wird dabei als ursprüngliche Schnittstelle der Menschheit betrachtet: Voxtral zielt darauf ab, die Grenzen aktueller Systeme zu überwinden, die entweder unzuverlässig oder proprietär sind, indem robuste, mehrsprachige und tiefgehend intelligente Sprachwerkzeuge bereitgestellt werden. Die Modelle sind in **zwei Versionen** verfügbar: eine 24B-Variante für Produktionsanwendungen im großen Maßstab und eine kompaktere 3B-Variante, **Voxtral Mini**, geeignet für lokale und Edge-Deployments. Beide werden unter der **freizügigen Apache-2.0-Lizenz** veröffentlicht und sind über die Mistral-AI-API zugänglich, wobei **Voxtral Mini Transcribe**, optimiert für Transkription, eine unerreichte Kosten-/Latenzeffizienz bietet.

**Zweistufige Architektur und Kostenvorteil**

Voxtral hebt sich hervor, indem es die Lücke zwischen Open-Source-ASR-Systemen mit hohen Fehlerraten und kostspieligen proprietären APIs schließt. Es liefert **State-of-the-Art-Genauigkeit und natives semantisches Verständnis** innerhalb eines offenen Rahmens, zu **weniger als der Hälfte des Preises** vergleichbarer proprietärer Lösungen. Diese Kosteneffizienz macht hochwertige Sprachintelligenz für eine Vielzahl von Anwendungen im großen Maßstab zugänglich und kontrollierbar.

**Fortgeschrittene Fähigkeiten über die Transkription hinaus**

Die Modelle bieten mehrere fortgeschrittene Fähigkeiten, die über einfache Transkription hinausgehen. Sie unterstützen **lange Audiokontexte**, bis zu **30 Minuten für Transkription und 40 Minuten für Verständnis**, was die vollständige Verarbeitung ausgedehnter Gespräche oder Aufnahmen ermöglicht. Ein herausragendes Merkmal: **integrierte Q&A und Zusammenfassung**, die die direkte Abfrage von Audioinhalten oder die Generierung strukturierter Zusammenfassungen **ohne Verkettung separater ASR- und Sprachmodelle** erlauben. Voxtral ist nativ mehrsprachig, mit automatischer Spracherkennung und State-of-the-Art-Leistung in vielen weit verbreiteten Sprachen: **Englisch, Spanisch, Französisch, Portugiesisch, Hindi, Deutsch, Niederländisch, Italienisch**. Es ermöglicht zudem **Function-Calling direkt aus der Sprache**, wodurch die gesprochenen Absichten der Nutzer in umsetzbare Systembefehle übersetzt werden. Die Modelle behalten die starken Textverständnisfähigkeiten ihrer Grundlage, des Sprachmodells Mistral Small 3.1, bei.

**Wettbewerbsvergleiche**

Benchmark-Ergebnisse unterstreichen die überlegene Leistung von Voxtral. Es **übertrifft Whisper large-v3 insgesamt**, das Referenzmodell für Open-Source-Transkription, und übertrifft GPT-4o mini Transcribe sowie Gemini 2.5 Flash bei verschiedenen Aufgaben. **Voxtral Small erzielt State-of-the-Art-Ergebnisse** bei Kurzform-Englisch und Mozilla Common Voice und zeigt damit starke mehrsprachige Fähigkeiten, und **erreicht das Niveau von ElevenLabs Scribe** für Premium-Anwendungsfälle bei deutlich reduzierten Kosten. **Voxtral Mini Transcribe übertrifft OpenAI Whisper bei weniger als der Hälfte des Preises**.

**Roadmap und Vision**

Mistral AI plant die Einführung von **Sprecherdiarisierung, Audio-Annotationen (Alter, Emotion), wortgenauen Zeitstempeln und der Erkennung von Nicht-Sprach-Audio**. Das Unternehmen baut sein Audio-Team aus und ermutigt Entwickler, Voxtral über lokalen Download auf Hugging Face, über die API oder durch Ausprobieren im Sprachmodus von Le Chat zu integrieren, mit fortgeschrittenen Enterprise-Funktionen: private Bereitstellung, domänenspezifisches Fine-Tuning und dedizierter Integrationssupport.

## GrapheDeConnaissance

- Mistral AI —publie→ Voxtral (TECHNOLOGIE, 0.99)
- Voxtral —est_basé_sur→ Mistral Small 3.1 (TECHNOLOGIE, 0.97)
- Voxtral —utilise→ licence Apache 2.0 (CONCEPT, 0.99)
- Voxtral Small —surpasse→ Whisper large-v3 (TECHNOLOGIE, 0.96)
- Voxtral Small —surpasse→ GPT-4o mini Transcribe (TECHNOLOGIE, 0.95)
- Voxtral Small —surpasse→ Gemini 2.5 Flash (TECHNOLOGIE, 0.95)
- Voxtral Small —concurrence→ ElevenLabs Scribe (TECHNOLOGIE, 0.93)
- Voxtral Mini Transcribe —surpasse→ OpenAI Whisper (TECHNOLOGIE, 0.94)
- Voxtral —permet→ function-calling depuis la voix (CONCEPT, 0.97)
- Voxtral —permet→ Q&A et résumé audio intégrés (CONCEPT, 0.97)
- Voxtral —observé_dans→ Hugging Face (TECHNOLOGIE, 0.96)
- Le Chat —utilise→ Voxtral (TECHNOLOGIE, 0.95)
- Mistral AI —collabore_avec→ Inworld (ORGANISATION, 0.88)

---
Canonical: https://www.thekb.eu/de/fiches/voxtral-mistral-ai-speech-understanding-2025-07-15/
