Zum Inhalt springen
Technologie

Genie 3

Genie 3 — Technologie. Kapazität: Bild-für-Bild-Generierung, 1 Minute, fotorealistische Qualität · Kategorie: Interaktives Echtzeit-Weltmodell · Parameter: 11 Milliarden

Genie 3 generiert seine Umgebungen Bild für Bild, in Echtzeit, in fotorealistischer Qualität, für bis zu eine Minute. Google DeepMind kündigte das Modell im August 2025 an und brachte es im Februar 2026 innerhalb von Project Genie auf den Markt, einer Webanwendung, die Google US Ultra-Abonnenten offensteht. Die Vorgeschichte ist kurz und steil: Genie 1 war ein Forschungspapier, Genie 2 (Dezember 2024) erzeugte zehn Sekunden in niedriger Auflösung ohne Echtzeitsteuerung, und Genie 3 löste es ab.

Das technische Problem ist schwieriger als bei standardmäßiger Videogenerierung. Ein Videomodell kann frühere Bilder nachträglich anpassen, um eine Sequenz konsistent zu halten; Genie 3 kann das nicht. Jedes Bild muss sowohl mit der Vergangenheit als auch mit der unmittelbaren Tastatur- oder Mausaktion der Nutzerin oder des Nutzers konsistent bleiben, ohne Kenntnis der noch bevorstehenden Eingaben. Die Physik ist nicht vorprogrammiert. Das Modell hat Schwerkraft, Kollisionen und Bewegungsdynamik durch die Beobachtung großer Mengen an 2D-Plattformspiel-Aufnahmen gelernt, ein emergentes Verständnis statt einer Regel-Engine.

Die Obergrenze von einer Minute ist ein Kompromiss. Die Dynamik der Welt neigt dazu, über längere Zeiträume nachzulassen, und die Betriebskosten bleiben hoch. Google DeepMind räumt zudem eine Komplexitätsgrenze bei den Spielmechaniken, eine unvollkommene Steuerungstreue und eine Verzerrung durch die Trainingsdaten ein.

Gegenüber OpenAI Sora und Runway Gen-3 ist die interaktive Steuerung das Unterscheidungsmerkmal. Die schwerwiegendere Konsequenz liegt woanders: Simmer nutzt Genie 3 bereits, um Agenten darauf zu trainieren, Ziele in beliebigen 3D-Welten zu erreichen, was das Modell auf verkörperte Intelligenz statt auf Unterhaltung ausrichtet. Das Team selbst siedelt sich bei 50% seiner erklärten Vision an.

Typ
Technologie
Kapazität
Bild-für-Bild-Generierung, 1 Minute, fotorealistische Qualität
Kategorie
Interaktives Echtzeit-Weltmodell
Parameter
11 Milliarden
Relationen
17
Zitiert in
2 fiches

Nachbarschaft

Google DeepMind Genie 2 Project Genie génération vidéo int… Simmer world model latent modèles de monde int… cohérence temporelle 11 milliards de para… vidéos de jeux vidéo… compréhension émerge… intelligence incarnée contrôle par actions prototypage rapide d…

← hat erschaffen

Google DeepMind ORGANISATION hohe Konfidenz stabil Quelle ↗

→ ersetzt

Genie 2 TECHNOLOGIE hohe Konfidenz stabil Quelle ↗

← veröffentlicht

Google DeepMind ORGANISATION hohe Konfidenz stabil Quelle ↗

← basiert auf

Project Genie TECHNOLOGIE hohe Konfidenz stabil Quelle ↗

→ ermöglicht

génération vidéo interactive contrôlable CONCEPT hohe Konfidenz stabil Quelle ↗
compréhension émergente de la physique CONCEPT hohe Konfidenz stabil Quelle ↗
prototypage rapide de jeux CONCEPT hohe Konfidenz zeitlos Quelle ↗

← verwendet

Simmer TECHNOLOGIE hohe Konfidenz dynamisch Quelle ↗

→ basiert auf

world model latent CONCEPT hohe Konfidenz stabil Quelle ↗
vidéos de jeux vidéo platformer CONCEPT hohe Konfidenz stabil Quelle ↗

→ ist eine Instanz von

modèles de monde interactifs CONCEPT hohe Konfidenz stabil Quelle ↗

→ verbessert

cohérence temporelle CONCEPT hohe Konfidenz stabil Quelle ↗

→ verwendet

11 milliards de paramètres CONCEPT hohe Konfidenz stabil Quelle ↗
contrôle par actions CONCEPT hohe Konfidenz stabil Quelle ↗

→ gilt für

intelligence incarnée CONCEPT hohe Konfidenz zeitlos Quelle ↗

→ konkurriert mit

OpenAI Sora TECHNOLOGIE hohe Konfidenz dynamisch Quelle ↗
Runway Gen-3 TECHNOLOGIE hohe Konfidenz dynamisch Quelle ↗

Zitiert in (2)