Saltar al contenido
Tecnología

Genie 3

Genie 3 — Tecnología. capacidad: Generación fotograma a fotograma, 1 minuto, calidad fotorrealista · categoría: Modelo de mundo interactivo en tiempo real · parámetros: 11 mil millones

Genie 3 genera sus entornos fotograma a fotograma, en tiempo real, con calidad fotorrealista, durante hasta un minuto. Google DeepMind lo anunció en agosto de 2025 y lo lanzó en febrero de 2026 dentro de Project Genie, una aplicación web abierta a los suscriptores de Google US Ultra. La trayectoria es corta y pronunciada: Genie 1 fue un artículo de investigación, Genie 2 (diciembre de 2024) producía diez segundos a baja resolución sin control en tiempo real, y Genie 3 lo reemplazó.

El problema técnico es más difícil que la generación de vídeo estándar. Un modelo de vídeo puede ajustar retroactivamente los fotogramas anteriores para mantener una secuencia coherente; Genie 3 no puede. Cada fotograma debe mantenerse coherente con el pasado y con la acción inmediata del teclado o del ratón del usuario, sin ningún conocimiento de las entradas que aún están por llegar. La física no está preprogramada. El modelo aprendió la gravedad, las colisiones y la dinámica del movimiento observando grandes volúmenes de imágenes de videojuegos de plataformas en 2D, una comprensión emergente y no un motor de reglas.

El límite de un minuto es un compromiso. La dinámica del mundo tiende a degradarse en sesiones más largas, y los costes de servicio siguen siendo altos. Google DeepMind también reconoce un límite de complejidad en la mecánica del juego, una fidelidad de control imperfecta y un sesgo derivado de los datos de entrenamiento.

Frente a OpenAI Sora y Runway Gen-3, el control interactivo es el diferenciador. La consecuencia más importante está en otro lugar: Simmer ya usa Genie 3 para entrenar agentes que logren objetivos en mundos 3D arbitrarios, lo que orienta el modelo hacia la inteligencia corporizada más que hacia el entretenimiento. El equipo se sitúa a sí mismo en el 50% de su visión declarada.

Tipo
Tecnología
capacidad
Generación fotograma a fotograma, 1 minuto, calidad fotorrealista
categoría
Modelo de mundo interactivo en tiempo real
parámetros
11 mil millones
relaciones
17
Citada en
2 fiches

Vecindario

Google DeepMind Genie 2 Project Genie génération vidéo int… Simmer world model latent modèles de monde int… cohérence temporelle 11 milliards de para… vidéos de jeux vidéo… compréhension émerge… intelligence incarnée contrôle par actions prototypage rapide d…

← creó

Google DeepMind ORGANISATION confianza alta estable Fuente ↗

→ reemplaza

Genie 2 TECHNOLOGIE confianza alta estable Fuente ↗

← publica

Google DeepMind ORGANISATION confianza alta estable Fuente ↗

← se basa en

Project Genie TECHNOLOGIE confianza alta estable Fuente ↗

→ permite

génération vidéo interactive contrôlable CONCEPT confianza alta estable Fuente ↗
compréhension émergente de la physique CONCEPT confianza alta estable Fuente ↗
prototypage rapide de jeux CONCEPT confianza alta atemporal Fuente ↗

← utiliza

Simmer TECHNOLOGIE confianza alta dinámico Fuente ↗

→ se basa en

world model latent CONCEPT confianza alta estable Fuente ↗
vidéos de jeux vidéo platformer CONCEPT confianza alta estable Fuente ↗

→ es una instancia de

modèles de monde interactifs CONCEPT confianza alta estable Fuente ↗

→ mejora

cohérence temporelle CONCEPT confianza alta estable Fuente ↗

→ utiliza

11 milliards de paramètres CONCEPT confianza alta estable Fuente ↗
contrôle par actions CONCEPT confianza alta estable Fuente ↗

→ se aplica a

intelligence incarnée CONCEPT confianza alta atemporal Fuente ↗

→ compite con

OpenAI Sora TECHNOLOGIE confianza alta dinámico Fuente ↗
Runway Gen-3 TECHNOLOGIE confianza alta dinámico Fuente ↗

Citada en (2)