Aller au contenu
Technologie

Genie 3

Genie 3 — Technologie. capacité : Génération frame par frame, 1 minute, qualité photoréaliste · catégorie : Modèle de monde interactif temps réel · paramètres : 11 milliards

Genie 3 génère ses environnements image par image, en temps réel, à une qualité photoréaliste, pendant une minute au maximum. Google DeepMind l'a annoncé en août 2025 et l'a lancé en février 2026 dans Project Genie, une application web ouverte aux abonnés Google US Ultra. La filiation est courte et abrupte : Genie 1 était un article de recherche, Genie 2 (décembre 2024) produisait dix secondes en basse résolution sans contrôle en temps réel, et Genie 3 l'a remplacé.

Le problème technique est plus difficile que la génération vidéo standard. Un modèle vidéo peut ajuster rétroactivement les images précédentes pour garder une séquence cohérente ; Genie 3 ne le peut pas. Chaque image doit rester cohérente avec le passé et avec l'action immédiate au clavier ou à la souris de l'utilisateur, sans aucune connaissance des entrées à venir. La physique n'est pas préprogrammée. Le modèle a appris la gravité, les collisions et la dynamique des mouvements en observant de grands volumes de séquences de jeux de plateforme en 2D, une compréhension émergente plutôt qu'un moteur de règles.

Le plafond d'une minute est un compromis. Le dynamisme du monde a tendance à décliner sur des durées plus longues, et les coûts de service restent élevés. Google DeepMind reconnaît aussi un plafond de complexité sur les mécaniques de jeu, une fidélité de contrôle imparfaite, et un biais des données d'entraînement.

Face à OpenAI Sora et Runway Gen-3, le contrôle interactif est le facteur différenciant. La conséquence la plus lourde se situe ailleurs : Simmer utilise déjà Genie 3 pour entraîner des agents à accomplir des objectifs dans des mondes 3D arbitraires, ce qui oriente le modèle vers l'intelligence incarnée plutôt que vers le divertissement. L'équipe se situe elle-même à 50% de sa vision affichée.

Type
Technologie
capacité
Génération frame par frame, 1 minute, qualité photoréaliste
catégorie
Modèle de monde interactif temps réel
paramètres
11 milliards
relations
17
Citée dans
2 fiches

Voisinage

Google DeepMind Genie 2 Project Genie génération vidéo int… Simmer world model latent modèles de monde int… cohérence temporelle 11 milliards de para… vidéos de jeux vidéo… compréhension émerge… intelligence incarnée contrôle par actions prototypage rapide d…

← a créé

Google DeepMind ORGANISATION confiance élevée stable Source ↗

→ remplace

Genie 2 TECHNOLOGIE confiance élevée stable Source ↗

← publie

Google DeepMind ORGANISATION confiance élevée stable Source ↗

← est basé sur

Project Genie TECHNOLOGIE confiance élevée stable Source ↗

→ permet

génération vidéo interactive contrôlable CONCEPT confiance élevée stable Source ↗
compréhension émergente de la physique CONCEPT confiance élevée stable Source ↗
prototypage rapide de jeux CONCEPT confiance élevée atemporel Source ↗

← utilise

Simmer TECHNOLOGIE confiance élevée évolutif Source ↗

→ est basé sur

world model latent CONCEPT confiance élevée stable Source ↗
vidéos de jeux vidéo platformer CONCEPT confiance élevée stable Source ↗

→ est instance de

modèles de monde interactifs CONCEPT confiance élevée stable Source ↗

→ améliore

cohérence temporelle CONCEPT confiance élevée stable Source ↗

→ utilise

11 milliards de paramètres CONCEPT confiance élevée stable Source ↗
contrôle par actions CONCEPT confiance élevée stable Source ↗

→ s applique à

intelligence incarnée CONCEPT confiance élevée atemporel Source ↗

→ concurrence

OpenAI Sora TECHNOLOGIE confiance élevée évolutif Source ↗
Runway Gen-3 TECHNOLOGIE confiance élevée évolutif Source ↗

Citée dans (2)