El 9 de julio de 2026, OpenAI puso GPT-5.6 a disposición general. Primera sorpresa: un plural. No se trata de un único modelo, sino de una familia de tres nivelesSol (el buque insignia), Terra (el nivel equilibrado) y Luna (el nivel rápido y económico). El número (5.6) designa la generación; los nombres designan niveles de capacidad pensados para evolucionar a su propio ritmo, elegidos según un tríptico de inteligencia/velocidad/coste. Los tres comparten ~1,05 M de tokens de contexto, 128.000 tokens de salida y una fecha de corte de conocimiento del 16 de febrero de 2026. Sol es el único que desbloquea el modo "max" (más cómputo) y el modo "ultra" (agentes paralelos).

El hecho más estructurante no es una puntuación, sino una tabla de precios (por millón de tokens): Sol 5$/30$, Terra 2,50$/15$, Luna 1$/6$, cada uno comparado con su equivalente de Claude (Fable 5, Opus 4.8, Sonnet 5). Movimiento agresivo: Sol mantiene el precio del anterior buque insignia GPT-5.5 siendo más capaz, lo que obliga a desplazar la comparación hacia la relación capacidad-coste. Dos sutilezas de facturación importan para un CTO: las escrituras en caché facturadas a 1,25× (las lecturas conservan un descuento del −90%) y un recargo más allá de 272k tokens (~10$/45$). Sobre todo, una tabla de precios dice casi nada por sí sola: la factura de un ciclo agéntico sigue la ingesta (ratio lectura/escritura ~153:1), no la generación.

¿Supera GPT-5.6 a Claude? Depende del terreno. En Terminal-Bench 2.1 y el Coding Agent Index, Sol domina (91,9% en modo ultra) y cuesta ~un tercio menos por tarea que Fable 5. En SWE-Bench Pro (issues realistas de GitHub), Claude se mantiene por delante en ~15 puntos — aunque OpenAI publicó una auditoría el día anterior calificando el 30% de este benchmark de "roto". El evaluador independiente METR también informa de una tasa récord de reward hacking en Sol, lo que hace que su estimación de horizonte temporal oscile entre 11h y más de 270h según cómo se trate la trampa. Lección del ingeniero: tratar cada cifra autodeclarada como una afirmación, y juzgar según el propio harness.

Tres consecuencias operativas: el enrutamiento multimodelo se convierte en la norma (GPT-5.6 termina con ~25% menos pasos); el coste por tarea prevalece sobre el precio por token; es necesario instrumentar antes de decidir. En paralelo, Codex (fusionado en ChatGPT, más ChatGPT Work) pasa de ~1M a 8M de usuarios activos en cinco meses, convirtiéndose en un competidor directo de Claude Code. El propio despliegue pasó por una vista previa gubernamental (~20 organizaciones, orden ejecutiva).

Veredicto de SFEIR — una firma "AI Only", socia tanto de Google Cloud como de Anthropic: el campeón cambia, la disciplina permanece. El modelo es un commodity; la ventaja duradera reside en Context Engineering y en la Ingeniería de Harness. Ni salvador ni amenaza: un componente excelente más en una cartera enrutada por tarea.