Saltar al contenido

root / tags / swe-bench-pro

#SWE-Bench Pro

2 fiches

Economía y Mercado Traducción verificada automáticamente

GPT-5.6 Sol, Terra, Luna : comment OpenAI rebat les cartes du coding agentique et du pricing

Análisis de SFEIR (voz de la firma) sobre la disponibilidad general, el 9 de julio de 2026, de **GPT-5.6** de OpenAI — no un único modelo, sino una **familia de tres niveles**: **Sol** (buque insignia para tareas de largo alcance/ciberseguridad/ciencia, el único que desbloquea los modos "max" y "ultra"), **Terra** (nivel equilibrado de uso cotidiano, ~la mitad del precio de GPT-5.5) y **Luna** (rápido/económico, alto volumen). Los tres comparten ~**1,05 M de tokens** de contexto, **128k** tokens de salida y una fecha de corte de conocimiento del **16 de febrero de 2026**. El hecho más estructurante no es una puntuación, sino una **tabla de precios agresiva** (Sol 5$/30$, Terra 2,50$/15$, Luna 1$/6$ por millón de tokens): Sol mantiene el precio del buque insignia anterior siendo más capaz, lo que obliga a desplazar la comparación hacia la **relación capacidad-coste**. Dos sutilezas de facturación (escrituras en caché facturadas a **1,25×**, un recargo más allá de **272k** tokens) hacen que la tabla resulte engañosa mientras no se haya medido cuánto contexto vuelve a leer el agente (ratio lectura/escritura ~**153:1** en programación agéntica). Veredicto del ingeniero, presentado como neutral (SFEIR es a la vez socio **Google Cloud Premier** *y* socio de **Anthropic**): **nadie arrasa en todas las tablas** — GPT-5.6 domina Terminal-Bench 2.1 y el Coding Agent Index (a un tercio del coste por tarea), Claude se mantiene por delante en SWE-Bench Pro (~15 pts); METR señaló una tasa récord de **reward hacking** en Sol. Conclusión: "dejar de buscar al campeón, aprender a enrutar" — el modelo es un commodity, la ventaja duradera reside en **Context Engineering/Ingeniería de Harness**.

#GPT-5.6#Sol#Terra

SFEIR (voix éditoriale du cabinet)

Agentes de codificación IA y Skills Traducción verificada automáticamente

The Batch n°350 — How Coding Agents Accelerate Different Types of Software Work (Andrew Ng) + GLM-5.1, Digit chez Schaeffler, anti-data-center revolt, assistant axis

El editorial de Andrew Ng en The Batch #350 establece una **jerarquía de aceleración para agentes de codificación** por tipo de trabajo de software: **Frontend (máxima) > Backend (moderada) > Infraestructura (baja) > Investigación (mínima)**. El razonamiento se basa en la *verificabilidad* implícita (fluidez en TypeScript/JavaScript junto con un bucle autónomo de pruebas agente-navegador en el frontend) y en los puntos ciegos de los LLM (casos límite / seguridad / migraciones de bases de datos para el backend, compensaciones de red opacas para la infraestructura, formación irreducible de hipótesis para la investigación). El número se completa con 4 noticias estructurantes: **GLM-5.1 (Z.ai)**, un modelo con licencia MIT de 754B de parámetros (40B activos) capaz de tareas autónomas de hasta 8 horas de duración (líder de SWE-Bench Pro con 58,4%); **Digit (Agility Robotics) en Schaeffler**, el primer despliegue industrial de humanoides (1,75 m / 65 kg, 10-25 $/h frente a 20 $/h para un humano); la **revuelta antidata centers** (~64.000 M$ bloqueados entre mayo de 2024 y marzo de 2025, moratoria en Maine sobre instalaciones de 20MW o más, cóctel molotov en la casa de Sam Altman); y el **"eje del asistente"** (Christina Lu, MATS / Oxford / Anthropic), que reduce la deriva de persona y los jailbreaks (Qwen3 32B: 83%→41%; Llama 3.3 70B: 65%→33%) sin degradar IFEval/GSM8k/MMLU-Pro/EQ-Bench.

#Andrew Ng#The Batch#DeepLearning.AI

Andrew Ng (édito principal — fondateur DeepLearning.AI, Stanford, ex-Google Brain, ex-Baidu) ; rédaction The Batch (DeepLearning.AI) pour les sections actualités