Saltar al contenido

root / tags / prompt-caching

#prompt caching

6 fiches

Herramientas y Plataformas Traducción verificada automáticamente

Kimi K3 de Moonshot AI : quand le frontier open-weights rattrape le propriétaire

Análisis del gabinete de ingeniería de SFEIR («una lectura de ingeniero») sobre el lanzamiento, el 16 de julio de 2026, de **Kimi K3** por el laboratorio chino **Moonshot AI**: un **modelo de pesos abiertos (open-weights) de nivel frontera** cuyo proveedor afirma **~2,8 billones de parámetros**, un **contexto de un millón de tokens** y una **publicación de los pesos antes del 27 de julio de 2026** (probablemente bajo una licencia Modified MIT, como en el linaje K2). Tesis: una capacidad que antes se creía reservada a los grandes propietarios (Anthropic, OpenAI, Google) está pasando a estar disponible **en pesos abiertos, a precio de descuento, desde un laboratorio chino**. SFEIR —pese a ser **partner de Anthropic y de Google Cloud**, y por tanto «sin ningún interés en sobrevender un modelo chino»— adopta una **advertencia metodológica** cardinal: el día del lanzamiento **no existe ninguna tabla de benchmarks oficial y completa**; las especificaciones (2,8 billones, Kimi Delta Attention, +25 % de eficiencia de entrenamiento) y las puntuaciones son **declaradas por el proveedor** o proceden de **arenas comunitarias**, «que deben tratarse como afirmaciones, no como hechos medidos». La nueva arquitectura (**Kimi Delta Attention**, atención lineal híbrida; decodificación que se afirma hasta **6,3 veces más rápida** a 1M de tokens) rompe con la cadencia de K2 (K2 jul. 2025 → K2.7 Code jun. 2026, un modelo insignia cada dos meses); dos variantes acompañan el lanzamiento (**K3 Max**, **K3 Swarm Max**), con el retiro forzado de la serie kimi-k2.5/moonshot-v1 el **31 de agosto de 2026**. **La verdadera arma es el precio** (~3 $/M de entrada, 0,30 $ en caché, 15 $ de salida según fuentes secundarias): un modelo frontera de pesos abiertos a este nivel **arrastra hacia abajo toda la curva de precio-rendimiento** — la comoditización de la capa de modelo, acelerada por el open source. Pero la singularidad decisiva no es una puntuación: es la **reversibilidad**. Un modelo frontera de pesos abiertos convierte una API consumida (dependencia del proveedor) en una **opción** (autoalojamiento, portabilidad, salida del lock-in), al precio de una infraestructura pesada para alojar 2,8 billones de parámetros. La postura de SFEIR: **el open-weights cambia la pregunta, no solo la respuesta** — ya no «¿qué modelo es mejor/más barato?», sino «¿qué parte de mi sistema estoy dispuesto a hacer depender de un proveedor que no controlo?». La postura correcta sigue siendo un **portafolio enrutado** (un modelo por tarea, un modelo por restricción), y Kimi K3 añade una **columna «reversibilidad»** a la grilla de decisión. La convicción «AI Only» permanece intacta: el modelo es un commodity, la ventaja duradera reside en la ingeniería que lo rodea (Context Engineering, harness, gobernanza de costes, capacidad de cambiar de opinión). Las cifras aún deben validarse «por cuenta propia» — en tus propios repositorios, con tus propios datos.

#Kimi K3#Moonshot AI#Yang Zhilin

SFEIR (voix éditoriale du cabinet)

Economía y Mercado Traducción verificada automáticamente

Token Budget Wars

Hilo viral de X (**230.5K visualizaciones**, 28 de mayo de 2026, 1:51 AM) de **Jaya Gupta** (@JayaGup10, inversora — probablemente de Foundation Capital, autora del marco *Context Graphs*) titulado ***"Token Budget Wars"***. **Tesis central**: ***"La IA empresarial ha pasado de la adopción a la asignación"*** — la fase 1 de la IA empresarial demostró que los modelos funcionan; la fase 2 decidirá **cuánto vale ese trabajo**. La nueva moneda en la cúpula de la empresa es la **capacidad de cuantificar el ROI de la IA**: *"muéstrame el valor"*. Concepto canónico: ***utilidad marginal del token*** = *"el valor de negocio creado por cada dólar adicional de inferencia"* — el número que importa a escala, y que **la mayoría de las empresas no puede ver**. Cronología: **Claude se lanzó en noviembre de 2025**, después de que se cerraran los presupuestos anuales de 2026 → ya en el **primer trimestre**, empresas *"funcionando muy por encima de lo previsto"* → la inferencia deja de ser una partida de experimentación y se convierte en un **costo operativo recurrente**. Paso de la **experimentación (unos cientos de miles de dólares) a la infraestructura (siete cifras, más de 1 millón de dólares)**: a escala de infraestructura, **la varianza técnica produce oscilaciones materiales en el P&L — dos ejecuciones del mismo flujo de trabajo sobre la misma entrada pueden diferir entre 5 y 10 veces en costo de tokens** sin que nada se vea visiblemente roto, *"una cifra que el CFO tiene que explicarle al CEO"*. **La IA compite con la mano de obra**: 3 tipos de solicitudes presupuestarias (sustituir trabajo externalizado / sustituir trabajo interno / generar ingresos) → desplazamiento hacia el ***costo de un resultado completado*** (costo por ticket resuelto, siniestro procesado, contrato revisado, factura completada, contratación evitada, cliente retenido, dólar de ingreso movilizado). **El BPO es la referencia más fácil para comparar** (ya tiene precio por unidad completada); el trabajo interno es mucho más difícil (empleados multi-competencia, ganancias difusas, resistencia de RR. HH. a la reducción de plantilla). **Por qué es distinto del SaaS**: el SaaS aprendió a tratar el uso como indicador indirecto del valor; la IA rompe ese indicador — *"la señal y el ruido comparten la misma unidad"* (el token), *"el uso de SaaS te decía que el software había sido adoptado. El uso de IA te dice que el contador sigue corriendo. No te dice si tu empresa está funcionando de verdad."* **Tres causas de la invisibilidad de la utilidad marginal del token**: (1) ***colas de reintento*** — tokens por flujo de trabajo resuelto ≈ **T/p**; pasar de un 90% a un 70% de finalización aumenta el costo efectivo en ~**28%**, no un 20%, porque los fallos se acumulan; (2) ***inflación de contexto*** — el costo de inferencia ≈ **O(n²)** respecto a la longitud del contexto (atención), duplicar el contexto **cuadruplica** el costo de razonamiento (sobre-recuperación: 50 documentos cuando bastarían 5); (3) ***enrutamiento*** — por defecto se usa el modelo más potente (una clasificación básica ejecutada en un modelo de razonamiento complejo); a través de millones de llamadas, la diferencia entre enrutar tareas fáciles a un modelo pequeño y enviarlo todo al modelo de vanguardia = *"la diferencia entre una factura manejable y un problema de nivel de consejo de administración."* **División sectorial**: las empresas de **software** = un problema de **medición de productividad** (ya instrumentado: PR, commits, despliegues, incidentes, tiempo de ciclo, MTTR — sigue el rastro de los *"despidos por IA"*); las empresas **no-software** = un problema de **transformación** (trabajo operativo: siniestros, suscripción de pólizas, soporte, revisiones de cumplimiento, excepciones de cadena de suministro, disputas de pago — *correcto bajo auditoría, no solo correcto en promedio*). **La capa que falta = atribución de token a resultado**: una capa de conversión que vincula el gasto en inferencia → el trabajo realizado → el resultado de negocio, respondiendo a 3 preguntas (costo real incluyendo reintentos/correcciones; qué partes de la traza importaron frente al desperdicio; si el trabajo cambió el modelo operativo). ***La medición se convierte en memoria***: vincular un token a un resultado exige capturar **trazas de decisión** (lo que el agente vio, recuperó, invocó, ignoró, dónde reintentó, cuándo un humano lo anuló) — *"el razonamiento de una decisión es uno de los activos más perecederos de una empresa"* (vive en Slack, correos, llamadas de escalado, en la cabeza de las personas). Los agentes **crean** estas trazas; capturadas primero para justificar el gasto, se vuelven *"más valiosas que el informe de costos"* → un **grafo de contexto** (*"aunque estoy tan cansada de esa palabra estos días"*). **La capa de asignación es el premio**: quien posea la atribución de token a resultado toma las **decisiones de asignación** (qué flujos de trabajo merecen más cómputo, cuáles tienen un tope, cuáles pasan a modelos más baratos, cuáles siguen siendo humanos, cuáles sustituyen al BPO). Las empresas no harán esto por sí solas — lo **comprarán como una transformación** (manual del Fortune 500: exalumnos de McKinsey + Palantir y un CEO que impulsa desde arriba, al estilo de la transformación ERP/BI/digital, un *"programa"* con un patrocinador ejecutivo e infraestructura que se convierte en la **nueva fuente de verdad**). Enmarcado por **Charlie Munger**: *"muéstrame el incentivo y te mostraré el resultado."* Subtesis organizativa: el instinto ejecutivo de décadas de que *equipos grandes = trabajos/alcance/poder grandes* → una vez que la inteligencia se convierte en el **recurso escaso**, el nuevo indicador es *"cuánta de ella estás orquestando."* Relevancia directa para el **posicionamiento de Cost Optimization / FinOps agéntico**: confirma empíricamente las palancas (enrutamiento de modelos, caché de prompts, higiene de contexto, subagentes) y desplaza el KPI hacia el **costo por resultado completado**. Fuerte convergencia con el *cross-system labor* de Bain (foso de datos de ejecución, Cursor), el *No AI jobpocalypse* de Ng (precios anclados al salario del empleado sustituido), el ROI de DORA (costo por función), Mensch/Mistral (electrón→token), Ensarguet (economía del cómputo), *Context Graphs* de Foundation Capital (trazas de decisión, misma autora), *Token Burning* de Wescale, BFM/Girard (token = combustible de valor).

#Token Budget Wars#utilidad marginal del token#atribución de token a resultado

**Jaya Gupta** (@JayaGup10) — investisseuse / VC. Très probablement **Foundation Capital** (le thread s'auto-réfère au cadre ***Context Graphs*** — *« ahem, context graph, although I am so tired of that word these days »* — concept porté par Foundation Capital, cf. fiche `bain-100b-saas-opportunity` qui cite *Foundation Capital — Context Graphs trillion-dollar opportunity, 2025-12-22*). Thread publié sur X le **28 mai 2026 à 1h51** · **230 · 5K vues** · format essai long en un seul post. Une réponse notable de **@tuning_engines** (*« DevSecFinOps for the Agentic Era »*) : *« Tokens will basically have to be managed like headcount […] model hierarchies too »*.

Agentes de codificación IA y Skills Traducción verificada automáticamente

The Batch n°350 — How Coding Agents Accelerate Different Types of Software Work (Andrew Ng) + GLM-5.1, Digit chez Schaeffler, anti-data-center revolt, assistant axis

El editorial de Andrew Ng en The Batch #350 establece una **jerarquía de aceleración para agentes de codificación** por tipo de trabajo de software: **Frontend (máxima) > Backend (moderada) > Infraestructura (baja) > Investigación (mínima)**. El razonamiento se basa en la *verificabilidad* implícita (fluidez en TypeScript/JavaScript junto con un bucle autónomo de pruebas agente-navegador en el frontend) y en los puntos ciegos de los LLM (casos límite / seguridad / migraciones de bases de datos para el backend, compensaciones de red opacas para la infraestructura, formación irreducible de hipótesis para la investigación). El número se completa con 4 noticias estructurantes: **GLM-5.1 (Z.ai)**, un modelo con licencia MIT de 754B de parámetros (40B activos) capaz de tareas autónomas de hasta 8 horas de duración (líder de SWE-Bench Pro con 58,4%); **Digit (Agility Robotics) en Schaeffler**, el primer despliegue industrial de humanoides (1,75 m / 65 kg, 10-25 $/h frente a 20 $/h para un humano); la **revuelta antidata centers** (~64.000 M$ bloqueados entre mayo de 2024 y marzo de 2025, moratoria en Maine sobre instalaciones de 20MW o más, cóctel molotov en la casa de Sam Altman); y el **"eje del asistente"** (Christina Lu, MATS / Oxford / Anthropic), que reduce la deriva de persona y los jailbreaks (Qwen3 32B: 83%→41%; Llama 3.3 70B: 65%→33%) sin degradar IFEval/GSM8k/MMLU-Pro/EQ-Bench.

#Andrew Ng#The Batch#DeepLearning.AI

Andrew Ng (édito principal — fondateur DeepLearning.AI, Stanford, ex-Google Brain, ex-Baidu) ; rédaction The Batch (DeepLearning.AI) pour les sections actualités