Saltar al contenido

root / tags / open-weights

#open-weights

8 fiches

Calidad y Seguridad Traducción verificada automáticamente

GLM-5.3: Frontier Coding with Emergent Cyber Capabilities

Publicación de anuncio publicada en el **blog oficial de Z.ai** (antes Zhipu AI, laboratorio chino) el **14 de agosto de 2026**, **sin firma individual**, ~2.000 palabras más notas al pie. Anuncia **GLM-5.3**, sucesor de GLM-5.2, y se abre con una tesis metodológica: *« Scaling post-training is all we did for GLM-5.3. »* Mismo modelo base que GLM-5.2 — *« every gain comes from post-training »*. Tres anuncios. **(A) Un modelo de codificación de pesos abiertos**: +50% reivindicado en **Z.ai Code Bench**, un benchmark interno no publicado. **(B) Una capacidad cibernética presentada como "emergente"**, que el cuerpo del texto atribuye a una decisión de entrenamiento — *« As part of post-training, we introduced vulnerability discovery data and environments into the training mix. We expected this to make the model better at finding and reasoning about vulnerabilities »* — lo que resultó sorprendente fue la velocidad y el cambio de naturaleza: el modelo pasa de identificar fallos aislados a *« coherent plans for complete exploitation chains »*. Las ganancias crecen con la posición en la cadena de explotación: CyberGym 77,2 → **84,5%**, ExploitBench 24,4 → **54,4%** (×2,2), ExploitGym 29 → **105** tareas en 2h (×3,6), con una brecha frente a la frontera cerrada que sigue siendo amplia (181 y 247 tareas). Z.ai lo formula así: *« Capability is growing fastest exactly where we are furthest behind. »* La publicación también difunde un **Z.ai Security Disclosure Ledger**: **2.436 vulnerabilidades identificadas en 269 proyectos de código abierto** — núcleos, sistemas operativos, motores de navegador, infraestructura, aplicaciones web, protocolos de red — la más antigua introducida en **1981**, vida media antes del descubrimiento de **26,6 años**, de las cuales **53 divulgadas** y **2.383 bajo embargo**. **(C) Una publicación de los pesos** *« within two weeks of launch, once safety evaluation and hardening are complete »*. El aporte metodológico más reutilizable: la **síntesis de entornos y verificadores**, esta última producida sin acceso a la solución de referencia y admitida solo tras un tríptico de controles negativos — **oracle**, **no-op**, **unsolved-state**. Todas las evaluaciones agénticas se realizan **en Claude Code 2.1.207**.

#GLM-5.3#GLM-5.2#Z.ai

**Z.ai** (anciennement **Zhipu AI**) · laboratoire d'IA chinois · éditeur de la famille **GLM**. Billet **institutionnel et non signé** : aucun auteur nommé · aucun chercheur mis en avant · aucun lien vers un rapport technique ou une carte de modèle. Publié le **14 août 2026**. La page est une SPA React — le HTML servi est un `<div id="root">` vide · et le texte comme les scores ont dû être extraits du bundle `glm-5.3-BCnx8T5_.js` · où ils figurent en valeurs source.

Calidad y Seguridad Traducción verificada automáticamente

Shieldstral : Mistral compile sa doctrine en 3,8 milliards de paramètres

Una nota de vigilancia de **Didier Girard** publicada en **X** el **7 de agosto de 2026**, que interpreta el lanzamiento de **Shieldstral 1.0 3B** (Mistral AI, 4 de agosto de 2026) no como el lanzamiento de un producto sino como **el despliegue en producción de una doctrina**. Punto de partida: el **13 de mayo de 2026**, ante la comisión de investigación de la Asamblea Nacional sobre las vulnerabilidades digitales, **Arthur Mensch** rechazó cualquier papel de supervisión de Mistral sobre el uso final de sus modelos — *"no tenemos legitimidad democrática"* — rechazando explícitamente la postura de **Anthropic**. Menos de tres meses después, Mistral lanza un **modelo de moderación**. El autor descarta la contradicción aparente: **Shieldstral no incorpora ninguna taxonomía de lo lícito y lo ilícito**, responde a una **pregunta que escribe el usuario**. **El mecanismo es el corazón de la nota**: un prompt en tres partes (contexto + severidad / una única pregunta cerrada / el contenido a juzgar), una respuesta `yes` o `no`, y el **softmax sobre estos dos tokens** produce una puntuación continua entre 0 y 1. **La política de moderación no está en los pesos, se lee en el momento de la inferencia** — mientras que **Llama Guard 4** incorpora la taxonomía de MLCommons fijada en el entrenamiento, Shieldstral lee la vuestra en lenguaje natural, modificable **sin reentrenamiento**. El informe técnico (**arXiv:2607.25857**, 28 de julio de 2026) cuantifica el coste de esta elección: el ajuste fino solo con datos públicos = **61,1% de F1** en adaptabilidad de política; **4,4 millones de pares contrastivos** generados por un LLM (el mismo contenido reescrito para infringir una política pero no su política hermana) = **+23,3 puntos**; **91,3%** tras la fusión de tres checkpoints. Características: **3.800 millones de parámetros reales** (el «3B» del nombre redondea a la baja), base **Ministral 3** + codificador de visión **Pixtral**, **12 idiomas**, **16 GB de VRAM en BF16**, **Apache 2.0**. Rendimiento en texto: **84,9% de F1 promedio**, a la par de **GPT-OSS-Safeguard-20B** (siete veces más grande), por delante de **Qwen3Guard-8B** (84,0) y muy por delante de **LlamaGuard-4-12B** (69,1). **Una salvedad planteada por el propio autor**: *todas estas cifras provienen de Mistral, sobre conjuntos de prueba seleccionados por Mistral, y no existía ninguna evaluación de terceros a fecha del 6 de agosto*. La tesis estructurante de la nota es una **oposición de topologías**: en **Anthropic**, la barrera de seguridad vive **en los pesos** y el editor arbitra quién queda exento de ella (**Claude Fable 5** público con medidas de seguridad / **Claude Mythos 5** sin ellas, reservado a los ciberdefensores aprobados de **Project Glasswing**, 9 de junio de 2026); en **Mistral**, la barrera de seguridad **se sitúa fuera del modelo** — un componente separado, abierto, autoalojable, cuya política pertenece a quien lo despliega. Alineación explícita de clientes (ministerio de las Fuerzas Armadas, BNP Paribas, administraciones gubernamentales francesa y luxemburguesa). La nota cierra con un **contratiempo documentado en tres puntos**: **auditabilidad** (salida binaria, sin traza de razonamiento, mientras que quien despliega hereda la carga de la justificación en una auditoría de la AI Act), **robustez** (el primer capítulo del *Tratado sobre la tolerancia* de Voltaire clasificado como «llamada a la violencia» por un usuario en el hilo de Hacker News — una confusión entre mención y respaldo), **disponibilidad** (a fecha del 6 de agosto: sin endpoint facturado en La Plateforme, sin Ollama oficial). Tres reglas de despliegue para cerrar.

#Shieldstral#Shieldstral 1.0 3B#Mistral AI

**Didier Girard** — auteur de la note · publiée sur son compte X. Écrit ici en **analyste de doctrine industrielle** plutôt qu'en testeur : il n'a pas déployé le modèle · il croise une **audition parlementaire** (Mensch, 13 mai) · un **lancement produit** (Shieldstral, 4 août) · un **rapport technique** (arXiv, 28 juillet) et un **contre-exemple concurrent** (Anthropic, 9 juin) pour montrer qu'ils forment une position cohérente. Deux marqueurs de posture : il **borne explicitement la valeur des chiffres** qu'il cite (aucune évaluation tierce) et il **termine par des règles opérationnelles** — l'analyse doit sortir avec sa traduction en décisions de déploiement.

Economía y Mercado Traducción verificada automáticamente

Mistral ↔ Microsoft : un accord souverain, une stratégie industrielle encore illisible

Análisis de SFEIR (voz de la firma, «una lectura de ingenieros») del acuerdo anunciado el **21 de julio de 2026** entre **Mistral** y **Microsoft**: una **alianza industrial valorada en varios miles de millones de dólares**, estructurada en tres partes — (1) **cómputo en Europa** (capacidad Azure reservada en el continente, centros de datos en Francia, sistemas **NVIDIA Vera Rubin** de última generación, para «cerrar el déficit europeo de cómputo»); (2) **los modelos de Mistral en las herramientas de Microsoft** (**Mistral Medium 3.5** y **Mistral OCR 4** en **Microsoft Foundry**, accesibles en **Copilot Studio** para construir agentes empresariales); (3) sobre todo **Azure Local hasta el modo desconectado** (nube pública, nube conectada supervisada, y **air-gapped**, totalmente fuera de la red externa — para el secreto de defensa, la sanidad, la banca crítica). **Dato notable, confirmado por Brad Smith: ninguna nueva participación de capital** de Microsoft en el capital de Mistral — una alianza masiva **sin vínculo de capital**. SFEIR — socio de Anthropic y Google Cloud, «sin interés en sobrevender al campeón francés» — considera a Mistral **«la mejor apuesta europea en la capa de modelo»** y propone una lectura en tres partes. **Lo que el acuerdo aporta a un CIO**: un modelo europeo de vanguardia, ejecutable en un entorno desconectado y controlado por el cliente (cifrado en memoria, claves gestionadas localmente), marca casillas que pocas ofertas marcan. **La tensión**: esta soberanía se despliega **sobre la infraestructura de un hyperscaler estadounidense**; hay que distinguir cuatro soberanías — **modelo, ejecución, infraestructura, relación comercial** — de las cuales se puede «obtener tres de cuatro, pero aun así hay que saber cuál falta». El único elemento que hace que la soberanía sea **verdaderamente portable** es la naturaleza **open-weights** de los pesos de Mistral (la misma lógica de reversibilidad que para **Kimi K3**). La ausencia de participación de capital no es un detalle: preserva la gobernanza de Mistral **y** minimiza el riesgo de un examen antitrust (FTC, Comisión Europea) — **arbitraje regulatorio asumido**, no solo una elección técnica. **El verdadero punto ciego**: la **legibilidad de la estrategia industrial de Mistral**, presente simultáneamente en casi todos los frentes (B2C con Le Chat, B2B vía distribución Azure, modelo open-weights **y** ambición frontier, infraestructura muy intensiva en capital — 200 MW asegurados, un tope de 1 GW para 2030 —, alianzas con un puñado de grandes cuentas, verticalización Robostral/OCR, servicio a sectores regulados): full-stack soberano (lectura optimista) o dispersión de una empresa de tres años, valorada en ~20.000 millones de euros, entre negocios con modelos económicos divergentes (lectura prudente). Para el liderazgo técnico: **separar el modelo del canal**, **diseñar para poder salir** (Design to Exit — el open-weights hace creíble la puerta de salida), **enrutar en lugar de apostar** (arquitectura soberana multi-LLM, RAISE). Conclusión: **la soberanía es una propiedad arquitectónica, no una etiqueta** — se cualifica dependencia por dependencia; la legibilidad industrial faltante sigue siendo la verdadera pregunta abierta, que no zanjarán los comunicados de prensa sino «los compromisos de los próximos doce meses».

#Mistral#Mistral AI#Microsoft

SFEIR (voix éditoriale du cabinet)

Filosofía y Sociedad Traducción verificada automáticamente

Some observations on Kimi (thread X)

Hilo de X de **Dean W. Ball** — **Head of Strategic Futures en OpenAI** desde el 6 de julio de 2026, **autor principal de America's AI Action Plan** bajo la administración Trump (un posicionamiento que conviene tener presente al leer un argumento anti-open-weights escrito por un insider de la frontera propietaria): **seis observaciones** desencadenadas por el modelo chino de pesos abiertos **Kimi**, que rápidamente van más allá del producto para avanzar una **tesis geopolítica e ideológica** contraria a la corriente dominante. (1) Kimi es **un modelo muy bueno**, no reducible a la destilación, **a la altura de los mejores modelos públicos del Q1 2026** en codificación agéntica — pero **muy ávido de tokens**, por lo que no resulta tan obviamente barato de operar. (2) Ball dice estar **sorprendido de que el Estado chino siga permitiendo la apertura del código** de modelos tan buenos: atribuye esto **~75% a una "ceguera estratégica" / a una falta de "AGI-pilledness"** (el PCC supuestamente sostiene una visión de la IA "muy a la Yann LeCun"), y ~25% a una **falta de cómputo de inferencia** — lo que convertiría la estrategia china de pesos abiertos en un **subproducto no intencional de los controles de exportación estadounidenses** — más un reflejo hacia exportaciones agresivas; del lado de las empresas, la apertura es mitad ideológica, mitad una admisión de que "estamos rezagados, nadie pagaría por modelos chinos por debajo de la frontera." (3) Tesis central: **los modelos de pesos abiertos son intrínsecamente desacelerantes** — **desincentivan el capex de IA**. Ball se sorprende del entusiasmo de los **"aceleracionistas"** por los pesos abiertos, que atribuye a su gusto por el **"manto de la ingobernabilidad"** (una analogía con *The Art of Not Being Governed* de James Scott y sus pueblos de las colinas). (4) Un mundo dominado por los pesos abiertos conduciría al **"comunismo de IA"** — la IA no como producto de mercado sino como **"bien público" / "infraestructura pública digital"** provista por el Estado, "exactamente lo que China está proponiendo"; Ball juzga este horizonte **"distópico"** y relata haber sido presionado, mientras estaba en el gobierno, para un centro de datos federal de **11 a 12 cifras** que subsidiaría a startups que regalarían sus modelos de forma gratuita. (5) **Predicción política**: la administración Trump terminará por comprender que su mejor estrategia no es **"prohibir el open source"** (uno de los argumentos más tontos del debate) sino **crear riesgo regulatorio / FUD** mediante **soft law** de cada agencia ("un boletín de la Fed sospecha de puertas traseras en modelos chinos"), suficiente para que las **empresas reguladas se retraigan**, sin ahuyentar a los hyperscalers (de lo contrario las startups recurrirían a proveedores más turbios). (6) Estos modelos hacen que **el mundo sea un poco más peligroso**, todavía no de forma perceptible — hasta el día en que lo sea; una línea de cierre irónica sobre un "agente autorreplicante escapado de un laboratorio chino" (una analogía COVID/fuga de laboratorio, "color me shocked"). A leer como **contrapunto** al análisis de SFEIR (Kimi K3, reversibilidad, [[sfeir-kimi-k3-moonshot-frontier-open-weights-2026-07-16]]) y al discurso pro-open-source de Xi en el WAIC ([[xi-waic2026-gouvernance-mondiale-ia-2026-07-17]]).

#Dean W. Ball#Dean Woodley Ball#OpenAI

Dean W. Ball (Dean Woodley Ball, @deanwball sur X) — expert américain de premier plan en politique de l'IA et gouvernance des technologies émergentes. **Depuis le 6 juillet 2026 : Head of Strategic Futures chez OpenAI** (petite équipe sur la politique de l'IA de pointe — risques catastrophiques, auto-amélioration récursive, impact marché du travail, relations labos-États-société ; rend compte au Chief Strategy Officer Jason Kwon). Reste **Nonresident Senior Fellow** à la Foundation for American Innovation (FAI). **Parcours** : Senior Policy Advisor for AI and Emerging Technology à l'Office of Science and Technology Policy de la Maison Blanche (administration Trump) · où il fut le **principal rédacteur d'America's AI Action Plan** ; Research Fellow au Mercatus Center (George Mason) · Senior Program Manager à la Hoover Institution (Stanford) · Manhattan Institute · ex-Executive Director de la Calvin Coolidge Presidential Foundation. Auteur de la newsletter **Hyperdimensional** (21 000+ abonnés) ; Visiting Lecturer à la Yale Law School (cours sur la gouvernance de l'IA de pointe). Diplômé d'Histoire de Hamilton College (2014, magna cum laude) · ~33-34 ans · vit à Washington D.C. **Sensibilité** : libéral classique / libertarien · mais reconnaissant un rôle nécessaire de l'État face aux risques existentiels de l'IA. (Post X personnel ; date d'ajout à la veille : 2026-07-17.)

Herramientas y Plataformas Traducción verificada automáticamente

Kimi K3 de Moonshot AI : quand le frontier open-weights rattrape le propriétaire

Análisis del gabinete de ingeniería de SFEIR («una lectura de ingeniero») sobre el lanzamiento, el 16 de julio de 2026, de **Kimi K3** por el laboratorio chino **Moonshot AI**: un **modelo de pesos abiertos (open-weights) de nivel frontera** cuyo proveedor afirma **~2,8 billones de parámetros**, un **contexto de un millón de tokens** y una **publicación de los pesos antes del 27 de julio de 2026** (probablemente bajo una licencia Modified MIT, como en el linaje K2). Tesis: una capacidad que antes se creía reservada a los grandes propietarios (Anthropic, OpenAI, Google) está pasando a estar disponible **en pesos abiertos, a precio de descuento, desde un laboratorio chino**. SFEIR —pese a ser **partner de Anthropic y de Google Cloud**, y por tanto «sin ningún interés en sobrevender un modelo chino»— adopta una **advertencia metodológica** cardinal: el día del lanzamiento **no existe ninguna tabla de benchmarks oficial y completa**; las especificaciones (2,8 billones, Kimi Delta Attention, +25 % de eficiencia de entrenamiento) y las puntuaciones son **declaradas por el proveedor** o proceden de **arenas comunitarias**, «que deben tratarse como afirmaciones, no como hechos medidos». La nueva arquitectura (**Kimi Delta Attention**, atención lineal híbrida; decodificación que se afirma hasta **6,3 veces más rápida** a 1M de tokens) rompe con la cadencia de K2 (K2 jul. 2025 → K2.7 Code jun. 2026, un modelo insignia cada dos meses); dos variantes acompañan el lanzamiento (**K3 Max**, **K3 Swarm Max**), con el retiro forzado de la serie kimi-k2.5/moonshot-v1 el **31 de agosto de 2026**. **La verdadera arma es el precio** (~3 $/M de entrada, 0,30 $ en caché, 15 $ de salida según fuentes secundarias): un modelo frontera de pesos abiertos a este nivel **arrastra hacia abajo toda la curva de precio-rendimiento** — la comoditización de la capa de modelo, acelerada por el open source. Pero la singularidad decisiva no es una puntuación: es la **reversibilidad**. Un modelo frontera de pesos abiertos convierte una API consumida (dependencia del proveedor) en una **opción** (autoalojamiento, portabilidad, salida del lock-in), al precio de una infraestructura pesada para alojar 2,8 billones de parámetros. La postura de SFEIR: **el open-weights cambia la pregunta, no solo la respuesta** — ya no «¿qué modelo es mejor/más barato?», sino «¿qué parte de mi sistema estoy dispuesto a hacer depender de un proveedor que no controlo?». La postura correcta sigue siendo un **portafolio enrutado** (un modelo por tarea, un modelo por restricción), y Kimi K3 añade una **columna «reversibilidad»** a la grilla de decisión. La convicción «AI Only» permanece intacta: el modelo es un commodity, la ventaja duradera reside en la ingeniería que lo rodea (Context Engineering, harness, gobernanza de costes, capacidad de cambiar de opinión). Las cifras aún deben validarse «por cuenta propia» — en tus propios repositorios, con tus propios datos.

#Kimi K3#Moonshot AI#Yang Zhilin

SFEIR (voix éditoriale du cabinet)

Economía y Mercado Traducción verificada automáticamente

The state of open source AI (v1.0.1, juillet 2026)

**Informe periódico de Mozilla**, *The state of open source AI*, **v1.0.1, julio de 2026**, presentado mediante una carta de **Raffi Krikorian** (CTO): siete secciones, un sitio interactivo y un informe descargable. Tesis enunciada en el título de la Sección 1: *« La capa del modelo se ha convertido en una commodity. El valor se acumula en el harness que se sitúa por encima. »* **Estado de las capacidades**: en el *Artificial Analysis Intelligence Index v4.1*, el mejor modelo cerrado obtiene **61** puntos (Claude Opus 5) y el mejor modelo abierto **57** (**Kimi K3**), cuarto en el ranking general y por delante de tres de los mayores laboratorios cerrados; en el *Epoch Capabilities Index*, la brecha es de **6 puntos** (K3 en 156 frente a GPT-5.6 Sol en 162), descrita como *« más o menos un ciclo de lanzamiento »*, con intervalos de confianza que se solapan. **Frontera en diente de sierra**: el open lidera en código frontend (K3 con 1.679 Elo en LMArena Frontend Code Arena, seis dominios de siete), disputa el trabajo agéntico en terminal (88,3 frente a 88,8 en Terminal-Bench 2.1) y cede terreno en trabajo profesional de conocimiento (Fable 5 supera a K3 por 92 Elo en GDPval-AA v2). **Cambio de uso**: la cuota de tokens de OpenRouter dirigida a modelos de pesos abiertos pasó de un nivel insignificante a un tercio a finales de 2025, y luego a una **mayoría a mediados de 2026**, con los siete modelos de mayor volumen todos de pesos abiertos —el propio informe señala que *« por número de solicitudes, los proveedores cerrados estadounidenses siguen liderando »*, siendo el liderazgo del open un liderazgo en volumen de tokens concentrado en cargas de trabajo de código y agénticas. **El contraste central**: *« El open es fácil de lanzar. El open es difícil de desplegar. »* —el 79% de los desarrolladores que añaden IA usan modelos abiertos frente al 71% para los cerrados, pero solo el **53%** de los equipos que usan modelos abiertos llega a producción **frente al 63%**, y la brecha se amplía con el tamaño de la organización (cerrado 54% → 73%, abierto 53% → 57%), lo que *« descarta una explicación por recursos »*. El mapa de madurez del stack (48 componentes, 9 capas) muestra dos columnas sistemáticamente frías —**estandarización** y ***preparación empresarial***— identificadas como la brecha operativa. **Sección 5**: *« El harness agéntico es otro agente de usuario »*, y *« El modelo se está comiendo al harness »* —en todos los modelos donde ambos coexisten, el harness propio del laboratorio gana ahora, y la brecha de 21,8 puntos se ha comprimido a unos 3. De ahí la fórmula: *« Un harness ajustado con precisión a los pesos de un laboratorio… se degrada con el modelo de cualquier otro, así que cuanto más ajustado está, menos intercambiables son los pesos que hay debajo. El lock-in llega como efecto secundario de la optimización. »*

#Mozilla#state of open source AI#pesos abiertos

**Mozilla** — éditeur du rapport · avec une introduction signée **Raffi Krikorian** · *Chief Technology Officer*. Publié en **juillet 2026** (v1.0.1). Données issues de sources tierces créditées (Artificial Analysis, Epoch AI, OpenRouter, LMArena) et d'une enquête propre menée avec **SlashData** (*Mozilla / SlashData 2026 developer survey*, n = 1 410 sur la question des freins).

Economía y Mercado Traducción verificada automáticamente

GLM-5.2 leads open weights models and sits at #3 overall on GDPval-AA, a real-world agentic work benchmark

Anuncio de benchmark de **Artificial Analysis** (plataforma independiente de evaluación de modelos de IA, vía X/Twitter + página del modelo): **GLM-5.2** de **Z.ai** (Zhipu AI, @Zai_org) se convierte en **el modelo de pesos abiertos líder** y asciende al **puesto n.º 3 de la clasificación general** de **GDPval-AA**, un benchmark del mundo real para *trabajo intelectual económicamente valioso* (tareas de largo horizonte, multiturno, agénticas). GLM-5.2 obtiene **1524 Elo**, solo por detrás de **Claude Fable 5 (1783)** y **Claude Opus 4.8 (1615)**, y a la par de **GPT-5.5 (xhigh, 1509)**. Supera con amplio margen al siguiente mejor modelo de pesos abiertos (**MiniMax-M3, 1408**), así como a numerosos modelos propietarios: **Gemini 3.5 Flash (1357)**, **Qwen 3.7 Max (1289)**, **Muse Spark (1158)**. Las tareas son genuinamente agénticas: **~31 turnos por tarea** de media en **1,999 enfrentamientos**. La misma clasificación se mantiene en el **Artificial Analysis Intelligence Index** (1.º entre los modelos de pesos abiertos), el **Agentic Index** (n.º 3) y **AA-Briefcase** (n.º 3, por delante de GPT-5.5 xhigh, solo por detrás de Fable 5). Dato destacado: un modelo de **pesos abiertos** bajo **licencia MIT**, **MoE con 753 mil millones de parámetros / 40 mil millones activos**, **contexto de 1M de tokens**, con un precio de **$1.40/$4.40 por 1M de tokens** de entrada/salida, rivaliza con la frontera propietaria en trabajo agéntico — un avance real para los modelos abiertos.

#GLM-5.2#Z.ai#Zhipu AI

Artificial Analysis (@ArtificialAnlys)

Investigación y Educación Traducción verificada automáticamente

Diffusion Language Models Explained: How Google's Diffusion Gemma Works

Artículo educativo del **MindStudio Team** (blog de la plataforma MindStudio, orquestación de flujos de trabajo multimodelo) que explica los **modèles de langage par diffusion** (*Diffusion Language Models*) a través del caso de **Diffusion Gemma**, la primera implementación de **open weights** de Google (2.000 millones de parámetros, derivada de Gemma 2). La tesis: mientras que los modelos **autoregressive** (GPT-4, Claude, Gemma estándar) generan texto **token a token, de izquierda a derecha** (atención **causal**, cada token fijado una vez producido), los modelos de **diffusion** parten de una secuencia **enmascarada/con ruido** y la **refinan iterativamente** (masked diffusion / *absorbing diffusion*), con **atención bidireccional**: el modelo puede **revisar cualquier posición en cualquier paso**. Consecuencias: alto **paralelismo** (un texto de 500 tokens requeriría 50-100 pasos de eliminación de ruido en lugar de 500 pasadas secuenciales), **infilling** natural y **generación restringida** (relleno de plantillas, completado de código con contexto circundante), y capacidad de **revisión** integrada. Pero a la escala actual (2B), Diffusion Gemma **no iguala** a los grandes modelos autoregresivos (GPT-4o, Gemini 1.5 Pro) en razonamiento, seguimiento de instrucciones y conocimiento general: la brecha se está "cerrando" sin estar cerrada. La inspiración proviene de la generación de imágenes (Stable Diffusion, DALL-E abandonaron la autorregresión hace años); si el mismo principio se sostiene para el texto sigue siendo una pregunta abierta. Diffusion Gemma se distribuye en Hugging Face (Google DeepMind), AI Studio y Vertex AI.

#modèles de langage par diffusion#Diffusion Gemma#Google DeepMind

MindStudio Team