Saltar al contenido

root / tags / human-in-the-loop

#human-in-the-loop

6 fiches

Calidad y Seguridad Traducción verificada automáticamente

GLM-5.3: Frontier Coding with Emergent Cyber Capabilities

Publicación de anuncio publicada en el **blog oficial de Z.ai** (antes Zhipu AI, laboratorio chino) el **14 de agosto de 2026**, **sin firma individual**, ~2.000 palabras más notas al pie. Anuncia **GLM-5.3**, sucesor de GLM-5.2, y se abre con una tesis metodológica: *« Scaling post-training is all we did for GLM-5.3. »* Mismo modelo base que GLM-5.2 — *« every gain comes from post-training »*. Tres anuncios. **(A) Un modelo de codificación de pesos abiertos**: +50% reivindicado en **Z.ai Code Bench**, un benchmark interno no publicado. **(B) Una capacidad cibernética presentada como "emergente"**, que el cuerpo del texto atribuye a una decisión de entrenamiento — *« As part of post-training, we introduced vulnerability discovery data and environments into the training mix. We expected this to make the model better at finding and reasoning about vulnerabilities »* — lo que resultó sorprendente fue la velocidad y el cambio de naturaleza: el modelo pasa de identificar fallos aislados a *« coherent plans for complete exploitation chains »*. Las ganancias crecen con la posición en la cadena de explotación: CyberGym 77,2 → **84,5%**, ExploitBench 24,4 → **54,4%** (×2,2), ExploitGym 29 → **105** tareas en 2h (×3,6), con una brecha frente a la frontera cerrada que sigue siendo amplia (181 y 247 tareas). Z.ai lo formula así: *« Capability is growing fastest exactly where we are furthest behind. »* La publicación también difunde un **Z.ai Security Disclosure Ledger**: **2.436 vulnerabilidades identificadas en 269 proyectos de código abierto** — núcleos, sistemas operativos, motores de navegador, infraestructura, aplicaciones web, protocolos de red — la más antigua introducida en **1981**, vida media antes del descubrimiento de **26,6 años**, de las cuales **53 divulgadas** y **2.383 bajo embargo**. **(C) Una publicación de los pesos** *« within two weeks of launch, once safety evaluation and hardening are complete »*. El aporte metodológico más reutilizable: la **síntesis de entornos y verificadores**, esta última producida sin acceso a la solución de referencia y admitida solo tras un tríptico de controles negativos — **oracle**, **no-op**, **unsolved-state**. Todas las evaluaciones agénticas se realizan **en Claude Code 2.1.207**.

#GLM-5.3#GLM-5.2#Z.ai

**Z.ai** (anciennement **Zhipu AI**) · laboratoire d'IA chinois · éditeur de la famille **GLM**. Billet **institutionnel et non signé** : aucun auteur nommé · aucun chercheur mis en avant · aucun lien vers un rapport technique ou une carte de modèle. Publié le **14 août 2026**. La page est une SPA React — le HTML servi est un `<div id="root">` vide · et le texte comme les scores ont dû être extraits du bundle `glm-5.3-BCnx8T5_.js` · où ils figurent en valeurs source.

Agentes de codificación IA y Skills Traducción verificada automáticamente

3 Key Product Development Loops (The Batch, Issue 359 — « Dear friends » letter)

Carta «Dear friends» de Andrew Ng en *The Batch* (DeepLearning.AI, número 359) sobre **loop engineering** aplicado al desarrollo de producto **0-to-1**. Ng comparte sus **3 bucles clave** — bucle de codificación agéntica (~minutos), bucle de feedback del desarrollador (~horas), bucle de feedback externo (~días) — anidados por escala temporal creciente, conectando *agente de codificación → especificación de producto/evals → visión del desarrollador → feedback externo*. Tesis central: los humanos conservan una **ventaja de contexto** (más que un «gusto») que hace indispensable el human-in-the-loop; los ingenieros asumen un rol parcial de gestión de producto. Ámbito: agentes de codificación, ingeniería de producto, metodología agéntica.

#Loop engineering#desarrollo de producto#bucle de codificación agéntica

Andrew Ng

Agentes de codificación IA y Skills Traducción verificada automáticamente

BYO Agent with M5Stack Stick 3

Artículo de trasteo dominical de **Mark Dembo** (Head of Solutions, Developer Platform & AI en **Cloudflare**) publicado el **7 de junio de 2026** en su blog personal. **Narrativa**: inspirado por **Steve Ruiz**, el autor compra un pequeño dispositivo **M5Stack Stick 3** (~30 €) y, aprovechando el lanzamiento de **Opus 4.8**, se construye un **agente de IA DIY** «por pura curiosidad, sin ningún objetivo». **Iteración 1 (45 min)**: pasa la documentación del dispositivo a **Claude Code**, que genera scripts en Python (~200 LOC, *«zero blast radius»*) que muestran el tiempo en Múnich, luego en varias ciudades; un backend de **Cloudflare Workers + Workers AI** añade **texto a voz (TTS)**, **push-to-talk** (voz a texto) y un **small LLM** central para responder preguntas. **Iteración 2 (un agente real)**: cambio de los endpoints REST a transporte **WebSocket** mediante el **Cloudflare Agents SDK** + **Dynamic Worker execution** → el patrón ***«Code Mode»*** (el agente escribe y ejecuta código para llevar a cabo su tarea). El agente responde entonces a preguntas sobre datos públicos (11! = factorial, el ganador de la Champions League mediante `fetch()` en Wikipedia, el tiempo en cualquier ciudad). **Iteración 3 (poderes reales)**: conexión a **Todoist** mediante un flujo **MCP OAuth** → 50 herramientas de golpe, de donde surgen dos problemas: **sobrecarga de contexto** y **riesgo real de daño**. La solución se apoya en el **MCP Server Portal** de Cloudflare + los ajustes de conectores de Claude: por herramienta, **Always allow / Ask for approval / Disable** (las herramientas *Disabled* nunca entran en el contexto; un **clasificador LLM** solo acepta autorizaciones «allow» explícitas y **deniega por defecto**). **Postura declarada**: reduce su papel al de ***«generador de ideas, ejecutor y juez»*** (y, en raras ocasiones, guía técnico), un flujo «human-in-the-loop» que considera poco *«2026»* (copiar y pegar en UIFlow). **Lo que NO hizo**: ninguna optimización de latencia/streaming, ninguna llamada LLM optimista, ningún eval, ***«Ni siquiera miré el código una sola vez.»*** **Asombro**: 30 € + una ventana de sesión de Anthropic + unos céntimos de inferencia de Cloudflare → un objeto que escucha y habla, gobernado en lenguaje natural; *«el verdadero desbloqueo está en lo accesible que es.»* Marcado contraste con [[thomas-pragdave-failing-faster-code-rot-ai-velocity-2026-06-06]] (aquí *«zero blast radius»* justifica no mirar nunca el código); ilustra concretamente *Code Mode* / *«el agente simplemente escribiendo y ejecutando código,»* el patrón **MCP** ([[claude-skills-bigger-than-mcp-willison-2025-10-16]]), la gobernanza de herramientas al estilo *Ask for approval* (uber-engineering-agent-identity-crisis-zero-trust-spire-2026-05-21), y la doctrina de los *sistemas en torno al modelo* de dropbox-okumura-beyond-code-generation-engineering-productivity-ai-agents-2026-05-28.

#BYO agent#trae tu propia IA#trasteo

**Mark Dembo** (@darkmembo / @mdembo) · **Head of Solutions – Developer Platform & AI** chez **Cloudflare** (auparavant auteur sur le blog Cloudflare). Billet personnel publié sur son blog *markpauldembo.com* le **7 juin 2026** (description : *« Thoughts about tinkering on a Sunday »*).

Agentes de codificación IA y Skills Traducción verificada automáticamente

the 2026 ai engineer roadmap

Hilo de X en formato manifiesto de Rohit (@rohit4verse) que expone la *2026 AI engineer roadmap*: una brecha de 150.000 $ entre el prompt engineer y el systems architect, el fin de los *wrappers genéricos* «sherlocked por las grandes tecnológicas», y 5 proyectos de portafolio clasificados por nivel de complejidad (SLM móvil offline, agente de codificación autoperfectible, *Cursor for video editors* multimodal, agente de sistema operativo de vida personal centrado en la privacidad, agente autónomo de flujos de trabajo empresariales). Cada proyecto describe sus *decisiones arquitectónicas clave* (lazy loading, sliding window, sandboxing, detección de escenas, grafo de conocimiento personal, multiagente basado en eventos, registro de auditoría, RBAC, observabilidad). Eslogan estructurante: *«lo reemplazable: construir wrappers / lo indespedible: desplegar sistemas autónomos»*. Tono imperativo y viral, típico de X en 2026.

#2026 AI engineer roadmap#Rohit#rohit4verse

Rohit (@rohit4verse) — créateur de contenu IA sur X · vulgarisateur d'architecture et roadmaps de carrière en ingénierie IA.

Transformación y Adopción Traducción verificada automáticamente

Three Years from GPT-3 to Gemini 3

Ethan Mollick - Evolución de la IA en 3 años de GPT-3 a Gemini 3 - De Chatbots a Agentes - El Código como Interfaz Universal - Inteligencia de Nivel Doctorado - Human-in-the-loop Antigravity

#GPT-3#Gemini 3#evolución de la IA

Ethan Mollick

Estrategia y Frameworks Traducción verificada automáticamente

The Gen AI Playbook for Organizations

IA générative marco estratégico - 4 cuadrantes de despliegue - Paradoja del acceso - Datos como foso - Diferenciación estratégica - Harvard Business Review - Bharat N. Anand - Andy Wu

#estrategia de IA générative#ventaja competitiva#marco de cuatro cuadrantes

Bharat N. Anand (NYU Stern School of Business Dean) · Andy Wu (Harvard Business School)