Andy Warfield, ingeniero del equipo de S3 en AWS, publicó un artículo de invitado en All Things Distributed el 26 de agosto de 2026, presentado por Werner Vogels. En él explica por qué los motores analíticos embebidos como DuckDB están cobrando importancia, y anuncia que DuckLabs, el equipo que desarrolla DuckDB, se incorpora a AWS.

Su marco de lectura es el de una «física» cambiante. Donde las ciencias físicas exploran invariantes, la informática de sistemas busca el compromiso elegante frente a proporciones que se desplazan: velocidad de memoria frente a velocidad de red, riqueza de las abstracciones frente a la potencia disponible. Cita tres momentos —el proyecto NOW de Berkeley, su propio trabajo en Xen, y la investigación sobre MonetDB y X100 en el CWI de Ámsterdam, donde el cuello de botella del procesamiento de consultas había pasado del disco a la CPU— y señala que estas restricciones reaparecen en ciclos.

Puedes tener una segunda computadora una vez que hayas demostrado que sabes usar la primera.

Andy Warfield , allthingsdistributed.com

Aplicado a los datos, este marco explica el procesamiento distribuido. El procesamiento siempre es más simple y eficiente en una sola máquina rápida, pero cuando el disco o la tarjeta de red de un servidor ya no puede leer el volumen deseado, se particiona. Esa fue la restricción de principios de la década de 2000, la que produjo MapReduce y luego los RDD de Spark. Warfield señala dos cualidades de estos sistemas: innovaron mucho en la ergonomía para el desarrollador, y aceptaron un costo fijo de planificación y distribución, apostando por el rendimiento ganado al añadir máquinas en lugar de por la eficiencia por unidad.

Pero las proporciones han cambiado. Una instancia actual ofrece aproximadamente cincuenta veces más memoria, núcleos y ancho de banda de red que la mayor instancia EC2 de 2007, mientras que el crecimiento de los conjuntos de datos sigue una distribución cuyos casos extremos forman la cola. El artículo Scalability! But at what COST? de 2015 ya había demostrado que una implementación de un solo hilo cuidadosamente optimizada podía superar a los marcos distribuidos que se ejecutaban en ciento veintiocho núcleos.

DuckDB, lanzado en 2018 por Hannes Mühleisen y Mark Raasveldt, aplica esta lógica: un motor analítico de tipo biblioteca en proceso, que se ejecuta en el espacio de direcciones de la aplicación, siguiendo el modelo de distribución de SQLite. AWS se convirtió en cliente de DuckLabs y luego en patrocinador de la extensión Iceberg de DuckDB, junto con su trabajo en S3 Tables; la extensión ahora es compatible con Iceberg v2 y v3 y supera las 800 000 descargas semanales.

Warfield no presenta el modelo embebido como un reemplazo: cuando un trabajo requiere mil máquinas, las requiere. Lo que está cambiando, escribe, es que buena parte del trabajo que se hace con datos en realidad nunca necesitó un clúster. DuckLabs se incorpora a AWS como subsidiaria, y el proyecto sigue siendo de código abierto bajo la licencia MIT y bajo la tutela de la DuckDB Foundation.