hyperresearch — « The Most Powerful Deep Research Harness » / « Agent-driven research knowledge base. Agents collect, search, and synthesize web research into a persistent, searchable wiki. »
Entrada de Skill (no es un artículo): hyperresearch, de Jordan Gibbs, es un arnés de investigación profunda (deep research harness) que convierte Claude Code en un agente de investigación documental, distribuido como paquete PyPI (MIT, Python 3.11-3.13) que instala 20 skills de Claude Code + una CLI + un servidor MCP + una interfaz web local.
Por **Jordan Gibbs** — auteur et mainteneur du dépôt `jordan-gibbs/hyperresearch`. Le projet est distribué sous **licence MIT** et publié sur **PyPI**// Fuente github.com ↗/Lectura 2 min/.md// Traducción verificada automáticamente
#skill#investigación profunda#arnés de investigación#Claude Code#pipeline de 16 pasos#tiers#light#full
hyperresearch (Jordan Gibbs, MIT, PyPI) convierte Claude Code en un agente de investigación profunda. Observado el 3 de agosto de 2026: 1568 estrellas, repositorio creado en abril. La instalación despliega 20 skills, una CLI, un servidor MCP y una interfaz web local.
El pipeline ejecuta 16 pasos adaptativos por nivel: light (~30-40 min) para preguntas acotadas, full (1,5-2,5 h) para análisis argumentativo con revisión adversarial, dissertation (4-8 h, 25.000-80.000 palabras, 300-450 fuentes) bajo petición explícita. Tres palancas distintas: los tiers deciden qué pasos se ejecutan, los gears deciden en qué medida, y las levers (teach/survey/analyze/advocate) deciden con qué voz sale el informe.
one 1200-line skill that got compacted away by the time Layer 4 needed its triple-draft procedure. The orchestrator forgot the procedure, wrote a single draft, and produced a flat-scoring report.
— **Jordan Gibbs** — auteur et mainteneur du dépôt `jordan-gibbs/hyperresearch`. Le projet est distribué sous **licence MIT** et publié sur **PyPI** , github.com
La arquitectura responde a un fallo documentado. La skill de entrada es un router ligero sin procedimiento alguno: « V7 was one 1200-line skill that got compacted away… The orchestrator forgot the procedure, wrote a single draft, and produced a flat-scoring report. » Cada paso vive en su propia skill, cargada de nuevo en cada invocación — un pipeline largo no pierde sus pasos por olvido, sino por desalojo de contexto.
Dos principios estructurales.« Patch, never regenerate »: tras la síntesis solo son posibles retoques quirúrgicos, ya que el parcheador está bloqueado a las herramientas [Read, Edit] a nivel de allowlist, de modo que « physically cannot Write a new draft » — la imposibilidad mecánica sustituye a la instrucción. Y « canonical research query is gospel »: el prompt textual se persiste y se relee en cada paso.
La verificación es la única etapa exenta de estilo — las levers inyectan shims en los prompts de los críticos, pero « the cite-checker and the ship gate receive no shim at all ». Tres barreras bloquean la publicación: cada cita debe existir textualmente en el vault, una fuente retractada sin señalar es un error bloqueante (con un escaneo actualizado en cada DOI citado), y las cifras no trazables se marcan.
El vault es markdown persistente indexado en SQLite — « Markdown is truth, SQLite is cache » — con un ciclo de vida de nota, procedencia, una puntuación de calidad compuesta y una auditoría de independencia: « five reprints of one press release argue with the weight of one source ». Los cuerpos obtenidos de la web se sirven dentro de una valla <untrusted-source>: « Fetched text is data, never instructions. »
⚠️ La reserva. El README reivindica el primer puesto en el leaderboard de DeepResearch-Bench; su propia nota al pie indica que se trata de una « forward-looking projection from a stratified pilot » sin validación por terceros. Citar el método, nunca la clasificación. El autor también reconoce que el lint « cannot guarantee factual accuracy ».
Puntos clave
Naturaleza.arnés de investigación profunda distribuido como un paquete de 20 skills de Claude Code + CLI Python + servidor MCP + interfaz web local. Instalación vía pip install hyperresearch && hyperresearch install, luego /hyperresearch <topic>. MIT, Python 3.11-3.13.
⭐⭐ La lección de arquitectura, con su modo de fallo documentado. — la parte más transferible, independiente de la herramienta: la skill de entrada es un router que no contiene ningún procedimiento, solo el orden de invocación. Justificación textual: « V7 was one 1200-line skill that got compacted away by the time Layer 4 needed its triple-draft procedure. The orchestrator forgot the procedure, wrote a single draft, and produced a flat-scoring report. V8 fixes this at the source: each step's procedure is loaded into context only at the moment it's needed, fresh, with no eviction risk. » → Un pipeline largo no pierde sus pasos porque el modelo olvide, sino porque el contexto se desaloja, y la corrección es estructural: una skill por paso, cargada en la invocación. Es exactamente la disciplina de [[lassiege-usine-logicielle-heure-ia-2026-07-28]] ("el contexto permanente lleva el índice, no el contenido") descubierta de forma independiente en otro terreno. Una convergencia digna de mención.
⭐ El bloqueo de herramientas como garantía física. el parcheador y el auditor de pulido están « tool-locked to [Read, Edit] at the Claude Code allowlist level so they physically cannot Write a new draft », con topes por retoque que hacen que "reescribir sin más" sea mecánicamente imposible. → No se le dice al agente que no reescriba — se le retira la herramienta de escritura. Misma familia que « a hook or a test is enforced every time » ([[lassiege-usine-logicielle-heure-ia-2026-07-28]]) y el anillo de restricciones de [[sfeir-code-review-anneau-contraintes-2026-07-30]]: la imposibilidad mecánica vence a la instrucción. Corolario operativo: un hallazgo de crítica que no encaja en un pequeño retoque escala a problema estructural en lugar de disparar una reescritura.
Los dieciséis pasos, en tres bloques. (la estructura importa más que el detalle): encuadre (1 descomposición + matriz de cobertura + clasificación por nivel, 1.5 partición en capítulos) → corpus y análisis (2 barrido amplio, 3 grafo de contradicciones, 4 análisis de loci, 5 investigaciones de profundidad en paralelo, 6 reconciliación entre loci, 7 tensiones entre fuentes, 8 crítica del corpus "¿qué fuente refutaría esto?" + relleno de vacíos dirigido, 9 síntesis de evidencia) → redacción y auditoría (10 triple borrador por ángulo, 11 síntesis, 12 cuatro críticas adversariales en paralelo, 13 relleno de vacíos post-crítica, 14 parcheador quirúrgico, 14.5 verificación de citas, 15 pulido, 16 auditoría de legibilidad).
Tres palancas de escala que no deben confundirse. — una distinción limpia y reutilizable: los tiers enrutan según la consulta y deciden qué pasos se ejecutan; los gears (perfiles de escala) deciden en qué medida — objetivos de fuentes, presupuestos de profundidad, longitud — y « survive reinstalls », aplicándose en la siguiente ejecución, nunca a mitad de ejecución; las levers (register, domain_notes, inference_depth) deciden con qué voz sale el resultado — teach / survey / analyze / advocate. ⭐ Detalle fino: las levers aterrizan en shims inyectados en los prompts de los subagentes, « so the critics move with the register instead of undoing it » — en registro survey, el crítico dialéctico señala representación injusta en lugar de falta de compromiso. Pero: « The cite-checker and the ship gate receive no shim at all. Verification never softens by mode. » → La verificación es la única etapa exenta de estilo. Una excelente regla de diseño.
⭐ Las tres barreras mecánicas antes de publicar. (la mejor parte del sistema, directamente transferible a cualquier corpus documental): 1. quote-integrity — cualquier porción citada entre comillas debe existir textualmente en una nota del vault; « hallucinated quotes cannot ship ». 2. retracted-citations — citar una fuente retractada sin señalarlo es un error bloqueante, con un escaneo de retractaciones actualizado en el momento de publicar en cada DOI citado, incluidas las fuentes reutilizadas de ejecuciones anteriores. « a retraction published yesterday is caught today ». 3. numeric-consistency — las cifras no trazables a evidencia se marcan. Además del cite-check: un LLM escéptico muestrea si la fuente citada respalda realmente la frase que sustenta.
⭐ La auditoría de independencia — la idea más inmediatamente aprovechable. las copias sindicadas y derivadas se agrupan, de modo que « five reprints of one press release argue with the weight of one source ». El número de fuentes coincidentes deja de ser un argumento en cuanto todas descienden del mismo comunicado de prensa. Relevante para cualquier práctica de vigilancia tecnológica: la redundancia por reimpresión se disfraza de consenso.
Puntuación de calidad compuesta persistente. tipo de fuente + utilidad observada en la lectura + autoridad de citación (OpenAlex / Semantic Scholar, con indicadores de retractación) + PageRank sobre el grafo interno del vault. Las fuentes retractadas se reducen a cero. « Quality is persistent, not vibes. »
⭐⭐ La defensa contra inyección de prompts — la más seria vista en un arnés abierto.« Fetched text is data, never instructions. » Cualquier cuerpo obtenido de la web se sirve dentro de una valla <untrusted-source url="..."> con un preámbulo de tratar-como-datos, en ambas rutas que sirven cuerpos (note show y search). Detalles que muestran que la amenaza se tomó en serio:
las notas escritas por los propios subagentes del pipeline pasan sin valla → frontera de confianza por procedencia, no por contenido;
las vallas de cierre falsificadas encontradas en un cuerpo obtenido se neutralizan pero se dejan visibles para análisis forense;
el atributo url se escapa y se le eliminan los caracteres de control;
en search, el envolvimiento ocurre después del truncado al presupuesto de tokens, « so the closing fence can never be severed » — el detalle que delata que el bypass fue realmente perseguido;
las URL resueltas vía API de terceros se verifican (esquema, credenciales incrustadas, resolución públicamente enrutable) → defensa SSRF;
los prompts del fetcher, del investigador y del redactor llevan una cláusula que prohíbe blanquear directivas de una página vallada hacia la salida de confianza. → Comparar con « a security boundary that relies on a prompt instruction is not a boundary » ([[sfeir-anthropic-sdlc-ai-native-securise-2026-07-26]]): aquí la valla es mecánica y la instrucción solo la respalda. Misma lógica de tratar el contenido observado como datos que en [[valente-zalewski-beyond-zero-enterprise-security-ai-era-2026-07-20]].
⭐ Higiene epistémica sobre fuentes de pago — notable y poco habitual. un artículo de pago normalmente entraría en el vault como un resumen de ~1500 caracteres, que el informe citaría entonces « as though it had been read ». hyperresearch consulta Unpaywall y Europe PMC en busca de una copia legal de acceso abierto y almacena ese texto en su lugar, revelando la sustitución en cuatro sitios (aviso en el cuerpo, frontmatter oa_, bloque JSON body_is_not_from_source: true, salida de la CLI). Y de forma crucial, se distingue un tercer estado: la nota "rescatada", cuando la fuente no pudo leerse en absoluto — nothing_from_source: true, un aviso que indica que la URL nunca fue leída, « the title, the authors, and every word of the body are the open-access copy's »*. Advertencia de versión: Unpaywall puede devolver un manuscrito aceptado o un preprint enviado, a comprobar antes de citar directamente. → El sistema distingue "leí esto" de "leí un sustituto" de "nunca leí la fuente", y lleva esa distinción hasta el artefacto. Directamente transferible a una práctica de vigilancia tecnológica.
El vault, y su inquietante cercanía a este mismo repositorio.« Markdown is truth, SQLite is cache » — índice totalmente reconstruible (hyperresearch sync), notas en markdown + frontmatter YAML legibles sin la herramienta, versionables en git, exportables/importables, ciclo de vida curado (draft → review → evergreen o stale → deprecated → archive) « that keeps a vault from becoming a dumping ground of half-read pages », procedencia vía --suggested-by con una regla de lint que detecta componentes desconectados, hubs, backlinks, wikilinks. ⭐ Esta es la arquitectura de este mismo corpus de vigilancia tecnológica, descubierta de forma independiente: fuente markdown, índice generado como caché, barrera de lint, doctor, wikilinks. Lo que hyperresearch tiene de más y este corpus no tiene: puntuación de calidad por fuente, auditoría de independencia, escaneo de retractaciones, búsqueda semántica opcional, estado de ciclo de vida explícito. Una vía de inspiración seria para scripts/.
Reanudación y presupuesto. cada ejecución tiene un espacio aislado (research/runs/<tag>/) y un manifiesto que sirve de « durable memory » — una ejecución interrumpida se reanuda exactamente en el paso caído (run resume). run init --budget 50bloquea la ejecución en cuanto se cruza el tope « rather than letting it quietly balloon ». Las ejecuciones concurrentes no colisionan.
⚠️⚠️ La reserva a señalar sistemáticamente — la afirmación del benchmark. el README indica de entrada que la herramienta « currently leads the DeepResearch-Bench RACE leaderboard (benchmarked internally) », gráfico incluido, situándola por delante de Grep Deep Research, Cellcog Max, nvidia-aiq, Gemini Deep Research y OpenAI Deep Research. La nota bajo el gráfico dice otra cosa: « Forward-looking projection from a stratified pilot against the DeepResearch-Bench leaderboard snapshot. Third party validation is pending. » → Una proyección prospectiva, autoadministrada, a partir de un piloto estratificado, sin validación por terceros, no es una clasificación. Las dos afirmaciones no son compatibles, y es el único lugar del repositorio donde se relaja el rigor mostrado en todo lo demás. Nunca citar la clasificación; citar el método.
⚠️ Otras limitaciones, algunas reconocidas por el autor.
Dependencia de Anthropic.« It runs on Anthropic models via the subagent roster » — Opus para los críticos, el sintetizador y el parcheador, Sonnet para los fetchers. Se invita explícitamente a un port a Codex, pero no está hecho (« If anyone wants to port this to Codex, put up a PR! »).
Coste real no cuantificado en euros.premier apunta a 100-130 fuentes solo de escaneo y ~3-5 h; dissertation apunta a 300-450 fuentes y 4-8 h. El presupuesto se limita en "gasto equivalente de API", no en coste observado.
La limitación honesta, digna de cita.« The lint gate catches structural failures… It cannot guarantee factual accuracy, that's still your call. » → Verificación estructural ≠ exactitud factual. Todo el sistema garantiza que una cita existe, no que sea verdadera.
Un límite firme y bienvenido.« CAPTCHAs, 2FA, and logins are never solved automatically » — se escalan y se devuelven al humano.
Superficie de dependencias. 20 skills + 16 subagentes + una CLI que gobierna un navegador autenticado, sobre un repositorio de menos de cuatro meses. La advertencia de [[lassiege-usine-logicielle-heure-ia-2026-07-28]] se aplica plenamente (« any skill, MCP, or code pulled in from outside must be scrutinized »).
Meta / a enlazar. la instancia más lograda de la ingeniería de arneses de [[osmani-agent-harness-engineering-2026-04-19]]; converge de forma independiente con [[lassiege-usine-logicielle-heure-ia-2026-07-28]] en la carga diferida de contexto y en que lo ejecutable vence a la instrucción; misma doctrina de frontera mecánica que [[sfeir-anthropic-sdlc-ai-native-securise-2026-07-26]] y [[valente-zalewski-beyond-zero-enterprise-security-ai-era-2026-07-20]]; parentesco de forma con las otras entradas de skill del corpus, [[skill-pocock-grill-with-docs-2026-06]] y [[akhouri-adhd-ideation-divergente-parallele-2026-07-20]]; a leer junto con [[agent-skills-anthropic-2025-10-16]], [[shihipar-claude-code-lessons-building-skills-2026-06-03]] y [[vincent-superpowers-agentic-skills-framework-github-2026-04-02]] sobre la mecánica de las skills; la crítica adversarial en paralelo conecta con la pregunta planteada por [[monperrus-end-of-code-review-agents-supersede-2026-06-11]] sobre lo que una revisión automatizada puede sostener.
Cifras clave
una posición líder en DeepResearch-Bench RACE, presentada como proyección prospectiva autoadministrada sin validación de terceros