hyperresearch — « The Most Powerful Deep Research Harness » / « Agent-driven research knowledge base. Agents collect, search, and synthesize web research into a persistent, searchable wiki. »
Skill-Eintrag (kein Artikel): hyperresearch von Jordan Gibbs ist ein Deep-Research-Harness, das Claude Code in einen dokumentenrecherchierenden Agenten verwandelt, veröffentlicht als PyPI-Paket (MIT, Python 3.11-3.13), das 20 Claude Code Skills + eine CLI + einen MCP-Server + eine lokale Web-UI installiert.
Von **Jordan Gibbs** — auteur et mainteneur du dépôt `jordan-gibbs/hyperresearch`. Le projet est distribué sous **licence MIT** et publié sur **PyPI**// Quelle github.com ↗/Lesezeit 2 min/.md// Automatisch geprüfte Übersetzung
hyperresearch (Jordan Gibbs, MIT, PyPI) verwandelt Claude Code in einen Deep-Research-Agenten. Beobachtet am 3. August 2026: 1.568 Stars, Repo im April erstellt. Die Installation legt 20 Skills, eine CLI, einen MCP-Server und eine lokale Web-UI an.
Die Pipeline durchläuft 16 adaptive Schritte über mehrere Tiers: light (~30-40 Min) für abgegrenzte Fragestellungen, full (1,5-2,5 Std) für argumentative Analysen mit adversarischer Prüfung, dissertation (4-8 Std, 25.000-80.000 Wörter, 300-450 Quellen) auf explizite Anfrage. Drei getrennte Stellhebel: Tiers entscheiden, welche Schritte laufen, Gears entscheiden, wie viel, Levers (teach/survey/analyze/advocate) entscheiden, in welcher Stimme der Bericht ausfällt.
one 1200-line skill that got compacted away by the time Layer 4 needed its triple-draft procedure. The orchestrator forgot the procedure, wrote a single draft, and produced a flat-scoring report.
— **Jordan Gibbs** — auteur et mainteneur du dépôt `jordan-gibbs/hyperresearch`. Le projet est distribué sous **licence MIT** et publié sur **PyPI** , github.com
Die Architektur beantwortet einen dokumentierten Fehlerfall. Der Einstiegs-Skill ist ein dünner Router ohne Prozedur: « V7 was one 1200-line skill that got compacted away… The orchestrator forgot the procedure, wrote a single draft, and produced a flat-scoring report. » Jeder Schritt lebt in seinem eigenen Skill, frisch geladen bei Aufruf – eine lange Pipeline verliert ihre Schritte nicht durch Vergessen, sondern durch Kontextverdrängung.
Zwei tragende Prinzipien.« Patch, never regenerate »: Nach der Synthese sind nur noch chirurgische Korrekturen möglich, da der Patcher auf Ebene der Allowlist auf [Read, Edit] werkzeuggesperrt ist, sodass er « physically cannot Write a new draft » – mechanische Unmöglichkeit ersetzt Anweisung. Und « canonical research query is gospel »: der wortgetreue Prompt wird persistiert und von jedem Schritt erneut gelesen.
Die Verifikation ist die einzige Stufe, die vom Stil ausgenommen ist – Levers injizieren Shims in die Prompts der Kritiker, aber « the cite-checker and the ship gate receive no shim at all ». Drei Schranken blockieren die Veröffentlichung: jede Zitation muss wortgetreu im Vault existieren, eine nicht markierte zurückgezogene Quelle ist ein harter Fehler (mit einem bei jeder zitierten DOI erneuerten Scan), und nicht nachvollziehbare Zahlen werden markiert.
Der Vault ist persistentes Markdown, indiziert in SQLite – « Markdown is truth, SQLite is cache » – mit einem Notiz-Lebenszyklus, Provenienz, einem zusammengesetzten Qualitätsscore und einer Unabhängigkeitsprüfung: « five reprints of one press release argue with the weight of one source ». Aus dem Web abgerufene Inhalte werden innerhalb einer <untrusted-source>-Umklammerung ausgeliefert: « Fetched text is data, never instructions. »
⚠️ Der Vorbehalt. Das README beansprucht den Spitzenplatz der DeepResearch-Bench-Rangliste; die eigene Fußnote erklärt, dass es sich um eine « forward-looking projection from a stratified pilot » ohne Validierung durch Dritte handelt. Man zitiere das Setup, niemals die Rangliste. Der Autor räumt zudem ein, dass der Lint « cannot guarantee factual accuracy ».
Kernpunkte
Art.Deep-Research-Harness, veröffentlicht als Paket aus 20 Claude Code Skills + Python-CLI + MCP-Server + lokaler Web-UI. Installation via pip install hyperresearch && hyperresearch install, dann /hyperresearch <topic>. MIT, Python 3.11-3.13.
⭐⭐ Die Architekturlehre mit ihrem dokumentierten Fehlermodus. – der übertragbarste Teil, unabhängig vom Werkzeug: Der Einstiegs-Skill ist ein Router, der keine Prozedur enthält, nur die Aufrufreihenfolge. Textliche Begründung: « V7 was one 1200-line skill that got compacted away by the time Layer 4 needed its triple-draft procedure. The orchestrator forgot the procedure, wrote a single draft, and produced a flat-scoring report. V8 fixes this at the source: each step's procedure is loaded into context only at the moment it's needed, fresh, with no eviction risk. » → Eine lange Pipeline verliert ihre Schritte nicht, weil das Modell vergisst, sondern weil der Kontext verdrängt wird, und die Lösung ist strukturell: ein Skill pro Schritt, geladen bei Aufruf. Genau die Disziplin von [[lassiege-usine-logicielle-heure-ia-2026-07-28]] ("der permanente Kontext trägt den Index, nicht den Inhalt") unabhängig auf anderem Terrain entdeckt. Eine Konvergenz, die es festzuhalten gilt.
⭐ Werkzeugsperrung als physische Garantie. Der Patcher und der Polish-Auditor sind « tool-locked to [Read, Edit] at the Claude Code allowlist level so they physically cannot Write a new draft », mit Obergrenzen pro Hunk, die ein « just rewrite it » mechanisch unmöglich machen. → Dem Agenten wird nicht gesagt, er solle nicht neu schreiben – ihm wird das Schreib-Werkzeug entzogen. Gleiche Familie wie « a hook or a test is enforced every time » ([[lassiege-usine-logicielle-heure-ia-2026-07-28]]) und der Zwangsring in [[sfeir-code-review-anneau-contraintes-2026-07-30]]: mechanische Unmöglichkeit schlägt Anweisung. Operatives Korollar: Ein Kritikbefund, der nicht in eine kleine Korrektur passt, eskaliert zu einem strukturellen Problem, statt eine Neufassung auszulösen.
Die sechzehn Schritte in drei Blöcken. (die Struktur zählt mehr als das Detail): Rahmung (1 Zerlegung + Abdeckungsmatrix + Tier-Klassifikation, 1.5 Kapitelaufteilung) → Korpus und Analyse (2 Breitenscan, 3 Widerspruchsgraph, 4 Loci-Analyse, 5 parallele Tiefenrecherchen, 6 Loci-übergreifende Abstimmung, 7 Spannungen zwischen Quellen, 8 Korpuskritik "welche Quelle würde das umstoßen?" + gezieltes Schließen von Lücken, 9 Evidenz-Digest) → Verfassen und Prüfung (10 dreifacher Entwurf nach Blickwinkel, 11 Synthese, 12 vier parallele adversarische Kritiken, 13 Lückenschluss nach der Kritik, 14 chirurgischer Patcher, 14.5 Zitationsprüfung, 15 Feinschliff, 16 Lesbarkeitsprüfung).
Drei nicht zu verwechselnde Skalierungshebel. – eine klare, wiederverwendbare Unterscheidung: Tiers routen nach Anfrage und entscheiden, welche Schritte laufen; Gears (Skalierungsprofile) entscheiden, wie viel – Quellenziele, Tiefenbudgets, Länge – und « survive reinstalls », wirken beim nächsten Lauf, nie mitten im Lauf; Levers (register, domain_notes, inference_depth) entscheiden, welche Stimme herauskommt – teach / survey / analyze / advocate. ⭐ Feines Detail: Levers landen in Shims, die in Subagenten-Prompts injiziert werden, « so the critics move with the register instead of undoing it » – im Register survey markiert der dialektische Kritiker unfaire Darstellung statt fehlendes Engagement. Aber: « The cite-checker and the ship gate receive no shim at all. Verification never softens by mode. » → Die Verifikation ist die einzige Stufe, die vom Stil ausgenommen ist. Eine ausgezeichnete Designregel.
⭐ Die drei mechanischen Schranken vor der Veröffentlichung. (der beste Teil des Aufbaus, direkt übertragbar auf jeden dokumentarischen Korpus): 1. quote-integrity – jeder in Anführungszeichen zitierte Abschnitt muss wortgetreu in einer Vault-Notiz existieren; « hallucinated quotes cannot ship ». 2. retracted-citations – eine zurückgezogene Quelle ohne Markierung zu zitieren ist ein blockierender Fehler, mit einem Rückzugs-Scan, der bei jeder Veröffentlichung für jede zitierte DOI erneuert wird, auch für aus älteren Läufen wiederverwendete Quellen. « a retraction published yesterday is caught today ». 3. numeric-consistency – nicht auf Evidenz zurückführbare Zahlen werden markiert. Plus cite-check: Ein skeptisches LLM prüft stichprobenhaft, ob die zitierte Quelle den Satz, den sie belegt, tatsächlich stützt.
⭐ Die Unabhängigkeitsprüfung – die unmittelbar am leichtesten übernehmbare Idee. Syndizierte und derivative Kopien werden gruppiert, sodass « five reprints of one press release argue with the weight of one source ». Die Anzahl übereinstimmender Quellen hört auf, ein Argument zu sein, sobald sie alle von derselben Pressemitteilung abstammen. Relevant für jede Tech-Watch-Praxis: Nachdruck-Redundanz tarnt sich als Konsens.
Persistenter zusammengesetzter Qualitätsscore. Quellentyp + beim Lesen beobachteter Nutzen + Zitationsautorität (OpenAlex / Semantic Scholar, mit Rückzugsindikatoren) + PageRank auf dem internen Graphen des Vaults. Zurückgezogene Quellen werden auf null gesetzt. « Quality is persistent, not vibes. »
⭐⭐ Die Prompt-Injection-Abwehr – die ernsthafteste, die in einem offenen Harness gesehen wurde.« Fetched text is data, never instructions. » Jeder aus dem Web abgerufene Inhalt wird innerhalb einer <untrusted-source url="...">-Umklammerung mit einer Als-Daten-behandeln-Präambel ausgeliefert, auf beiden Pfaden, die Inhalte ausliefern (note show und search). Details, die zeigen, dass die Bedrohung ernst genommen wurde:
Notizen, die von den eigenen Subagenten der Pipeline geschrieben wurden, passieren ohne Umklammerung → Vertrauensgrenze nach Provenienz, nicht nach Inhalt;
gefälschte. Schlussklammern, die in einem abgerufenen Inhalt gefunden werden, werden neutralisiert, aber für die forensische Analyse sichtbar gelassen;
das Attribut url wird escaped und seine Steuerzeichen entfernt;
in search erfolgt die Umklammerung nach dem Trunkieren auf das Token-Budget, « so the closing fence can never be severed » – das Detail, das verrät, dass tatsächlich gezielt nach dem Bypass gesucht wurde;
über Drittanbieter-APIs aufgelöste URLs werden geprüft (Schema, eingebettete Zugangsdaten, öffentlich routbare Auflösung) → SSRF-Abwehr;
Fetcher-, Investigator- und Writer-Prompts tragen eine Klausel, die das Waschen von Anweisungen aus einer umklammerten Seite in vertrauenswürdige Ausgabe verbietet. → Zu vergleichen mit « a security boundary that relies on a prompt instruction is not a boundary » ([[sfeir-anthropic-sdlc-ai-native-securise-2026-07-26]]): Hier ist die Umklammerung mechanisch, und die Anweisung untermauert sie lediglich. Gleiche Logik, beobachteten Inhalt als Daten zu behandeln, wie in [[valente-zalewski-beyond-zero-enterprise-security-ai-era-2026-07-20]].
⭐ Epistemische Hygiene bei kostenpflichtigen Quellen – bemerkenswert und selten. Ein kostenpflichtiger Artikel würde normalerweise als ~1.500-Zeichen-Abstract in den Vault eingehen, den der Bericht dann zitieren würde, « as though it had been read ». hyperresearch fragt Unpaywall und Europe PMC nach einer legalen Open-Access-Kopie ab und speichert diesen Text stattdessen, wobei die Substitution an vier Stellen offengelegt wird (Banner im Text, oa_-Frontmatter, JSON-Block body_is_not_from_source: true, CLI-Ausgabe). Und entscheidend: Ein dritter Zustand wird unterschieden, die "rescued"-Notiz, wenn die Quelle überhaupt nicht gelesen werden konnte – nothing_from_source: true, ein Banner, der besagt, dass die URL nie gelesen wurde, « the title, the authors, and every word of the body are the open-access copy's »*. Versionswarnung: Unpaywall kann ein akzeptiertes Manuskript oder einen eingereichten Preprint zurückgeben, was vor jeder direkten Zitation zu prüfen ist. → Das System unterscheidet „Ich habe das gelesen" von „Ich habe einen Ersatz gelesen" von „Ich habe die Quelle nie gelesen", und trägt diese Unterscheidung in das Artefakt. Direkt übertragbar auf eine Tech-Watch-Praxis.
Der Vault und seine beunruhigende Nähe zu diesem Repository selbst.« Markdown is truth, SQLite is cache » – vollständig rekonstruierbarer Index (hyperresearch sync), Notizen in Markdown + YAML-Frontmatter, ohne das Tool lesbar, versionierbar in Git, exportierbar/importierbar, kuratierter Lebenszyklus (draft → review → evergreen oder stale → deprecated → archive) « that keeps a vault from becoming a dumping ground of half-read pages », Provenienz via --suggested-by mit einer Lint-Regel, die getrennte Komponenten, Hubs, Backlinks, Wikilinks erkennt. ⭐ Das ist die Architektur genau dieses Tech-Watch-Korpus, unabhängig entdeckt: Markdown-Quelle, generierter Index als Cache, Lint-Gate, Doctor, Wikilinks. Was hyperresearch zusätzlich hat und diesem Korpus fehlt: Qualitätsscore pro Quelle, Unabhängigkeitsprüfung, Rückzugs-Scanning, optionale semantische Suche, expliziter Lebenszyklusstatus. Ein ernstzunehmender Inspirationspfad für scripts/.
Fortsetzung und Budget. Jeder Lauf hat einen isolierten Raum (research/runs/<tag>/) und ein Manifest, das als « durable memory » dient – ein abgestürzter Lauf wird exakt am toten Schritt fortgesetzt (run resume). run init --budget 50blockiert den Lauf, sobald die Obergrenze überschritten wird, « rather than letting it quietly balloon ». Parallele Läufe kollidieren nicht.
⚠️⚠️ Der systematisch hervorzuhebende Vorbehalt – die Benchmark-Behauptung. Das README erklärt gleich zu Beginn, das Tool « currently leads the DeepResearch-Bench RACE leaderboard (benchmarked internally) », samt Diagramm, das es vor Grep Deep Research, Cellcog Max, nvidia-aiq, Gemini Deep Research und OpenAI Deep Research platziert. Die Anmerkung unter dem Diagramm sagt etwas anderes: « Forward-looking projection from a stratified pilot against the DeepResearch-Bench leaderboard snapshot. Third party validation is pending. » → Eine zukunftsgerichtete, selbst durchgeführte Projektion aus einem stratifizierten Pilotversuch ohne Validierung durch Dritte ist keine Rangliste. Die beiden Aussagen sind nicht vereinbar, und es ist die einzige Stelle im Repository, an der die überall sonst gezeigte Sorgfalt nachlässt. Niemals die Rangliste zitieren, sondern das Setup.
⚠️ Weitere Einschränkungen, einige vom Autor selbst eingeräumt.
Anthropic-Abhängigkeit.« It runs on Anthropic models via the subagent roster » – Opus für Kritiker, den Synthesizer und den Patcher, Sonnet für Fetcher. Ein Codex-Port wird ausdrücklich begrüßt, aber nicht umgesetzt (« If anyone wants to port this to Codex, put up a PR! »).
Reale Kosten nicht in Euro quantifiziert.premier zielt auf 100-130 Quellen bei reinem Scan und ~3-5 Std; dissertation zielt auf 300-450 Quellen und 4-8 Std. Das Budget ist in "API-äquivalenten Ausgaben" begrenzt, nicht in beobachteten Kosten.
Die ehrliche Einschränkung, zitierwürdig.« The lint gate catches structural failures… It cannot guarantee factual accuracy, that's still your call. » → Strukturelle Verifikation ≠ faktische Korrektheit. Der gesamte Aufbau garantiert, dass ein Zitat existiert, nicht dass es wahr ist.
Eine harte und willkommene Grenze.« CAPTCHAs, 2FA, and logins are never solved automatically » – eskaliert und an den Menschen zurückgegeben.
Abhängigkeitsfläche. 20 Skills + 16 Subagenten + eine CLI, die einen authentifizierten Browser steuert, auf einem Repository, das noch keine vier Monate alt ist. Die Warnung aus [[lassiege-usine-logicielle-heure-ia-2026-07-28]] gilt vollständig (« any skill, MCP, or code pulled in from outside must be scrutinized »).
Meta / zu verlinken. die vollendetste Instanz des Harness-Engineerings aus [[osmani-agent-harness-engineering-2026-04-19]]; konvergiert unabhängig mit [[lassiege-usine-logicielle-heure-ia-2026-07-28]] beim verzögerten Laden von Kontext und dabei, dass das Ausführbare die Anweisung schlägt; gleiche Doktrin der mechanischen Grenze wie [[sfeir-anthropic-sdlc-ai-native-securise-2026-07-26]] und [[valente-zalewski-beyond-zero-enterprise-security-ai-era-2026-07-20]]; formverwandt mit den anderen Skill-Einträgen des Korpus, [[skill-pocock-grill-with-docs-2026-06]] und [[akhouri-adhd-ideation-divergente-parallele-2026-07-20]]; zu lesen zusammen mit [[agent-skills-anthropic-2025-10-16]], [[shihipar-claude-code-lessons-building-skills-2026-06-03]] und [[vincent-superpowers-agentic-skills-framework-github-2026-04-02]] zur Skill-Mechanik; die parallele adversarische Kritik verbindet sich mit der von [[monperrus-end-of-code-review-agents-supersede-2026-06-11]] aufgeworfenen Frage, was eine automatisierte Review leisten kann.
Kernzahlen
eine Spitzenposition auf DeepResearch-Bench RACE, dargestellt als selbst verwaltete Zukunftsprojektion ohne Validierung durch Dritte