graphify — « Turn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable knowledge graph. A /graphify skill for Claude Code, Cursor, Codex, and Gemini CLI: local deterministic AST parsing, every edge explained, no vector store. »
Skill-Eintrag (kein Artikel): graphify von Safi Shamsi (Graphify Labs, Y Combinator S26) verwandelt ein gesamtes Projekt — Code, Dokumentation, PDFs, Bilder, Videos — in einen abfragbaren Wissensgraphen, aufgerufen über /graphify aus Claude Code, Cursor, Codex, Gemini CLI, GitHub Copilot und etwa fünfzehn weiteren Clients.
Von **Safi Shamsi** — créateur et mainteneur de graphify// Quelle github.com ↗/Lesezeit 2 min/.md// Automatisch geprüfte Übersetzung
graphify (Safi Shamsi, Graphify Labs, Y Combinator S26) verwandelt ein gesamtes Projekt in einen abfragbaren Wissensgraphen, aufgerufen über /graphify aus Claude Code, Cursor, Codex, Gemini CLI und etwa fünfzehn weiteren Clients. Beobachtet am 6. August 2026: 103.187 Sterne für ein Repository, das am 3. April erstellt wurde, Apache-2.0, Python.
Drei Grundprinzipien tragen das Projekt.Code wird lokal geparst zu tree-sitter-AST, ohne LLM: deterministisch, nichts verlässt die Maschine, kein API-Schlüssel nötig für ein reines Code-Korpus. Jede Kante trägt ihre Herkunft — EXTRACTED, wenn explizit in der Quelle, INFERRED, wenn von graphify hergeleitet —, „so you can tell what was read directly from what was inferred". Und das Projekt definiert sich gegen vektorbasiertes RAG: „Not a vector index. No embeddings, no vector store: a real graph you traverse."
Die Nutzung ersetzt grep.query liefert einen Subgraphen für eine Frage in natürlicher Sprache, path A B verfolgt den Pfad zwischen zwei Entitäten, explain erschließt ein Konzept. Drei Ausgaben: ein interaktiver Graph, ein lesbarer Report (God Nodes, überraschende Verbindungen, vorgeschlagene Fragen) und eine persistente graph.json, Wochen später abfragbar.
Die Abdeckung reicht über Code hinaus: 36 tree-sitter-Grammatiken, aber auch SQL, Terraform, Apex, MCP-Konfigurationen, Paketmanifeste, Office, PDFs, Bilder und lokal transkribiertes Video. # WHY:-Kommentare und Design-Begründungen werden zu vollwertigen Knoten, verlinkt mit dem Code, den sie erklären.
Die Benchmarks verdienen eine genaue Lektüre. Bei LOCOMO dominiert graphify beim Recall (0,497 gegenüber 0,149 und 0,048), verliert aber bei der QA-Genauigkeit (45,3 % gegenüber 49,7 %); bei LongMemEval-S liegt es mit 76 % gleichauf mit einem dense RAG. Die entscheidende Zeile liegt woanders: „Graph build — LLM credits: 0". Das haltbare Unterscheidungsmerkmal sind Kosten und Nachvollziehbarkeit, nicht die Antwortqualität.
⚠️ Drei Vorbehalte. Der main-Branch führt eine veraltete README aus der v1-Ära, die ein anderes Produkt beschreibt: lesen Sie v8. Das PyPI-Paket heißt graphifyy, bis der Name zurückgewonnen wird. Und ein lokales Query-Log ist standardmäßig aktiv, deaktivierbar über eine Umgebungsvariable.
Der Skill dient zugleich als Einstiegspunkt zu einer wartelistengeführten kommerziellen Plattform unter graphify.com, die denselben Ansatz kontinuierlich auf den gesamten Arbeitskontext anwendet.
Kernpunkte
Art./graphify-Skill + Python-CLI, Apache-2.0, auf PyPI unter dem Namen graphifyy verteilt (zwei y, bis graphify zurückgewonnen wird). Installation via uv tool install graphifyy && graphify install. Funktioniert in Claude Code, Cursor, Codex, Gemini CLI, GitHub Copilot und etwa fünfzehn weiteren Clients.
⭐⭐ Die drei Gestaltungsprinzipien, und sie greifen ineinander. 1. Code wird lokal geparst, ohne LLM. tree-sitter-AST, deterministisch, „nothing leaves your machine". Ein reines Code-Korpus erfordert keinen API-Schlüssel und läuft offline. Dokumente, PDFs und Bilder durchlaufen jedoch ein Modell. 2. Jede Kante trägt ihre Herkunft.EXTRACTED = explizit in der Quelle; INFERRED = von graphify hergeleitet; AMBIGUOUS im Report. „You always know what was found vs guessed." 3. Kein Vektorindex. Keine Embeddings, kein Vector Store: ein Graph, den man durchläuft. → Die drei Prinzipien verstärken sich gegenseitig: Determinismus macht die Kosten null, Nullkosten ermöglichen häufiges Neuaufbauen, und die Kantenbeschriftung macht das Ergebnis überprüfbar. Dieselbe Denkfamilie wie die ausführbare Datei, die das Briefing übertrifft, in [[lassiege-usine-logicielle-heure-ia-2026-07-28]].
⭐ Der Graph ersetzt grep, und das ist das Nutzungsargument.query "<Frage>" liefert einen Subgraphen für eine Frage in natürlicher Sprache, path A B verfolgt den Pfad zwischen zwei Entitäten, explain X erschließt die Nachbarschaft eines Konzepts. Das Beispiel der README verdeutlicht dies: path "FastAPI" "ModelField" liefert einen Pfad über drei Hops mit dem Typ jeder Kante. Man fragt nach einer Beziehung, nicht nach einem String-Treffer. Genau das ist der Nutzen, den Hugo Lassiège in [[lassiege-usine-logicielle-heure-ia-2026-07-28]] GitNexus zuschreibt — „searching for an execution flow rather than grepping a function name" und „the real point isn't speed, it's detecting all the side effects".
⭐⭐ Die Benchmark-Tabelle, richtig gelesen — die entscheidende Zeile ist kein Sieg. | Benchmark | Metrik | graphify | Feld | |---|---|---|---| | LOCOMO (n=300) | recall@10 | 0,497 | supermemory 0,149 · mem0 0,048 | | LOCOMO (n=300) | QA-Genauigkeit | 45,3 % | supermemory 49,7 % · mem0 27,3 % | | LongMemEval-S (n=50) | QA-Genauigkeit | 76 % | gleichauf mit einem dense RAG | | Graphaufbau | LLM-Credits | 0 | anderswo pro Token abgerechnet | → graphify dominiert weitgehend beim Recall, verliert bei der QA-Genauigkeit, liegt beim zweiten Benchmark gleichauf mit dense RAG und baut seinen Graphen kostenlos auf. Das haltbare Unterscheidungsmerkmal sind daher Kosten und Nachvollziehbarkeit, nicht die Antwortqualität. graphify als „besser als RAG" darzustellen wäre eine Überinterpretation, der die eigenen Zahlen widersprechen. Anerkanntes Protokoll: gleicher Harness, gleiches Modell, gleiche Budgets, Richterurteil blind gegen einen zweiten Richter validiert (90,6 % Übereinstimmung, Cohens Kappa 0,81).
⭐ Ein Vergleich mit der einzigen vergleichbaren Zahl des Korpus lohnt sich. Compare the Market maß einen AST-Graphen bei ~70 % gegenüber ~58 % für ein vektorbasiertes RAG bei 79 Merge Requests, wobei RAG schlechter abschnitt als gar kein Kontext (vgl. [[comparethemarket-context-retrieval-ai-code-review-gkg-rag-2026-03-06]], erneut aufgegriffen in [[sfeir-code-review-anneau-contraintes-2026-07-30]]). Zwei unabhängige Messungen konvergieren zur Überlegenheit des strukturierten Graphen für Code — und graphify fügt hinzu, dass der Aufbau nichts kostet.
Quellenabdeckung — breiter als „nur Code". 36 tree-sitter-Grammatiken für ~40 Sprachen (bis hinunter zu CUDA, Metal, Zig, Elixir, Julia, Dart, SystemVerilog, Delphi, Fortran), außerdem SQL, Terraform/HCL, Apex Salesforce, MCP-Konfigurationen (.mcp.json, claude_desktop_config.json — extrahiert Server, Pakete und erforderliche Umgebungsvariablen), Paketmanifeste (pyproject.toml, go.mod, pom.xml — ein kanonischer Knoten pro Paket, folglich ein einziger Hub), Office, Google Workspace, PDFs, Bilder, Video und Audio. ⭐ Das Graphifizieren der eigenen MCP-Konfigurationen ist eine unerwartete und unmittelbar nützliche Möglichkeit, die eigene Tooling-Oberfläche zu kartieren.
Das „Warum" als vollwertiges Objekt extrahiert.# NOTE:-, # WHY:-, # HACK:-Kommentare, Docstrings und in der Dokumentation gefundene Design-Begründungen werden zu eigenständigen Knoten, verlinkt mit dem Code, den sie erklären. → Intention wird als Graph-Entität behandelt, was direkt die Verständnisschuld adressiert: Man kann nach dem Warum fragen, nicht nur nach dem Was.
Aktualität des Graphen, drei Mechanismen. SHA256-Cache (nur geänderte Dateien werden neu verarbeitet), --watch (sofortiger Rebuild beim Speichern einer Code-Datei, nur AST, ohne LLM; Dokumente und Bilder markieren, dass ein --update nötig ist), und graphify hook install (Post-Commit-Hook, kein Hintergrundprozess). Der --watch-Modus wird explizit für Multi-Agent-Workflows begründet: „the graph stays current between waves automatically".
Ausgaben für Agenten.--wiki erzeugt enzyklopädieartige Artikel pro Community mit einer index.md, „point any agent at index.md and it can navigate the knowledge base by reading files instead of parsing JSON". Und --mcp startet einen MCP-stdio-Server. Exporte nach Obsidian, GraphML (Gephi, yEd), Neo4j (Cypher), SVG. → Der Graph ist darauf ausgelegt, von einer Maschine gelesen zu werden, mit mehreren Einstiegspunkten je nach Werkzeug. Dieselbe Absicht wie das Markdown, das Agenten in [[martinho-allen-cloudflare-markdown-for-agents-2026-02-12]] bereitgestellt wird.
⚠️ Datenschutz — die Grenze ist subtil, wissenswert.
Lokal. Code (tree-sitter), Video und Audio (faster-whisper). Ein reines Code-Korpus läuft offline, und --code-only erzwingt diesen Modus bei einem gemischten Repository.
An das Modell gesendet. Dokumente, PDFs, Bilder. Im Headless-Modus ist ein API-Schlüssel erforderlich, mit einer automatischen Prioritätskette (Gemini → Kimi → Claude → OpenAI → DeepSeek → Azure → Bedrock → Ollama). ⚠️ Kimi leitet an Moonshot-AI-Server in China weiter — die README weist darauf hin, und --backend ollama bietet einen vollständig lokalen Modus.
Keine Telemetrie. , kein Nutzungs-Tracking.
⚠️ Standardmäßig wird jedoch ein Query-Log geschrieben unter ~/.cache/graphify-queries.log (Zeitstempel, Frage, Korpus, zurückgegebene Knoten, Dauer). Subgraphen werden nicht gespeichert. Deaktivierbar via GRAPHIFY_QUERY_LOG_DISABLE=1. Lokal, aber ohne Opt-in aktiv: wissenswert vor dem Einsatz in einem sensiblen Kontext.
⚠️ Zwei Dokumentationsfallen im Repository selbst. 1. Der main-Branch ist veraltet. Er führt eine README aus der v1-Ära (7 KB), die „a Claude Code skill" für einen einzigen Client beschreibt, die Behauptung „71,5× weniger Tokens" bei einem 52-Datei-Korpus von Karpathy hervorhebt und noch auf safishamsi/graphify verweist. Der Standardbranch ist v8 (57 KB), der ein Multi-Client-Produkt beschreibt und die LOCOMO-/LongMemEval-Benchmarks hervorhebt. v8 lesen, niemals main. 2. Der Paketname: pip install graphifyy (zwei y). CLI- und Skill-Befehl bleiben graphify.
Geschäftsmodell, zu beobachten. Der Open-Source-Skill ist der Einstiegspunkt zu einer kommerziellen Plattform unter graphify.com — „the always-on layer… applies the same graph approach to your entire working context: meetings, files, docs, and code, updating continuously in the background", derzeit über eine Warteliste, mit angekündigter kostenloser Testphase. Lokale Open Source auf der einen, kontinuierlich gehosteter Dienst auf der anderen Seite: ein klassisches Muster, das bei jeder Adoptionsentscheidung zu berücksichtigen ist.
⚠️ Die Traktion erfordert eine vorsichtige Lektüre.103.187 Sterne in vier Monaten sind ein außergewöhnliches Tempo, selbst für ein virales Tool. Die Zahl ist das, was die GitHub-API am 6. August 2026 zurückgibt; sie sagt nichts über die tatsächliche Nutzung aus, und die offizielle Website des Projekts zeigt weiterhin 3.700 (vgl. [[graphify-net-annuaire-ia-coding-2026-08-06]]), ein Zeichen dafür, dass die Kommunikation nicht Schritt gehalten hat. Die Sternezahl als Aufmerksamkeitssignal zitieren, niemals als Adoptionsmaß.
Meta / Querverweise. dieselbe Familie wie [[skill-gibbs-hyperresearch-2026-08-03]] (persistenter Speicher, Herkunftsnachweis, agentenlesbare Ausgabe), jedoch für Code statt dokumentarischer Recherche; realisiert in Produktform, was Hugo Lassiège in [[lassiege-usine-logicielle-heure-ia-2026-07-28]] von GitNexus erhält; numerische Konvergenz mit [[comparethemarket-context-retrieval-ai-code-review-gkg-rag-2026-03-06]] und [[sfeir-code-review-anneau-contraintes-2026-07-30]] zu AST-Graph versus vektorbasiertem RAG; fügt sich in den kodifizierten Kontext von [[vasilopoulos-codified-context-infrastructure-ai-agents-2026-02-24]] und die Kontextplattformen von [[memodb-acontext-context-data-platform-agents-2025-12-11]] ein; formale Verwandtschaft mit anderen Skill-Einträgen, [[skill-pocock-grill-with-docs-2026-06]]; Skill-Mechanik in [[agent-skills-anthropic-2025-10-16]], [[shihipar-claude-code-lessons-building-skills-2026-06-03]] und [[vincent-superpowers-agentic-skills-framework-github-2026-04-02]]. ⚠️ Begriffsklärung: Die Website graphify.net ist eine von graphify.com (der kommerziellen Plattform) getrennte Domain — siehe den eigenen Eintrag.
Der aus dieser Fiche extrahierte Wissensgraph — 9 Entitäten, 24 Relationen.
In diesem Graphen :graphify · Safi Shamsi · Graphify Labs · provenance d'arête · extraction hybride par type de fichier · tree-sitter · algorithme de Leiden · LOCOMO · LongMemEval