graphify — « Turn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable knowledge graph. A /graphify skill for Claude Code, Cursor, Codex, and Gemini CLI: local deterministic AST parsing, every edge explained, no vector store. »
Entrada de tipo skill (no un artículo): graphify, de Safi Shamsi (Graphify Labs, Y Combinator S26), convierte un proyecto completo —código, documentación, PDF, imágenes, vídeos— en un grafo de conocimiento consultable, invocado mediante /graphify desde Claude Code, Cursor, Codex, Gemini CLI, GitHub Copilot y una quincena de otros clientes.
Por **Safi Shamsi** — créateur et mainteneur de graphify// Fuente github.com ↗/Lectura 2 min/.md// Traducción verificada automáticamente
#skill#grafo de conocimiento#grafo de conocimiento#AST#tree-sitter#análisis estático determinista#extracción local#sin LLM
graphify (Safi Shamsi, Graphify Labs, Y Combinator S26) convierte un proyecto completo en un grafo de conocimiento consultable, invocado mediante /graphify desde Claude Code, Cursor, Codex, Gemini CLI y una quincena de otros clientes. Observado el 6 de agosto de 2026: 103 187 estrellas para un repositorio creado el 3 de abril, Apache-2.0, Python.
Tres compromisos sustentan el proyecto.El código se analiza localmente en un AST de tree-sitter, sin LLM: determinista, nada sale de la máquina, no se requiere clave de API para un corpus puramente de código. Cada arista lleva su procedencia —EXTRACTED si es explícita en la fuente, INFERRED si graphify la resolvió—, « so you can tell what was read directly from what was inferred ». Y el proyecto se define frente al RAG vectorial: « Not a vector index. No embeddings, no vector store: a real graph you traverse. »
Not a vector index. No embeddings, no vector store: a real graph you traverse.
— **Safi Shamsi** — créateur et mainteneur de graphify , github.com
El uso sustituye a grep.query devuelve un subgrafo para una pregunta en lenguaje natural, path A B traza el camino entre dos entidades, explain despliega un concepto. Tres salidas: un grafo interactivo, un informe legible (nodos god, conexiones sorprendentes, preguntas sugeridas) y un graph.json persistente, consultable semanas después.
La cobertura va más allá del código: 36 gramáticas de tree-sitter, pero también SQL, Terraform, Apex, configuraciones MCP, manifiestos de paquetes, Office, PDF, imágenes y vídeo transcrito localmente. Los comentarios # WHY: y el razonamiento de diseño se convierten en nodos de pleno derecho vinculados al código que explican.
Los benchmarks merecen una lectura atenta. En LOCOMO, graphify domina en recall (0,497 frente a 0,149 y 0,048) pero pierde en precisión de QA (45,3 % frente a 49,7 %); en LongMemEval-S empata con un RAG denso en 76 %. La línea que importa está en otra parte: « Graph build — LLM credits: 0 ». El diferenciador defendible es el coste y la trazabilidad, no la calidad de las respuestas.
⚠️ Tres advertencias. La rama main conserva un README obsoleto de la era v1 que describe un producto distinto: hay que leer v8. El paquete PyPI se llama graphifyy, hasta que se recupere el nombre. Y un registro local de consultas está activo por defecto, desactivable mediante una variable de entorno.
La skill también sirve de punto de entrada a una plataforma comercial en lista de espera, graphify.com, que aplica el mismo enfoque de forma continua a todo el contexto de trabajo.
Puntos clave
Naturaleza. skill /graphify + CLI en Python, Apache-2.0, distribuida en PyPI bajo el nombre graphifyy (con dos y, hasta que se recupere graphify). Instalación mediante uv tool install graphifyy && graphify install. Funciona en Claude Code, Cursor, Codex, Gemini CLI, GitHub Copilot y una quincena de otros clientes.
⭐⭐ Los tres compromisos de diseño, y se sostienen entre sí. 1. El código se analiza localmente, sin LLM. AST de tree-sitter, determinista, « nothing leaves your machine ». Un corpus puramente de código no requiere ninguna clave de API y funciona sin conexión. Los documentos, PDF e imágenes, en cambio, pasan por un modelo. 2. Cada arista lleva su procedencia.EXTRACTED = explícita en la fuente; INFERRED = resuelta por graphify; AMBIGUOUS en el informe. « You always know what was found vs guessed. » 3. Sin índice vectorial. Sin embeddings, sin almacén vectorial: un grafo que se recorre. → Los tres se refuerzan entre sí: el determinismo hace que el coste sea cero, el coste cero permite reconstrucciones frecuentes, y el etiquetado de las aristas hace el resultado auditable. Misma familia de razonamiento que el ejecutable que supera al brief en [[lassiege-usine-logicielle-heure-ia-2026-07-28]].
⭐ El grafo sustituye a grep, y ese es el argumento de uso.query "<pregunta>" devuelve un subgrafo para una pregunta en lenguaje natural, path A B traza el camino entre dos entidades, explain X despliega el vecindario de un concepto. El ejemplo del README lo ilustra: path "FastAPI" "ModelField" devuelve un camino de tres saltos con el tipo de cada arista. Se pregunta por una relación, no por una coincidencia de cadena. Es exactamente el beneficio que Hugo Lassiège atribuye a GitNexus en [[lassiege-usine-logicielle-heure-ia-2026-07-28]] —« searching for an execution flow rather than grepping a function name », y « the real point isn't speed, it's detecting all the side effects ».
⭐⭐ La tabla de benchmarks, leída correctamente — la línea que importa no es una victoria. | Benchmark | Métrica | graphify | Sector | |---|---|---|---| | LOCOMO (n=300) | recall@10 | 0,497 | supermemory 0,149 · mem0 0,048 | | LOCOMO (n=300) | precisión QA | 45,3 % | supermemory 49,7 % · mem0 27,3 % | | LongMemEval-S (n=50) | precisión QA | 76 % | empatado con un RAG denso | | Construcción del grafo | créditos LLM | 0 | facturado por token en el resto del sector | → graphify domina ampliamente en recall, pierde en precisión de QA, empata con el RAG denso en el segundo benchmark y construye su grafo de forma gratuita. El diferenciador defendible es, por tanto, el coste y la trazabilidad, no la calidad de las respuestas. Presentar graphify como « mejor que el RAG » sería una sobreinterpretación que sus propias cifras contradicen. Protocolo acreditado: mismo harness, mismo modelo, mismos presupuestos, juez validado a ciegas frente a un segundo juez (90,6 % de acuerdo, kappa de Cohen 0,81).
⭐ Vale la pena compararlo con la única cifra comparable del corpus. Compare the Market midió un grafo AST en ~70 % frente a ~58 % para un RAG vectorial en 79 merge requests, con el RAG rindiendo peor que sin ningún contexto (cf. [[comparethemarket-context-retrieval-ai-code-review-gkg-rag-2026-03-06]], retomado en [[sfeir-code-review-anneau-contraintes-2026-07-30]]). Dos mediciones independientes convergen en la superioridad del grafo estructurado para el código — y graphify añade que su construcción no cuesta nada.
Cobertura de fuentes — más amplia que "solo código". 36 gramáticas de tree-sitter que cubren ~40 lenguajes (hasta CUDA, Metal, Zig, Elixir, Julia, Dart, SystemVerilog, Delphi, Fortran), además de SQL, Terraform/HCL, Apex Salesforce, configuraciones MCP (.mcp.json, claude_desktop_config.json —extrae servidores, paquetes y variables de entorno requeridas—), manifiestos de paquetes (pyproject.toml, go.mod, pom.xml —un nodo canónico por paquete, de ahí un único hub—), Office, Google Workspace, PDF, imágenes, vídeo y audio. ⭐ Aplicar graphify a las propias configuraciones MCP es una forma inesperada e inmediatamente útil de cartografiar la propia superficie de herramientas.
El «porqué» extraído como objeto de primer orden. los comentarios # NOTE:, # WHY:, # HACK:, los docstrings y el razonamiento de diseño presente en la documentación se convierten en nodos independientes vinculados al código que explican. → La intención se trata como una entidad del grafo, lo que aborda directamente la deuda de comprensión: se puede preguntar por qué, no solo qué.
Actualidad del grafo, tres mecanismos. caché SHA256 (solo se reprocesan los archivos modificados), --watch (reconstrucción instantánea al guardar un archivo de código, solo AST, sin LLM; los documentos e imágenes señalan que se necesita un --update), y graphify hook install (hook post-commit, sin proceso en segundo plano). El modo --watch se justifica explícitamente para flujos multiagente: « the graph stays current between waves automatically ».
Salidas para agentes.--wiki produce artículos de estilo enciclopédico por comunidad con un index.md, « point any agent at index.md and it can navigate the knowledge base by reading files instead of parsing JSON ». Y --mcp inicia un servidor MCP stdio. Exportaciones a Obsidian, GraphML (Gephi, yEd), Neo4j (cypher), SVG. → El grafo está construido para ser leído por una máquina, con varios puntos de entrada según la herramienta. Misma intención que el markdown servido a agentes en [[martinho-allen-cloudflare-markdown-for-agents-2026-02-12]].
⚠️ Privacidad — el límite es sutil, conviene conocerlo.
Local. código (tree-sitter), vídeo y audio (faster-whisper). Un corpus exclusivamente de código funciona sin conexión, y --code-only fuerza este modo en un repositorio mixto.
Enviado al modelo. documentos, PDF, imágenes. En modo headless se requiere una clave de API, con una cadena de prioridad automática (Gemini → Kimi → Claude → OpenAI → DeepSeek → Azure → Bedrock → Ollama). ⚠️ Kimi enruta hacia servidores de Moonshot AI en China —el README lo señala—, y --backend ollama ofrece un modo totalmente local.
Sin telemetría. , sin seguimiento de uso.
⚠️ Pero un registro de consultas se escribe por defecto en ~/.cache/graphify-queries.log (marca temporal, pregunta, corpus, nodos devueltos, duración). Los subgrafos no se almacenan. Se desactiva mediante GRAPHIFY_QUERY_LOG_DISABLE=1. Local, pero activo sin opt-in: conviene saberlo antes de un despliegue en un contexto sensible.
⚠️ Dos trampas de documentación en el propio repositorio. 1. La rama main está obsoleta. Conserva un README (7 KB) de la era v1 que describe « a Claude Code skill » para un único cliente, destacando la afirmación « 71,5× menos tokens » sobre un corpus Karpathy de 52 archivos, y sigue apuntando a safishamsi/graphify. La rama por defecto es v8 (57 KB), que describe un producto multicliente y destaca los benchmarks LOCOMO/LongMemEval. Hay que leer v8, nunca main. 2. El nombre del paquete: pip install graphifyy (con dos y). El comando de la CLI y de la skill sigue siendo graphify.
Modelo de negocio, a vigilar. la skill open source es el punto de entrada a una plataforma comercial en graphify.com —« the always-on layer… applies the same graph approach to your entire working context: meetings, files, docs, and code, updating continuously in the background »—, actualmente en lista de espera, con una prueba gratuita anunciada. Open source local por un lado, servicio alojado continuo por otro: un patrón clásico, a tener en cuenta en cualquier decisión de adopción.
⚠️ La tracción exige una lectura cautelosa.103 187 estrellas en cuatro meses es un ritmo excepcional, incluso para una herramienta viral. La cifra es la que devuelve la API de GitHub el 6 de agosto de 2026; no dice nada sobre el uso real, y el sitio oficial del proyecto sigue mostrando 3700 (cf. [[graphify-net-annuaire-ia-coding-2026-08-06]]), señal de que la comunicación no ha seguido el ritmo. El número de estrellas debe citarse como señal de atención, nunca como medida de adopción.
Meta / referencias cruzadas. misma familia que [[skill-gibbs-hyperresearch-2026-08-03]] (almacén persistente, procedencia, salida legible por agentes), pero para código en lugar de investigación documental; materializa en forma de producto lo que Hugo Lassiège obtiene de GitNexus en [[lassiege-usine-logicielle-heure-ia-2026-07-28]]; convergencia numérica con [[comparethemarket-context-retrieval-ai-code-review-gkg-rag-2026-03-06]] y [[sfeir-code-review-anneau-contraintes-2026-07-30]] sobre grafo AST frente a RAG vectorial; se inscribe en el contexto codificado de [[vasilopoulos-codified-context-infrastructure-ai-agents-2026-02-24]] y las plataformas de contexto de [[memodb-acontext-context-data-platform-agents-2025-12-11]]; parentesco formal con otras entradas de tipo skill, [[skill-pocock-grill-with-docs-2026-06]]; mecánica de las skills en [[agent-skills-anthropic-2025-10-16]], [[shihipar-claude-code-lessons-building-skills-2026-06-03]] y [[vincent-superpowers-agentic-skills-framework-github-2026-04-02]]. ⚠️ Desambiguación: el sitio graphify.net es una propiedad distinta de graphify.com (la plataforma comercial) — véase la entrada dedicada.
El grafo de conocimiento extraído de esta ficha — 9 entidades, 24 relaciones.
En este grafo :graphify · Safi Shamsi · Graphify Labs · provenance d'arête · extraction hybride par type de fichier · tree-sitter · algorithme de Leiden · LOCOMO · LongMemEval