live

GraphRAG vs RAG Plano: Por Que el Grafo Siempre Gana

RAG clasico recupera chunks sin entender relaciones. GraphRAG indexa entidades y aristas. Con RDF y SPARQL el salto es mayor: razonamiento simbolico puro sobre hechos estructurados, base ideal para agentes BDI.

El problema del RAG clasico

El RAG estandar funciona asi: trocea documentos en chunks, los embeddea, y en query-time recupera los N mas cercanos por similitud coseno. El LLM ve esos chunks y genera una respuesta.

Funciona. Pero falla en preguntas que requieren razonamiento relacional:

  • "Que vulnerabilidades comparten los sistemas con OpenSSL menor a 3.0 expuestos en el puerto 443?"
  • "Que agentes de amenaza han usado T1055 y T1027 juntos contra infraestructura critica?"
  • "Dame todos los artefactos con CVSS mayor a 8 que afectan a binarios sin PIE en la red local"

Un embedding no sabe que CVE-XXXX afecta a OpenSSL que corre en ese servidor. Solo sabe que el texto es similar.

GraphRAG: entidades y aristas primero

Microsoft presento GraphRAG en 2024. La idea: antes de indexar, extraer entidades y relaciones del corpus y construir un grafo. En query-time, el retrieval recorre el grafo en lugar de buscar chunks planos.

Resultado: respuestas sobre temas que requieren sintetizar informacion distribuida mejoran drasticamente. El LLM razona sobre estructura, no solo proximidad semantica.

Con RDF + SPARQL: el salto siguiente

Si el grafo es RDF, ganas algo que GraphRAG no tiene: logica declarativa. SPARQL no es solo un lenguaje de consulta, es un motor de inferencia:

SELECT ?host ?cve ?tecnica WHERE {
  ?host cyber:exposedPort 443 ;
        cyber:runsSoftware ?sw .
  ?cve pentest:affects ?sw ;
       pentest:cvss ?score .
  FILTER(?score > 8.0)
  ?cve offensive:mapsTo ?tecnica .
  ?tecnica a mitre:Technique .
}

Eso es una query que ningun embedding puede responder. Razonamiento simbolico puro sobre hechos estructurados.

La arquitectura hibrida optima

Ni puro simbolico ni puro vectorial:

  1. Capa RDF/SPARQL — hechos duros, relaciones explicitas, reglas de inferencia. Consultas exactas.
  2. Capa vectorial — embeddings para recuperacion semantica difusa, analogias, similitud conceptual.
  3. Capa LLM — sintetiza y razona en lenguaje natural sobre lo que las dos capas anteriores extraen.

Cada capa hace lo que mejor sabe. SPARQL no alucina. El embedding no necesita que todo este anotado. El LLM no tiene que memorizar hechos.

Por que esto importa para agentes autonomos

Un agente BDI que solo usa embeddings tiene memoria borrosa. Puede recuperar conceptos similares pero no puede garantizar que un hecho especifico es verdad.

Con un grafo RDF como sustrato:
- Las creencias son tripletas verificables, no probabilidades
- Los deseos pueden derivarse por reglas: si CVE critico en infra propia, desire parchear
- Las intenciones se planifican sobre un mapa real del mundo, no sobre una nube de vectores

La memoria semantica del agente deja de ser una aproximacion y pasa a ser un modelo del mundo con garantias logicas.

Estado del arte en 2026

Los desarrollos mas relevantes:
- SPARQL generado por LLM sobre grafos RDF — el agente formula sus propias queries
- KG completion con embeddings — rellenar huecos del grafo con modelos relacionales como TransE o RotatE
- Razonamiento multi-hop — cadenas de inferencia que combinan SPARQL y embedding en cada salto

El consenso emergente: los LLMs solos tienen techo en razonamiento factual. El grafo de conocimiento es el sustrato de memoria que los hace fiables. No es una alternativa al LLM, es lo que le da suelo firme.

aqui cualquier cosa mientras cuadramos el logo