Grafdatabaser – så fungerar databasen som lagrar sambanden
En grafdatabas lagrar sambanden mellan saker lika noga som sakerna själva. Den förmågan gör den stark på frågor om hur allt hänger ihop och har gjort tekniken viktig för AI. Så fungerar den.
Över 370 journalister runt om i världen arbetade med samma läcka inför publiceringen av Panama Papers våren 2016: 11,5 miljoner filer från en advokatbyrå i Panama, sammanlagt 2,6 terabyte. Det som skulle avslöjas låg gömt i sambanden. Vem ägde bolaget som ägde bolaget och vem stod ytterst bakom?
Datateamet på journalistnätverket International Consortium of Investigative Journalists, ICIJ, lade därför in byråns interna register över bolag och ägare i en grafdatabas. Reportrar utan teknisk vana kunde klicka sig fram från en person till personens bolag och vidare till nästa led. De mer tekniskt kunniga kunde be databasen om alla som stod inom två led från en viss person, berättar ICIJ.
Tio år senare har samma idé fått ett nytt användningsområde. När en AI-assistent ska svara på frågor om avtal, ägare och leverantörer ligger svaret ofta i hur uppgifterna hänger ihop. Där kommer grafen in igen.
Kortversionen
- En grafdatabas lagrar saker och sambanden mellan dem. Den är byggd för frågor om hur allt hänger ihop: vem som äger vad, vem som känner vem och vägen från A till B.
- Skillnaden mot tabeller: en vanlig databas räknar fram sambanden varje gång någon frågar. En grafdatabas har dem sparade och följer dem steg för steg. Fördelen växer med längden på kedjan.
- Nyttan: ägarkedjor, bedrägerier, rekommendationer och leveranskedjor, där sambanden är själva svaret.
- Verklighetskollen: de flesta behov klarar en vanlig databas, som numera också kan besvara graffrågor. En separat grafdatabas lönar sig när kedjorna är långa och sambanden är det viktigaste.
- AI-kopplingen: en kunskapsgraf, en karta över saker och hur de hänger ihop, ger en språkmodell sammanhang. Med metoden GraphRAG kan modellen följa sambanden i grafen i flera steg, medan vanlig AI-sökning hämtar text som liknar frågan.
- Du kan se en kunskapsgraf växa fram redan i dag, med en prompt i Claude eller ChatGPT.
En grafdatabas lagrar saker och sambanden mellan dem
Rita ett bolag på en whiteboard. Du skriver namnet i en ruta, ritar ägaren i en ruta bredvid och drar en pil från ägaren till bolaget med ägarandelen på pilen. Fortsätter du med ägarens ägare har du snart en karta över hur allt hänger ihop. En grafdatabas sparar data i just den formen.
Den har tre byggstenar:
- Noder är sakerna: en person, ett bolag eller ett dokument. Varje nod har en etikett som säger vad den är, till exempel Person eller Bolag.
- Relationer är pilarna mellan noderna. En relation har en typ, till exempel ÄGER, och en riktning, från ägaren till bolaget. I matematiken kallas den kant.
- Egenskaper är uppgifterna som sitter på noder och relationer: namn, ort och år, och på ägarrelationen själva andelen.
Exemplet nedan visar samma lilla ägarkedja på två sätt, som tabeller och som graf. Växla mellan vyerna och tryck på noderna för att se deras egenskaper.
I grafvyn är relationerna egna saker i databasen, lika verkliga som bolagen. I tabellvyn finns de som rader med id-nummer och databasen måste para ihop dem varje gång någon frågar.
Grafteorin är äldre än datorn. År 1736 visade matematikern Leonhard Euler att ingen promenad i Königsberg kunde korsa stadens sju broar exakt en gång var. Han bortsåg från kartan och räknade bara med stadsdelarna och broarna mellan dem. Den lösningen räknas som grafteorins början. Stadsdelarna och broarna motsvarar dagens noder och relationer.
Ägarkedjor bakom bolag visar skillnaden mellan tabell och graf
Exemplet speglar en fråga som svenska bolag hanterar på riktigt. De flesta bolag ska registrera sina verkliga huvudmän, de personer som ytterst äger eller kontrollerar bolaget. Enligt lagen om registrering av verkliga huvudmän antas den som kontrollerar mer än 25 procent av rösterna ha den kontrollen. Kontrollen räknas vidare genom kedjor av bolag.
Frågan om vem som står bakom Konsultbolaget AB kräver alltså att man följer ägandet uppåt tills man når en människa. I exemplet tar det tre led. Konsultbolaget ägs av Holdingbolaget, som ägs av Investbolaget och Anna, och Investbolaget ägs av Erik. Anna har 40 procent av rösterna i Holdingbolaget och Erik, genom Investbolaget, 60 procent. Båda ligger över gränsen och enligt lagens kedjeregel räknas deras kontroll vidare till Konsultbolaget.
Med tabeller blir varje led ett nytt uppslag. Databasen slår upp i ägartabellen vem som äger Konsultbolaget, sedan en gång till vem som äger Holdingbolaget och så vidare tills inga fler ägare finns. I grafen står databasen på Konsultbolaget och följer pilarna bakåt, en i taget. Tryck på Följ kedjan i exemplet ovan för att se båda vägarna steg för steg.
Grafdatabasen följer sambanden i stället för att slå upp dem
Den som släktforskat känner igen skillnaden. I kyrkböckerna letar du upp en person, läser namnen på föräldrarna och letar sedan upp dem, ofta i en annan bok. Varje generation kostar ett nytt sökande. Ett släktträd på väggen visar i stället strecken direkt och du följer dem med fingret.
En relationsdatabas, den vanliga sortens databas med tabeller, fungerar som kyrkböckerna. Sambanden finns som id-nummer i tabellerna och databasen parar ihop dem med en join, ett uppslag i tabellens index, varje gång någon frågar. En grafdatabas som Neo4j fungerar mer som släktträdet. Varje nod har sparat direkta pekare till sina grannar, så ett steg i grafen kostar ungefär lika mycket oavsett hur stor databasen är. Tekniken kallas index-free adjacency.
Skillnaden syns också i själva frågan. Dra i reglaget och se hur frågan växer i SQL, frågespråket för tabeller, medan graffrågan bara ändrar en siffra.
Graffrågan är skriven i Cypher, frågespråket i Neo4j, och den ser ut som en ritning av det den letar efter:
MATCH (p:Person)-[:ÄGER*]->(b:Bolag {namn: 'Konsultbolaget AB'})
RETURN p.namn
Parenteserna är noder och pilen är relationen. Stjärnan betyder att kedjan får vara hur lång som helst.
Fördelen har en tydlig gräns. Databasforskarna Michael Stonebraker och Andrew Pavlo konstaterar i en genomgång av databasfältet från 2024 att pekarna lönar sig när kedjorna är långa. Grafdatabasernas framtid hänger enligt dem på om det finns tillräckligt många sådana fall för att välja bort en vanlig databas. Ju kortare kedjan är, desto mindre spelar skillnaden roll.
Grafdatabasen är motorn och kunskapsgrafen är innehållet
Tre ord dyker upp så fort grafer och AI nämns i samma mening och de blandas lätt ihop.
- Grafdatabasen är motorn, ett program som lagrar och söker i grafer. Neo4j är en av de mest kända och har svenska rötter. Företaget bakom den grundades i Sverige 2007 av Emil Eifrem, Johan Svensson och Peter Neubauer.
- Kunskapsgrafen är innehållet, en karta över saker och hur de hänger ihop. Den kan ligga i en grafdatabas, i en vanlig databas eller i en fil.
- GraphRAG är en AI-metod som bygger en kunskapsgraf ur text och låter en språkmodell använda grafen när den svarar.
Den mest kända kunskapsgrafen är Googles. Google lanserade sin Knowledge Graph i maj 2012 under devisen ”things, not strings”, saker i stället för teckensträngar. Redan då innehöll den över 500 miljoner objekt och 3,5 miljarder fakta om dem och sambanden mellan dem. Det är också den som fyller faktarutan i sökresultatet när du söker på en känd person eller plats.
Din egen webbplats bidrar sannolikt redan. Strukturerad data enligt standarden schema.org beskriver vem som skrivit en artikel eller var ett företag ligger, och Google använder den för att förstå både sidan och världen i stort.
Kunskapsgrafer finns i två huvudformer. Den som beskrivs här kallas property graph och har egenskaper på både noder och relationer. Den andra heter RDF, Resource Description Framework. Där byggs allt av tripletter i formen subjekt, predikat och objekt: Anna → äger → Holdingbolaget AB. RDF är standarden för länkade data på webben och kommer från World Wide Web Consortium, W3C.
Grafdatabaser gör störst nytta där sambanden är svaret
- Ägarkedjor och penningtvätt. Banker och myndigheter behöver se igenom bolag som äger bolag, precis som journalisterna bakom Panama Papers.
- Bedrägerier. Tio konton som ser oberoende ut men delar telefonnummer, adress och betalkort bildar i en graf ett mönster som är svårt att se i en lista.
- Rekommendationer. Vad kunder som köpt en viss produkt också köpte är en fråga om relationer mellan kunder och produkter.
- Leveranskedjor. Vilka av era produkter påverkas om en underleverantör två led bort stänger?
- Behörigheter och IT-miljöer. Vem kommer åt vad, via vilken grupp, och vilka system stannar om en server går ner?
Gemensamt för alla fem är att frågan handlar om vägen mellan sakerna, mer än om sakerna själva.
En vanlig databas med tabeller räcker för de flesta behov
Trots fördelarna är grafdatabaser en nisch. Sajten DB-Engines mäter hur mycket olika databaser syns i sökmotorer, jobbannonser, tekniska forum och sociala nätverk. I oktober 2026 fick grafdatabaserna 1,6 procent av den samlade populariteten och relationsdatabaserna 71 procent. Vektordatabaserna, som används för AI-sökning, låg på 2,8 procent, nästan dubbelt så mycket som grafdatabaserna.
En del av förklaringen är att relationsdatabaserna har lärt sig grafernas knep. Sedan 2023 har SQL-standarden en egen del för graffrågor, SQL/PGQ, som låter en vanlig databas läsa sina tabeller som en graf. Grafdatabaserna fick i sin tur ett eget standardiserat frågespråk året efter, GQL. För PostgreSQL finns tillägget Apache AGE, som tar in grafspråket Cypher i en databas som många redan kör.
Stonebraker och Pavlo går längre. De pekar på studier där grafer lagrade i vanliga tabeller har varit snabbare än renodlade grafdatabaser, bland annat en från 2023 där analysdatabasen DuckDB med ett tillägg för grafsyntax slog Neo4j i tester som forskarna bakom tillägget själva gjorde. De tror att specialiserade grafdatabaser förblir en liten marknad.
För de flesta verksamheter är slutsatsen att grafmodellen, sättet att tänka i noder och relationer, är värdefull långt oftare än en separat grafdatabas behövs. Tre frågor räcker för att avgöra var ni står.
Kunskapsgrafer ger AI-modellen sammanhang
En språkmodell vet det den lärt sig i träningen och det du ger den i stunden. För att den ska kunna svara på frågor om era egna dokument används ofta RAG, retrieval-augmented generation. Ett system hämtar först de textbitar som verkar relevanta och sedan svarar modellen utifrån dem. Det är ett exempel på att systemet runt modellen avgör lika mycket som modellen själv.
Den vanliga formen av RAG hämtar text som liknar frågan i betydelse. Varje textbit görs om till en vektor, en lång rad tal som fångar vad texten handlar om. Sökningen hittar sedan de bitar som ligger närmast frågan. Det fungerar bra när svaret står på ett ställe. När svaret kräver att uppgifter från flera dokument kopplas ihop, som i frågan om vem som ytterst äger ett bolag, blir likheten en sämre vägvisare.
GraphRAG är gjort för just sådana frågor. Metoden presenterades av Microsoft Research 2024 och låter en språkmodell läsa igenom dokumenten och plocka ut saker och relationer till en kunskapsgraf. När en fråga kommer följer systemet sambanden i grafen och ger modellen det som hittas där. Microsofts version sammanfattar dessutom grupper av närliggande saker i förväg, så att den kan svara på helhetsfrågor som vilka teman som återkommer i ett stort material.
En systematisk jämförelse som publicerades 2025 och uppdaterades 2026 visar att metoderna har var sina styrkor:
- Vanlig RAG gav bäst svar på enkla faktafrågor och detaljfrågor.
- GraphRAG gav bättre svar än vanlig RAG på frågor som kräver flera steg.
- Grafen tappar information. I en av varianterna fanns bara omkring två tredjedelar av de saker som behövdes för svaren med i grafen som språkmodellen byggt.
- Bygget kostar tid. På en av testmängderna tog det drygt två minuter att bygga det vanliga sökindexet, medan graferna tog från en och en halv timme upp till drygt två timmar.
- En kombination av båda metoderna gav i de flesta fall de bästa resultaten.
Samma studie visar något som är viktigt för alla som utvärderar AI. När forskarna lät en språkmodell döma vilken av två sammanfattningar som var bäst kunde domslutet vända helt om sammanfattningarna bara bytte plats.
Microsoft har sedan dess visat LazyGraphRAG, som skjuter upp språkmodellens arbete till frågetillfället. Att bygga den kostar då lika lite som vanlig RAG, 0,1 procent av vad den ursprungliga metoden kostar. Forskarna bakom HippoRAG har hämtat idén från teorin om hur hjärnans hippocampus indexerar minnen. Genom att kombinera en kunskapsgraf med en variant av Googles rankningsalgoritm PageRank fick de upp till 20 procent bättre resultat på frågor i flera steg.
Språkmodellen bygger kunskapsgrafen åt dig
Det dyra med kunskapsgrafer har länge varit att bygga dem. Någon måste bestämma vilka saker och relationer som ska finnas och sedan föra in dem. Grafen behöver dessutom hållas aktuell när världen ändras. Forskarna bakom en översikt över språkmodeller och kunskapsgrafer pekar ut svårigheten att bygga och uppdatera graferna som en av kunskapsgrafernas svagheter.
Språkmodellerna har vänt på det. Verktyg som Neo4j:s LLM Knowledge Graph Builder låter en modell läsa PDF:er och webbsidor och själv föreslå noder och relationer. Två saker behöver ändå en människa. Modellen skapar lätt flera noder för samma sak, som Anna Berg, A. Berg och Berg, och den kan hitta på samband som inte står i texten. Testa därför grafens kvalitet på era egna dokument innan den får bära beslut.
Samma modeller kan också skriva frågorna. Du frågar på svenska och modellen översätter till Cypher och kör frågan. Neo4j har en officiell MCP-server för det. MCP, Model Context Protocol, är en standard för att koppla AI-assistenter till verktyg och data. Med den kan Claude och andra assistenter läsa databasens struktur och ställa frågor direkt mot databasen.
Grafen har också blivit ett sätt att ge AI-agenter minne. Tjänsten Zep sparar det en agent lär sig som en kunskapsgraf där varje samband har en tidsstämpel, så att agenten vet både vad som gäller och vad som gällde förut. I företagets egen utvärdering svarade den rätt på 94,8 procent av frågorna i ett test av långtidsminne, mot 93,4 procent för forskningsprojektet MemGPT. Skillnaden är liten och mätt av företaget självt.
Riskkapitalbolaget Foundation Capital har gett nästa steg ett namn, context graphs. Det är grafer som sparar skälen bakom besluten tillsammans med själva besluten, så att nästa agent kan hitta prejudikat. Begreppet är nytt och drivs mest av investerare och leverantörer. Idén känns ändå igen från Panama Papers: svaret finns i sambanden.
Så ser du en kunskapsgraf växa fram
Det räcker med en AI-assistent för att se hur en kunskapsgraf byggs. Klistra in en offentlig text i Claude eller ChatGPT, till exempel en nyhetsartikel om ett företagsköp, tillsammans med prompten nedan.
Claude ritar diagrammet direkt. Visar ChatGPT bara koden, klistra in den i Mermaid Live, som ritar diagram ur Mermaid-kod. Titta efter två saker: samma person under flera namn och samband som inte står i texten. Det är precis de fel som behöver rättas när en riktig kunskapsgraf byggs.
Använder du Claude Desktop kan du gå ett steg längre med minnesservern från MCP-projektet. Den sparar det du berättar för Claude som en kunskapsgraf i en lokal fil, med saker, relationer och observationer. Claude kan sedan söka i den i senare samtal. Projektet kallar sina referensservrar demonstrationer, avsedda att visa hur MCP fungerar, så se den som ett sätt att lära känna grafminne. Hur du kopplar in en server står i vår guide till MCP.
Grafen gör sambanden till data
Grafdatabasen bygger på en enkel idé. Sambanden mellan sakerna är lika mycket data som sakerna själva och förtjänar att sparas så. För journalisterna bakom Panama Papers var det skillnaden mellan en hög dokument och en karta över vem som ägde vad.
För de flesta verksamheter räcker den databas de redan har, nu när den också kan besvara graffrågor. Det som ändras är frågorna. När AI-assistenterna ska svara på vem som hänger ihop med vem, i avtal, ägarkedjor och leverantörsled, behöver de sambanden uppritade. Där gör grafen skillnad, oavsett vilken databas den bor i.
