En ny triple-robustness-analyse udfordrer den gængse antagelse om, at GraphRAG altid er bedre til fler-hop-spørgsmål. Forskerne holder retrieval-arkitekturen fast og varierer tre akser — embedder, korpus og dommer — på tværs af 4.440 hovedmatrix-kørsler, 600 kryds-korpus-kørsler og 1.200 parrede faithfulness-vurderinger.

Det vigtigste fund: over-citation er arkitektonisk universel. GraphRAG udsender 11-15 ID'er per svar med en citation-præcision på 0,12-0,23 og retrieval-recall på 0,68-0,87 — uanset indstilling. Men konsekvensen for faithfulness er korpus-betinget: På typed-edge DO-178C-krav falder GraphRAG's faithfulness fra 74% til 40% på tværs af hop, mens samme pipeline på Wikipedia-kæder stiger fra 42% til 58%, fordi over-citerede afsnit stadig er topisk understøttende.

For beslutningstagere betyder det, at valget mellem GraphRAG og vektor-RAG ikke kan træffes generisk. Analysen viser, at vinderen er stratum-betinget: vanilla vinder på 2-hop med DO-178C, mens GraphRAG vinder på 2-hop med MuSiQue — identisk under begge embedders. Med andre ord: din korpus-struktur og dine spørgsmåls dybde afgør, hvilken tilgang der giver mest værdi.

Endelig afslører undersøgelsen en skrøbelighed i selve evalueringsmetoden: En enkelt LLM-dommers faithfulness-vurdering er følsom over for retrieval-tilstand — same-judge self-kappa på tværs af embedders er kun 0,137 for GPT-5.4, med domæneændring på 41% af emnerne. Det betyder, at dine egne evalueringer kan være upålidelige, hvis du kun bruger én dommer.