Ny forskning fra arXiv viser, at nøglen til mere præcise LLM-baserede digitale tvillinger ikke er mængden af data, men hvordan informationen struktureres. En undersøgelse sammenligner ustrukturerede resuméer med strukturerede persona-repræsentationer og finder, at en fast skabelon (BDE: Baggrund, Beslutningsprocedure, Evaluering) forbedrer prædiktiv nøjagtighed med +1,91 procentpoint på en homogen benchmark (Twin-2K-500), men fejler på mere heterogene opgaver, hvor resultaterne er statistisk uadskillelige fra baseline.
For at løse denne begrænsning introducerer forskerne en automatisk struktur-opdagelsespipeline, hvor en LLM iterativt foreslår og forfiner opgavespecifikke persona-strukturer. På en benchmark med 13 forskellige delstudier genopretter denne tilgang ydeevnen og forbedrer gennemsnitlig nøjagtighed med +1,91 procentpoint over baseline, hvilket eliminerer de signifikante tab, der blev observeret med den faste skabelon.
For beslutningstagere, der overvejer at implementere digitale tvillinger til kundesimulering eller personalisering, betyder dette, at investering i strukturering af data kan være vigtigere end at indsamle flere data. Den automatiske pipeline tilbyder en skalerbar metode til at opnå dette uden manuel skabelon-design.
