En ny benchmark, PoolBench, sætter fokus på en overset, men afgørende designbeslutning i arbejdet med at forstå, hvordan sprogmodeller repræsenterer koncepter: pooling. Når en model skal sammenfatte token-niveauets skjulte tilstande til en passage-niveau-vektor, findes der ingen fælles standard for, hvordan dette valg sammenlignes på tværs af koncepter, modeller og opgaver. Rapporterede forbedringer er ofte blandet sammen med ændringer i datasæt, lag, konstruktionsmetode og pooling-regel, hvilket gør princippet om beslutninger umuligt.
PoolBench isolerer pooling som den eksperimentelle variabel under en fast evalueringsprotokol. Benchmarket dækker 17 koncepter, 19 pooling-strategier og 3 åbne decoder-only-modeller (Llama-3.1-8B, Gemma-2-9B, Mistral-7B), evalueret på et enkelt revideret korpus af 37.693 rigtige tekstpassager. Hovedaksen er lineær separabilitet (D1/AUROC); styret konceptforekomst (D2/SCP) og output-niveau-disentanglement (D3) fungerer som diagnostiske akser.
Det primære resultat er klart: W4_hierarchical når en tværmodel-gennemsnitlig AUROC på 0,7799, mens den bredt anvendte P1_last_token-baseline kun når 0,7640 og er statistisk signifikant dårligere (Friedman+Nemenyi, p = 2.0e-36; 77 signifikante par blandt 18 effektive strategier). Rangeringerne er stabile på tværs af lag (rho = 0,961–0,990).
Et vigtigt negativt resultat: Stærk detektion indebærer ikke stærk styring – D2 og D3 er væsentligt svagere end D1 for de fleste koncepter, hvilket indikerer en fundamental repræsentationsbegrænsning snarere end en pooling-fejl. På mellemsvære koncepter overgår W4_hierarchical P1_last_token med 0,042–0,113 AUROC; konstruktionsmetodevalg (DiffMean vs. REPE) har en større effekt (delta AUROC 0,15) end pooling (delta AUROC 0,016), hvilket etablerer det korrekte praktiske hierarki.
For beslutningstagere, der bygger eller køber AI-systemer, betyder dette, at fokus på pooling-strategi alene kan være misvisende. Investeringer i at forbedre konceptrepræsentation bør først adressere konstruktionsmetode og de fundamentale begrænsninger i styring, før man optimerer på pooling-detaljer. PoolBench tilbyder en genanvendelig protokol med korpus, præ-ekstraherede aktiveringer, scorer-modeller, styringsvektorer og evalueringskode, hvilket gør det muligt for teams at træffe mere informerede valg.
