To GPU-kernels, der implementerer samme INT8-matrixmultiplikation, betragtes normalt som udskiftelige. En ny undersøgelse fra arXiv viser, at det er en farlig antagelse: Selv med præcis samme checkpoint, prompts, hardware, inferens-engine og kvantiseringskonfiguration, gav to forskellige INT8-kernels (CUTLASS og Triton) ingen identiske sekvenser i nogen ende-til-ende-sammenligning (0/8, 0/16 og 0/64 sekvenser). Det skriver forskerne bag papiret.

Forskellen skyldes ikke akkumulatoren: For fælles INT8-operander under en verificeret no-overflow-grænse er INT32-dotproduktet eksakt og rækkefølge-uafhængigt. I stedet lokaliserer forskerne divergensen til skala-anvendelse og output-afrunding efter den eksakte akkumulator. Ved at anvende en såkaldt probe-checkpoint kunne de genskabe bitvis identiske resultater (8/8 og 16/16 sekvenser).

For beslutningstagere er implikationen klar: Reproducerbarhed i AI-systemer er ikke garanteret, selv med samme model og hardware. Hvis din virksomhed er afhængig af konsistente resultater — fx i regulerede brancher, finans eller sundhed — kan valget af kernel have utilsigtede konsekvenser. Forskerne frigiver en konformitetsprocedure der kan tjekke, om to kernels er udskiftelige i praksis.