En ny transformatorarkitektur fra forskere på arXiv adresserer et stigende problem for virksomheder, der kører store sprogmodeller i produktion: de kumulative inferensomkostninger vokser hurtigere end træningsomkostningerne. Dual-Flow Transformer adskiller den indledende promptbehandling (prefill) fra den løbende tekstgenerering (decode) ved at tilføje en separat 'hjælpeflow', der kun aktiveres efter prompten. Dette giver mulighed for at øge decode-kapaciteten uden at øge prefill-omkostningerne, hvilket er afgørende, da decode ofte er hukommelsesbåndbredde-begrænset og dyr i drift.

Arkitekturen deler vægte og KV-cache mellem de to flows, hvilket skaber genbrug af data under eksekvering. I MoE-modeller kan primære og hjælpe-ekspert-fan-outs styres uafhængigt, hvilket giver fase-specifik kontrol over omkostninger og kvalitet. Eksperimenter viser lavere validation loss ved matchet token-forbrug og afslører en prefill-decode-kvalitetsafvejning.

For beslutningstagere betyder dette, at man kan optimere inferensomkostninger mere præcist: For eksempel kan man øge decode-kapacitet for lange generationer uden at betale for dyrere prefill. Dette kan reducere driftsomkostninger for AI-tjenester med høj gennemstrømning, som chatbots eller agenter, og gøre det mere attraktivt at skalere modeller i produktion.