IBM har offentliggjort en ny arkitektur, der lader virksomheder køre retrieval-augmented generation (RAG) – altså AI-svar baseret på egne data – helt og holdent på én LinuxONE-maskine. Pointen er ikke kun hastighed, men at følsomme data aldrig forlader hardwaren, hvilket løser et klassisk dilemma for regulerede brancher: data ligger ét sted, AI-kraften et andet, og flytningen imellem skaber latens-, sikkerheds- og compliance-problemer.
Arkitekturen, beskrevet i et nyt paper på arXiv, består af seks delsystemer: fra query-modtagelse over vektor-søgning og prompt-samling til LLM-inferens, compliance-filtrering og svar-levering. Spyre-acceleratoren (en PCIe-inferens-card bygget til LinuxONE og IBM Z) håndterer den tunge generative inferens, mens Telum II-on-chip-acceleratoren klarer lette klassificeringsopgaver. Hele pipelinen kører i Red Hat OpenShift, og LinuxONE's Secure Execution-teknologi udvider confidential-computing-garantierne til AI-workloads.
De tidlige analyser viser end-to-end RAG-latenstider på under to sekunder og op til 20x reduktion sammenlignet med inferens uden for platformen – alt sammen med stærk kryptering og auditability, som regulerede industrier kræver.
For beslutningstagere er konsekvensen klar: Hvis tallene holder, kan virksomheder i finans, sundhed og offentlig sektor overveje at flytte AI-inferens tættere på dataene – eller helt ind i samme hardware – uden at gå på kompromis med sikkerhed eller performance. Det ændrer regnestykket for dem, der i dag køber cloud-GPU-kapacitet og betaler for dataoverførsel og compliance-risici.
