Reinforcement learning (RL) har længe været lovende for industriel styring, men én barriere har holdt det tilbage: hyperparameter-valg. Når simulatorer ikke findes, og online eksperimenter er dyre, er det svært at finde de rigtige indstillinger. Nu viser forskere fra et kommunalt vandrensningsanlæg, at offline-dynamikmodeller – også kaldet kalibreringsmodeller – kan løse problemet i praksis. Det er første gang, metoden afprøves i en ægte industriel sammenhæng, og resultaterne er offentliggjort på arXiv.
Forskerne evaluerede flere tilgange, herunder en k-nærmeste-nabo-model med Laplaciansk afstandsmetrik, på højdimensionelle, ikke-stationære sensordata. Modellerne genererede realistiske langtidssimuleringer og genskabte meningsfulde følsomhedstendenser for hyperparametre. Det betyder, at man kan vælge indstillinger baseret på offline-data alene – uden at skulle køre dyre online-eksperimenter eller bygge en simulator.
For beslutningstagere i industrien er implikationen klar: RL kan blive langt mere anvendeligt i miljøer, hvor man hidtil har måttet nøjes med heuristikker eller manuel tuning. Artiklen adresserer også skalerbarhed til årslange datasæt, valg af fine-tuning-læringsrater for præ-trænede agenter og robusthed under distribution shift – alle praktiske spørgsmål, som virksomheder vil møde, når de ruller RL ud.
Selvom resultaterne er et proof of concept, peger de på en vej mod bredere RL-adoption i driftstunge sektorer som vand, energi og logistik. De praktiske udfordringer, der fremhæves, er dog ikke trivielle: distribution shift og ikke-stationære data er netop de forhold, der kendetegner mange industrielle miljøer.
