Et nyt forskningspapir fra arXiv introducerer en reinforcement learning (RL) metode, der er skræddersyet til kontinuerlig-tid jump Markov decision processes (CTJMDPs) med generelle diskrete tilstandsrum. Metoden er designet til applikationer som netværksdynamisk prisfastsættelse, hvor virksomheder skal balancere udbud og efterspørgsel i realtid.
Traditionelle RL-teknikker, som q-learning for kontrollerede diffusioner, er begrænset til kontinuerlige tilstandsrum og kan ikke håndtere diskrete strukturer, der ofte findes i operations management. Forskerne bag papiret har nu etableret de teoretiske fundamenter for q-learning i CTJMDPs og udviklet en model-fri algoritme, der ikke kræver kendskab til systemets dynamik.
Numeriske eksperimenter inden for netværksdynamisk prisfastsættelse viser, at den nye algoritme konsekvent overgår standard benchmark-metoder og leverer nær-optimale løsninger, selv i store netværksinstanser. Dette er et vigtigt skridt mod praktisk anvendelse af RL i komplekse beslutningsmiljøer.
For beslutningstagere betyder det, at virksomheder, der opererer med dynamiske priser – eksempelvis i detailhandel, transport eller energisektoren – kan få adgang til mere effektive optimeringsværktøjer, der kan håndtere komplekse, diskrete tilstande uden at kræve tung beregningskraft.
