En ny undersøgelse fra arXiv viser, at en kombination af traditionelle statistiske modeller og machine learning kan give mere pålidelige folkesundhedsprognoser end nogen enkeltmodel. Forskerne bag MLAMA (Machine Learning and ARIMA Model Averaging) testede ARIMA, random forest og XGBoost på 190 ugentlige observationer af COVID-19-tal i Ontario fra januar 2020 til oktober 2023.
Resultaterne er ikke kun akademiske. For beslutningstagere, der skal planlægge sundhedsindsatser, viser undersøgelsen, at valget af prognosemodel bør afhænge af situationen: ARIMA tilpassede sig hurtigt efter vendepunkter, men fejlen voksede ved længere horisonter. Random forest og XGBoost var mindre responsive i starten, men mere stabile over tid. MLAMA, der vægter modellerne efter ydelse og horisont, opnåede den laveste gennemsnitlige fejl på tværs af de fleste horisonter.
Det centrale budskab er, at man ikke skal satse på én model, men på en kombination, der kan tilpasses de aktuelle driftsbetingelser. For eksempel viste undersøgelsen, at træning på de seneste data var bedre end længere historiske perioder for to-ugers prognoser – især for XGBoost. Det har direkte konsekvenser for, hvordan man bygger og opdaterer prognosesystemer i sundhedssektoren.
Pakken bag MLAMA er endnu ikke offentligt tilgængelig, da den gennemgår validering og reproducerbarhedstest. Men metoden er beskrevet i detaljer i den fulde artikel, så andre kan implementere den.
