Forskere har udviklet et nyt system, SNAIL, der automatisk kan genkende navne på bioinformatik-software og databaser i videnskabelig litteratur. Systemet, beskrevet i en ny artikel på arXiv, kombinerer leksikalske mønstre med sprogmodeller som SciBERT og en token-maskeringsstrategi for at forbedre genkendelsen af værktøjsnavne.
SNAIL blev trænet på et stort korpus bygget automatisk gennem en hybrid pipeline, der kombinerer citationsbaseret ekstraktion med LLM-assisteret destillation. I evalueringer på to uafhængige benchmarks og rigtige forskningsartikler overgår SNAIL markant eksisterende metoder, herunder domænespecifikke systemer som bioNerDS2 og generelle sprogmodeller som ChatGPT, Gemini, Grok og Claude.
For beslutningstagere i life science-sektoren betyder dette en mere pålidelig måde at kortlægge, hvilke værktøjer der faktisk bruges i forskningen. Systemet muliggør systematisk meta-analyse af værktøjsbrug og forskningstendenser på tværs af delområder, hvilket kan informere alt fra biblioteksinvesteringer til strategiske partnerskaber med softwareudviklere.
