En produktionsklar agent skal kunne vælge den rette færdighed (skill) blandt et voksende bibliotek, når en bruger stiller en opgave. I en ny case study fra arXiv undersøger forskere, hvordan en multimodal video-agent-harness ved navn Tinycloud repræsenterer sine skills for planlæggeren, og resultatet er overraskende: At vise flere skills i systemprompten er ikke altid bedre. Faktisk kan delvis eksponering skabe en form for 'leksikalsk konkurrence', der undertrykker det korrekte valg.

Studiet sammenligner tre eksponeringsregimer: fuld autoload (alle skills indlæst), produktionsstandard (nogle autoloadede, nogle kun listet) og alt-af. I seks opgaver valgte fuld autoload den korrekte skill i alle tilfælde, mens alt-af gav langsommere eksekvering og hårde opdagelsesfejl. Men produktionsstandarden misrutede én opgave, fordi et leksikalsk signal kolliderede med en autoloadet tool-skill, der trak planlæggerens opmærksomhed væk fra en listet workflow-skill.

For beslutningstagere, der bygger eller køber agent-løsninger, er pointen klar: Designet af systemprompten og skill-repræsentationen er ikke en teknisk detalje, men en strategisk faktor, der kan afgøre, om agenten leverer pålideligt. Hvis man planlægger at skalere en agent med mange skills, bør man overveje, hvordan eksponeringen styres – ikke bare hvor mange skills der er tilgængelige.

Forskerne forbinder denne lille-skala observation med nyere retrieval-baseret skill-routing på stor skala og rammer bidraget ind som en case study snarere end en benchmark. Læs hele papiret for detaljer om eksperimentdesign og implikationer for retrieval-baserede systemer.