Nalazite se
Članak
Objavljeno: 12.08.2026. 10:41

Cornell University 

Predviđanje popularnosti budućih znanstvenih radova

Istraživači su pronašli način za uočavanje budućih istraživanja koja će ostvariti veliki uspjeh u budućnosti.

Predviđanje popularnosti budućih znanstvenih radova

Znanstvenici na američkom Sveučilištu Cornell, objavili su rad koji predstavlja novi pristup predviđanju dugoročnih ishoda pod nazivom Lead-Lag Forecasting (LLF).

Ideja je jednostavna: rani korisnički signali, poput pregleda, pristupa, lajkova ili aktivnosti na nekom projektu, mogu prethoditi važnijim rezultatima koji se pojavljuju tek mjesecima ili godinama kasnije. Autori žele utvrditi koliko se takvi rani signali mogu iskoristiti za predviđanje budućeg utjecaja.

Kako bi omogućili sustavno istraživanje tog problema, autori stvaraju dva velika javna skupa podataka. Prvi obuhvaća oko 2,3 milijuna znanstvenih radova s arXiva, povezujući broj ranih pristupa s kasnijim citatima. Drugi obuhvaća oko 3 milijuna GitHub repozitorija, pri čemu se rani broj „pushova“ i zvjezdica koristi za predviđanje budućeg broja 'forkova' (kopije nekog tuđeg repozitorija koju napravite na svom GitHub računu kako bi je mogli samostalno razvijati). Oba skupa omogućuju predviđanje ishoda na horizontu od čak pet godina, što je znatno dulje od većine postojećih skupova za vremenske prognoze.

Analiza pokazuje da rani signali doista sadrže značajnu količinu informacija o budućem uspjehu. Kod znanstvenih radova broj pristupa u prvih nekoliko mjeseci pokazuje snažnu povezanost s brojem citata nakon pet godina, pri čemu su pristupi u ranoj fazi često bolji prediktor od tadašnjih citata. Kod GitHuba zvjezdice se pojavljuju znatno prije forkova i pokazuju snažniju povezanost s dugoročnim brojem forkova.

Eksperimenti s različitim metodama strojnog učenja potvrđuju da se dugoročni uspjeh može predviđati čak i iz relativno malo početnih podataka. Primjerice, kod arXiva, model koji koristi samo rani broj pristupa postiže AUC (mjera za ocjenjivanje koliko dobro model strojnog učenja razlikuje dvije skupine) oko 0,80 nakon 30 dana, odnosno oko 0,86 nakon godinu dana. Kombiniranje više kanala dodatno poboljšava rezultate, a napredniji modeli vremenskih serija posebno dobro funkcioniraju pri duljim horizontima.

Važan zaključak rada jest da više različitih ranih ponašanja zajedno daje bolju prognozu od pojedinačnog pokazatelja. Ipak, autori naglašavaju da njihovi rezultati pokazuju statističku prediktivnost, a ne nužno uzročnost. Primjerice, velik broj ranih pristupa ne znači da će sam po sebi izazvati veći broj citata. 

Rad tako postavlja temelje za novu istraživačku paradigmu koja bi se u budućnosti mogla primijeniti i na druge sustave, primjerice za predviđanje kupnje iz ranih klikova, popularnosti sadržaja iz pregleda ili dugoročnog uspjeha proizvoda iz početne aktivnosti korisnika.

Ukratko, rad pokazuje da se iz ponašanja ljudi u prvih nekoliko dana ili mjeseci može iznenađujuće dobro predvidjeti što će se s nekim sadržajem dogoditi godinama kasnije. Najvažniji doprinos nije samo u modelima, nego u stvaranju ogromnih javnih skupova podataka koji omogućuju da se taj problem ubuduće sustavno istražuje.

Vezani sadržaji
Ključne riječi Cornell University
Komentari

Učitavam komentare ...

Učitavam