Tömeges idézésfeltöltés az MTMT-be nagy nyelvi modell segítségével

Micsik, András and Tanácsi, Roland (2026) Tömeges idézésfeltöltés az MTMT-be nagy nyelvi modell segítségével. In: A tudomány, az oktatás és a közgyűjteményi kiszolgálás új informatikai szinergiái : NETWORKSHOP 2026 : 35. Országos Informatikai Konferencia : 2026. március 31-április 2. Debreceni Egyetem, Debrecen. Hungarnet Egyesület, Budapest, pp. 213-221. ISBN 9786156792297 10.31915/NWS.2026.22

[img] Text
nws_2026_inpress_micsik.pdf

Download (708kB)

Abstract

A Magyar Tudományos Művek Tára (MTMT) a hazai tudományos eredmények és eredményesség hiteles adatbázisa. A kutatások eredményességének jelentős mutatója az idézettség, és ehhez az MTMT folyamatosan adatokat gyűjt. Az idézési adatokat nem mindig lehet központilag megszerezni vagy megvásárolni, ezért ezek feltöltése tudományterületenként változó arányban a szerzőkre és az MTMT adminisztrátoraira hárul. Az esetenként több ezer új idézési adat feltöltése óriási plusz terhet ró a kutatókra és a kutatást segítőkre. E feladat gépi asszisztálására a HUN-REN SZTAKI Elosztott Rendszerek Osztálya (DSD) már régóta próbálkozik különböző megoldásokkal. Az elmúlt 1–2 év mesterséges intelligencia (MI) fejlesztései már lehetővé teszik, hogy egy nagy nyelvi modell (LLM) intelligens módon gyűjtsön metaadatokat weblapokról. E lehetőség kihasználására fejlesztettünk ki egy parancssorból vezérelhető tömeges idézésfeldolgozó szkriptet, a Metaxa-t (Metadata Extractor), amelynek alapvető működési elveit mutatjuk itt be. | The Hungarian Science Bibliography (MTMT) is the authoritative database of Hungarian scientific achievements and performance. Citation count is a significant indicator of research performance, and MTMT collects citation data for this purpose. Citation data cannot always be obtained or purchased centrally, so uploading these data often falls to the authors and MTMT administrators. The occasional need to upload several thousand new citation records places a substantial additional burden on researchers and research support staff. To provide machine-assisted support for this task, the Department of Distributed Systems (DSD) of HUN-REN SZTAKI has long been experimenting with various solutions. Advances in artificial intelligence (AI) over the past 1–2 years now make it possible for a large language model (LLM) to intelligently collect metadata from web pages. To leverage this opportunity, we have developed a command-line–driven bulk citation processing script called Metaxa (Metadata Extractor), whose basic operating principles are presented here.

Item Type: Book Section
Subjects: Q Science > QA Mathematics and Computer Science > QA75 Electronic computers. Computer science / számítástechnika, számítógéptudomány
Divisions: Department of Distributed Systems
SWORD Depositor: MTMT Injector
Depositing User: MTMT Injector
Date Deposited: 09 Sep 2026 08:21
Last Modified: 09 Sep 2026 08:21
URI: https://eprints.sztaki.hu/id/eprint/11150

Update Item Update Item