کلیدواژههای اسناد علمی مانند پارساهای (پایاننامهها و رسالهها) ثبت شده در پایگاه گنج، بیانگر موضوعات اصلی مطرح شده در سند هستند و در کارهایی نظیر بازیابی اطلاعات، خلاصهسازی خودکار اسناد، خوشهبندی اسناد، طراحی و ساخت آنتولوژی، و دستهبندی موضوعی اسناد، نقش کلیدی دارند. پارساهای کشور در پایگاه گنج ایرانداک ثبت میشوند و طی فرایند نمایهسازی توسط متخصصین کلیدواژههایی به آنها اختصاص مییابد. تاکنون نزدیک به 800 هزار پارسا در پایگاه گنج ثبت شده که حدود 315 هزار رکورد نمایه شدهاند و بیش از400 هزار رکورد در پایگاه گنج ثبت شدهاند اما هنوز کلیدواژهای به آنها تخصیص نیافته و در صف نمایهسازی هستند. از آنجاییکه فرایند تخصیص کلیدواژه به صورت دستی بسیار زمانبر است، باید از روشهای استخراج خودکار کلیدواژه برای اسنادی که تاکنون نمایهنشدهاند و آنهایی که از این به بعد در پایگاه گنج ثبت میشوند، استفاده شود. در این طرح پژوهشی با توجه به تجربیات گذشته در طراحی و توسعه روشهای استخراج خودکار کلیدواژه در طرحهای پژوهشی پیشین که در ایرانداک انجام شده، برای پارساهای ثبت شده که هنوز نمایه نشدهاند، کلیدواژه تخصیص مییابد. همچنین سرویسی در قالب API ارائه میشود که برای پارساهایی که پس از آن در گنج ثبت میشوند نیز کلیدواژه تخصیص یابد. الگوریتم تخصیص کلیدواژه بر پایه اطلاعات اصطلاحنامههای تخصصی و منابع دانشی مانند فهرست کلیدواژههای کمکی و نیز کلیدواژههای اسناد مشابه است. برای ارزیابی الگوریتم، تعداد محدودی از اسناد (حدود 1000 سند) به صورت تصادفی از حوزههای موضوعی مختلف انتخاب شده و کلیدواژههای آنها براساس الگوریتم تخصیص یافته است. سپس در یک سامانه ارزیابی که در این طرح توسعه یافته، نظرات متخصصین نمایهساز درباره کلیدواژههای تخصیص یافته به آن اسناد دریافت و بررسی شده است. در نهایت از معیارهای دقت و فراخوانی و معیار Fبرای ارزیابی الگوریتم استفاده شده است. همچنین برای سرویس نمایهسازی،API توسعه یافته که با دریافت اطلاعات اولیه سند مانند عنوان و چکیده، در انتها کلیدواژههای مناسب را به آن تخصیص میدهد.
محبی، آزاده، امیر بادامچی، مرضیه زرینبال ماسوله، علی اصغر حجت پناه، و زهرا دهسرایی. 1403. طراحی و پیادهسازی وب سرویس استخراج خودکار کلیدواژه از مستندات علمی فارسی. تهران: پژوهشگاه علوم و فناوری اطلاعات ایران.
