طراحی و پیاده‌سازی وب سرویس استخراج خودکار کلیدواژه از مستندات علمی فارسی

طراحی و پیاده‌سازی وب سرویس استخراج خودکار کلیدواژه از مستندات علمی فارسی
نوع طرح پژوهشی
دسته‌بندی موضوعی
تاریخ تصویب
وضعیت طرح
چکیده

 کلیدواژه‌های اسناد علمی مانند پارساهای (پایان‌نامه‌ها و رساله‌ها) ثبت شده در پایگاه گنج، بیانگر موضوعات اصلی مطرح شده در سند هستند و در کارهایی نظیر بازیابی اطلاعات، خلاصه‌سازی خودکار اسناد، خوشه‌بندی اسناد، طراحی و ساخت آنتولوژی، و دسته‌بندی موضوعی اسناد، نقش کلیدی دارند. پارساهای کشور در پایگاه گنج  ایرانداک ثبت می‌شوند و طی فرایند نمایه‌سازی توسط متخصصین کلیدواژه‌هایی به آنها اختصاص می‌یابد. تاکنون نزدیک به 800 هزار پارسا در پایگاه گنج ثبت شده که حدود 315 هزار رکورد نمایه شده‌اند و بیش از400 هزار رکورد در پایگاه گنج ثبت شده‌اند اما هنوز کلیدواژه‌ای به آنها تخصیص نیافته و در صف نمایه‌سازی هستند. از آنجاییکه فرایند تخصیص کلیدواژه به صورت دستی بسیار زمانبر است، باید از روش‌های استخراج خودکار کلیدواژه برای اسنادی که تاکنون نمایه‌نشده‌اند و آنهایی که از این به بعد در پایگاه گنج ثبت می‌شوند، استفاده شود. در این طرح پژوهشی با توجه به تجربیات گذشته در طراحی و توسعه روش‌های استخراج خودکار کلیدواژه در طرح‌های پژوهشی پیشین که در ایرانداک انجام شده، برای پارساهای ثبت شده که هنوز نمایه نشده‌اند، کلیدواژه تخصیص می‌یابد. همچنین سرویسی در قالب API ارائه می‌شود که برای پارساهایی که پس از آن در گنج ثبت می‌شوند نیز کلیدواژه تخصیص یابد. الگوریتم تخصیص کلیدواژه بر پایه اطلاعات اصطلاحنامه‌های تخصصی و منابع دانشی مانند فهرست کلیدواژه‌های کمکی و نیز کلیدواژه‌های اسناد مشابه است. برای ارزیابی الگوریتم، تعداد محدودی از اسناد (حدود 1000 سند) به صورت تصادفی از حوزه‌های موضوعی مختلف انتخاب شده و کلیدواژه‍‌های آنها براساس الگوریتم تخصیص یافته است. سپس در یک سامانه ارزیابی که در این طرح توسعه یافته، نظرات متخصصین نمایه‌ساز درباره کلیدواژه‌های تخصیص یافته به آن اسناد دریافت و بررسی شده است. در نهایت از معیارهای دقت و فراخوانی و معیار Fبرای ارزیابی الگوریتم استفاده شده است. همچنین برای سرویس نمایه‌سازی،API توسعه یافته که با دریافت اطلاعات اولیه سند مانند عنوان و چکیده، در انتها کلیدواژه‌های مناسب را به آن تخصیص می‌دهد.

استناد

محبی، آزاده، امیر بادامچی، مرضیه زرین‌بال ماسوله، علی اصغر حجت پناه، و زهرا دهسرایی. 1403. طراحی و پیاده‌سازی وب سرویس استخراج خودکار کلیدواژه از مستندات علمی فارسی. تهران: پژوهشگاه علوم و فناوری اطلاعات ایران.

فایل پیوست
خلاصه متن فارسی (122.77 کیلوبایت)
شماره :
5295
آخرین به روزرسانی :
جمعه, 26 دی 1404 - 23:30
X
Chat Icon