طرح پژوهشی «طراحی و پیاده‌سازی وب سرویس استخراج خودکار کلیدواژه از مستندات علمی فارسی» به پایان رسید

طرح پژوهشی «طراحی و پیاده‌سازی وب سرویس استخراج خودکار کلیدواژه از مستندات علمی فارسی» به پایان رسید

طرح پژوهشی دکتر آزاده محبی با نام «طراحی و پیاده‌سازی وب سرویس استخراج خودکار کلیدواژه از مستندات علمی فارسی» به پایان رسید.

طرح پژوهشی «طراحی و پیاده‌سازی وب سرویس استخراج خودکار کلیدواژه از مستندات علمی فارسی» به پایان رسید

به گزارش «روابط‌ عمومی پژوهشگاه علوم و فناوری اطلاعات ایران» طرح پژوهشی «طراحی و پیاده‌سازی وب سرویس استخراج خودکار کلیدواژه از مستندات علمی فارسی» توسط دکتر آزاده محبی، استادیار پژوهشکده فناوری اطلاعات به پایان رسید.

کلیدواژه‌های اسناد علمی مانند پارساهای (پایان‌نامه‌ها و رساله‌ها) ثبت شده در پایگاه گنج، بیانگر موضوعات اصلی مطرح شده در سند هستند و در کارهایی نظیر بازیابی اطلاعات، خلاصه‌سازی خودکار اسناد، خوشه‌بندی اسناد، طراحی و ساخت آنتولوژی، و دسته‌بندی موضوعی اسناد، نقش کلیدی دارند. پارساهای کشور در پایگاه گنج ایرانداک ثبت می‌شوند و طی فرایند نمایه‌سازی توسط متخصصین کلیدواژه‌هایی به آنها اختصاص می‌یابد. تاکنون نزدیک به 800 هزار پارسا در پایگاه گنج ثبت شده که حدود 315 هزار رکورد نمایه شده‌اند و بیش از400 هزار رکورد در پایگاه گنج ثبت شده‌اند اما هنوز کلیدواژه‌ای به آنها تخصیص نیافته و در صف نمایه‌سازی هستند. از آنجایی‌که فرایند تخصیص کلیدواژه به صورت دستی بسیار زمانبر است، باید از روش‌های استخراج خودکار کلیدواژه برای اسنادی که تاکنون نمایه‌نشده‌اند و آنهایی که از این به بعد در پایگاه گنج ثبت می‌شوند، استفاده شود. در این طرح پژوهشی با توجه به تجربیات گذشته در طراحی و توسعه روش‌های استخراج خودکار کلیدواژه در طرح‌های پژوهشی پیشین که در ایرانداک انجام شده، برای پارساهای ثبت شده که هنوز نمایه نشده‌اند، کلیدواژه تخصیص می‌یابد. همچنین سرویسی در قالب API ارائه می‌شود که برای پارساهایی که پس از آن در گنج ثبت می‌شوند نیز کلیدواژه تخصیص یابد. الگوریتم تخصیص کلیدواژه بر پایه اطلاعات اصطلاحنامه‌های تخصصی و منابع دانشی مانند فهرست کلیدواژه‌های کمکی و نیز کلیدواژه‌های اسناد مشابه است. برای ارزیابی الگوریتم، تعداد محدودی از اسناد (حدود 1000 سند) به صورت تصادفی از حوزه‌های موضوعی مختلف انتخاب شده و کلیدواژه‍‌های آنها براساس الگوریتم تخصیص یافته است. سپس در یک سامانه ارزیابی که در این طرح توسعه یافته، نظرات متخصصین نمایه‌ساز درباره کلیدواژه‌های تخصیص یافته به آن اسناد دریافت و بررسی شده است. در نهایت از معیارهای دقت و فراخوانی و معیار Fبرای ارزیابی الگوریتم استفاده شده است. همچنین برای سرویس نمایه‌سازی،API توسعه یافته که با دریافت اطلاعات اولیه سند مانند عنوان و چکیده، در انتها کلیدواژه‌های مناسب را به آن تخصیص می‌دهد.

شماره :
6015
آخرین به روزرسانی :
جمعه, 26 دی 1404 - 23:27
X
Chat Icon