طرح پژوهشی «توسعه رویکرد خوشهبندی برای پیشنهاد اسناد علمی فارسی برمبنای دادههای فارسی پایگاه (گنج)» به پایان رسید
طرح پژوهشی دکتر مرضیه زرینبال با نام «توسعه رویکرد خوشهبندی برای پیشنهاد اسناد علمی فارسی برمبنای دادههای فارسی پایگاه اطلاعات علمی ایران (گنج)» به پایان رسید.
به گزارش «روابط عمومی پژوهشگاه علوم و فناوری اطلاعات ایران» در نشست 447 شورای پژوهش که سوم اسفند ماه 1400 برگزار شد، طرح پژوهشی «توسعه رویکرد خوشهبندی برای پیشنهاد اسناد علمی فارسی بر مبنای دادههای فارسی پایگاه اطلاعات علمی ایران (گنج)» توسط دکتر مرضیه زرینبال، عضو هیئت علمی پژوهشکده فناوری اطلاعات به پایان رسید.
سیستمهای پیشنهاددهنده سیستمهایی هستند که با ارائه پیشنهادهای متناسب با نیاز کاربر به او در تصمیمگیری کمک میکنند. نیازهای کاربر با کمک روشهای مختلفی نظیر بهرهگیری از عبارت پرسوجوی کاربر، تحلیل سند منتخب کاربر و یا تحلیل رفتار کاربر و یا کاربران مشابه استخراج میشود. سیستم پیشنهاددهنده مبتنی بر دانش یا مبتنی بر محتوی یکی از انواع سیستمهای پیشنهاددهنده است و برای توسعه آن خصوصا در سالهای اخیر از رویکردهای نوین نظیر یادگیری ماشین و تشخیص الگو استفاده میشود. خوشهبندی متن یکی از روشهای بسیار پرکاربرد در یادگیری ماشین است که در آن اسناد مشابه بر اساس ویژگیهای مناسب و شباهت بین اسناد خوشهبندی میشوند. لذا استخراج و انتخاب این ویژگیها برای اسناد و خوشهبندی اسناد از جمله چالشهای اصلی محسوب میشوند. همچنین، اغلب سیستمهای پیشنهاددهنده متن و الگوریتمهای خوشهبندی برای زبان انگلیسی توسعه پیدا کردهاند و به راحتی برای سایر زبانها، مانند زبان فارسی، قابل بکارگیری نیستند. بنابراین هدف اصلی در این طرح، توسعه و بکارگیری رویکرد خوشهبندی برای پیشنهاد اسناد علمی فارسی به کاربر است. برای ارزیابی رویکرد توسعه داده شده از فرادادههای پایاننامهها و رسالههای فارسی پایگاه گنج استفاده شده است. بر اساس ادبیات مربوط به خوشهبندی دادههای بزرگ، سه معیار شباهت مینکویسکی، کسینوسی و آنتروپی نسبی به عنوان معیارهای فاصله یا شباهت انتخاب و با کمک این معیارها سه الگوریتم خوشهبندی K-means، FCM وREFCM در نرمافزار Python پیادهسازی شدهاند. بر اساس نتایج بدست آمده، الگوریتم FCM (فاصله کسینوسی) و REFCM نتایج بهتری نسبت به الگوریتم K-means داشتهاند.
