سیستمهای پیشنهاددهنده سیستمهایی هستند که با ارائه پیشنهادهای متناسب با نیاز کاربر به او در تصمیمگیری کمک میکنند. نیازهای کاربر با کمک روشهای مختلفی نظیر بهرهگیری از عبارت پرسوجوی کاربر، تحلیل سند منتخب کاربر و یا تحلیل رفتار کاربر و یا کاربران مشابه استخراج میشود. سیستم پیشنهاددهنده مبتنی بر دانش یا مبتنی بر محتوی یکی از انواع سیستمهای پیشنهاددهنده است و برای توسعه آن خصوصا در سالهای اخیر از رویکردهای نوین نظیر یادگیری ماشین و تشخیص الگو استفاده میشود. خوشهبندی متن یکی از روشهای بسیار پرکاربرد در یادگیری ماشین است که در آن اسناد مشابه بر اساس ویژگیهای مناسب و شباهت بین اسناد خوشهبندی میشوند. لذا استخراج و انتخاب این ویژگیها برای اسناد و خوشهبندی اسناد از جمله چالشهای اصلی محسوب میشوند. همچنین، اغلب سیستمهای پیشنهاددهنده متن و الگوریتمهای خوشهبندی برای زبان انگلیسی توسعه پیدا کردهاند و به راحتی برای سایر زبانها، مانند زبان فارسی، قابل بکارگیری نیستند. بنابراین هدف اصلی در این طرح، توسعه و بکارگیری رویکرد خوشهبندی برای پیشنهاد اسناد علمی فارسی به کاربر است. برای ارزیابی رویکرد توسعه داده شده از فرادادههای پایاننامهها و رسالههای فارسی پایگاه گنج استفاده شد. بر اساس ادبیات مربوط به خوشهبندی دادههای بزرگ، سه معیار شباهت مینکویسکی، کسینوسی و آنتروپی نسبی به عنوان معیارهای فاصله یا شباهت انتخاب و با کمک این معیارها سه الگوریتم خوشهبندی K-means، FCM وREFCM در نرمافزار Python پیادهسازی شدند. بر اساس نتایج بدست آمده، الگوریتم FCM (فاصله کسینوسی) وREFCM نتایج بهتری نسبت به الگوریتم K-means داشتند.
زرینبال ماسوله، مرضیه، و آزاده محبی. 1400. توسعه رویکرد خوشهبندی برای پیشنهاد اسناد علمی فارسی بر مبنای دادههای فارسی پایگاه اطلاعات علمی ایران (گنج). تهران: پژوهشگاه علوم و فناوری اطلاعات ایران.
