کلمات کلیدی زیرمجموعهای از کلمات یا عبارات یک سند هستند که میتوانند معنای سند را توصیف کنند و در فرایند بازیابی اطلاعات نقش مهمی ایفا کنند. از آنجا که عملیات استخراج کلیدواژه یا عبارات کلیدی از متون تخصصی و علمی کاری تخصصی و زمانبر بوده و حجم اسناد علمی که نیاز به کلیدواژه دارند روزافزون است، الگوریتمهای مختلفی برای استخراج تخصصی و خودکار کلیدواژه و عبارات کلیدی به اسناد طراحی و پیادهسازی شدهاند. RAKE یک الگوریتم پرکاربرد برای استخراج کلمات کلیدی از متون است. اساس کار الگوریتم RAKE، کلمات کلیدی و عموماً حاوی چندین کلمه (یعنی عبارت کلیدی) هستند، ولی علائم نگارشی یا کلمات بیمعنا یا ایستواژهها را شامل نمیشوند. در این الگوریتم از برچسبگذاری دستوری کلمات بهعنوان ابزاری برای تعیین ضریب اهمیت آنها در جملات استفاده میشود. کلیدواژهها مجموعهای از توالیهای چندکلمهای یا تککلمهای هستند که طبق معیارهای خاصی امتیازدهی میشوند. در این پژوهش، یک نسخه بهبودیافته از الگوریتم استخراج خودکار کلیدواژه (RAKE) ارائه شده است. در نسخه بهبودیافته سعی شده با ایجاد تغییراتی در معیارهای امتیازدهی عبارات کاندید، دقت و بازخوانی عبارات کلیدی استخراجشده افزایش یابد. راهکار ارائه شده برای بهبود الگوریتم RAKE با در نظر گرفتن ضعفهای موجود در رویکردهای وزندهی دراین الگوریتم به ویژه برای زبان فارسی و مستندات علمی پیشنهاد شده است. برای بررسی نقاط ضعف الگوریتم RAKE و ارائه راهکار پیشنهادی از مجموعهای از فرادادههای پایاننامه و رسالههای فارسی استفاده شده است. راهکار پیشنهادی روی این دادهها آزمایش و ارزیابی شده و باعث افزایش دقت، بازخوانی و معیار F شده است.
الهه محرابی، آزاده محبی، و عباس احمدی. 1400. بهبود الگوریتم RAKE برای استخراج کلیدواژه از متون علمی فارسی؛ مطالعه موردی: پایاننامهها و رسالههای فارسی. پژوهشنامه پردازش و مدیریت اطلاعات 37 (1): 197-228.
