فراداده دادهای است که اطلاعاتی درباره دادهای دیگر ارائه میدهد. عنوان، نام دانشگاه، رشته تحصیلی، نام دانشجو، استاد راهنما، چکیده و کلمات کلیدی را میتوان از مهمترین فرادادههای پایاننامهها و رسالهها (پارساها) نام برد. از آنجاییکه فرادادهها در بازیابی اطلاعات نقش منحصر به فردی را ایفا مینمایند، استخراج صحیح و ذخیره آنها در سامانههای بازیابی اطلاعات حائز اهمیت است. با توجه به حجم بالای متون علمی و سرعت پایین کنترل دستی فراداده در سامانه ثبت پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک)، همواره نمایهسازی پارساهای دریافتی عقبتر از پارساهای دریافتی بوده و در نتیجه نمایش اطلاعات در سامانه گنج ایرانداک به روز نیست. با توجه به این مساله، افزایش سرعت کنترل فرادادهها از موارد اولویتدار سامانه ثبت است.
هدف اصلی این طرح پژوهشی طراحی الگوریتمی است که بتواند فرادادهها را از متن کامل پارساها استخراج نماید.چنین الگوریتمی میتواند با بررسی سیستمی و هوشمند فرادادههای پارساها، سرعت نمایهسازی پارساها در پایگاه ثبت را افزایش داده و منجر به بروز شدن پایگاه گنج گردد.
برای انجام این مهم پس از پیشپردازشهای رایج مانند نرمالسازی متن، حذف ایستواژهها و قطعهبندی در پردازش زبان فارسی، از هر پاراگراف ویژگیهای ساختاری و زبانی استخراج میگردد. استخراج ویژگی باید به گونهای طراحی گردد که فرادادههای متفاوت قابل تمیز دادن از هم باشند. در مرحله بعد با استفاده روشهای هوشمند دستهبندی چند کلاسه، روش پیشنهادی آموزش داده میشود. در این طرح پژوهشی برای مکاشفه بهتر و دستیابی به مقادیر بهینه دستهبند از الگوریتمهای فرامکاشفهای استفاده خواهد شد. ارزیابی روش پیشنهادی نشان میدهد در بسیاری از اقلام اطلاعاتی فراداده استخراج هوشمند و خودکار کارا بوده و امکان عملیاتی شدن ایده وجود دارد.
نصیری، جلالالدین، و نصراله پاکنیت. 1400. استخراج فراداده در پارساها با رویکرد الگوریتمهای دستهبندی. تهران: پژوهشگاه علوم و فناوری اطلاعات ایران.
