طرح پژوهشی «استخراج فراداده در پارساها با رویکرد الگوریتمهای دستهبندی» به پایان رسید
طرح پژوهشی دکتر جلالالدین نصیری با نام «استخراج فراداده در پارساها با رویکرد الگوریتمهای دستهبندی» به پایان رسید.
به گزارش «روابط عمومی پژوهشگاه علوم و فناوری اطلاعات ایران» در نشست 409 شورای پژوهش که 18 اردیبهشت ماه 1400 برگزار شد، طرح پژوهشی «استخراج فراداده در پارساها با رویکرد الگوریتمهای دستهبندی» توسط دکتر جلالالدین نصیری، به پایان رسید.
فراداده دادهای است که اطلاعاتی درباره دادهای دیگر ارائه میدهد. عنوان، نام دانشگاه، رشته تحصیلی، نام دانشجو، استاد راهنما، چکیده و کلمات کلیدی را میتوان از مهمترین فرادادههای پایاننامهها و رسالهها (پارساها) نام برد. از آنجاییکه فرادادهها در بازیابی اطلاعات نقش منحصربهفردی را ایفا مینمایند، استخراج صحیح و ذخیره آنها در سامانههای بازیابی اطلاعات حائز اهمیت است. با توجه به حجم بالای متون علمی و سرعت پایین کنترل دستی فراداده در سامانه ثبت پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک)، همواره نمایهسازی پارساهای دریافتی عقبتر از پارساهای دریافتی بوده و در نتیجه نمایش اطلاعات در سامانه گنج ایرانداک به روز نیست. با توجه به این مساله، افزایش سرعت کنترل فرادادهها از موارد اولویتدار سامانه ثبت است.
هدف اصلی این طرح پژوهشی طراحی الگوریتمی است که بتواند فرادادهها را از متن کامل پارساها استخراج نماید. چنین الگوریتمی میتواند با بررسی سیستمی و هوشمند فرادادههای پارساها، سرعت نمایهسازی پارساها در پایگاه ثبت را افزایش داده و منجر به بهروز شدن پایگاه گنج گردد.
برای انجام این مهم پس از پیشپردازشهای رایج مانند نرمالسازی متن، حذف ایستواژهها و قطعهبندی در پردازش زبان فارسی، از هر پاراگراف ویژگیهای ساختاری و زبانی استخراج میگردد. استخراج ویژگی باید به گونهای طراحی گردد که فرادادههای متفاوت قابل تمیز دادن از هم باشند. در مرحله بعد با استفاده از روشهای هوشمند دستهبندی چند کلاسه، روش پیشنهادی آموزش داده میشود. در این طرح پژوهشی برای مکاشفه بهتر و دستیابی به مقادیر بهینه دستهبند از الگوریتمهای فرامکاشفهای استفاده خواهد شد. ارزیابی روش پیشنهادی نشان داده است که در بسیاری از اقلام اطلاعاتی فراداده استخراج هوشمند و خودکار کارا بوده و امکان عملیاتی شدن ایده وجود دارد.
