در این طرح پژوهشی یک روش جدید برای برچسبگذاری تصاویر موجود در متون علمی فارسی معرفی میشود. در اسناد علمی، تصاویر حاوی اطلاعلات مهمی هستند و در بسیاری از موارد با بررسی آنها به تنهایی میتوان به ایده اصلی و یا نتایج مهم مقاله علمی پی برد بدون اینکه لازم باشد کل مقاله را مطالعه کرد. به دلیل رشد روز افزون دادههای تصویری، بسیاری از موتورهای جستجوگر مستندات علمی، به دنبال فراهم کردن امکان بازیابی تصاویر از پایگاه اطلاعاتی خود هستند، به طوری که کاربر با وارد کردن یک جستوجو، علاوه بر متن مقالات بتواند به تصاویر مربوط به آن جستوجو نیز دسترسی پیدا کند. هم اکنون در پایگاه اطلاعاتی گنج، که حاوی حجم زیادی از مستندات علمی و پایاننامهها و رسالههای فارسی کشور است، امکان جستوجو بر اساس یک عبارت متنی و بازیابی و نمایش نتایج جستوجو در قالب فرادادههای متنی (عنوان، چکیده، پدیدآور، سال انتشار) وجود دارد. لیکن تصاویر موجود در اسناد «گنج» بازیابی نمیشود. فراهم کردن چنین امکانی در «گنج» به عنوان یک ارزش افزوده میتواند آن را از موتورهای جستوجوی مشابه متمایز سازد. برای بازیابی تصاویر نیاز است که برچسبهای توصیفکنندهای برای هر تصویر استخراج شود. موتور جستوجو با استفاده از این برچسبها میتواند تصاویری را بازیابی کند که کلمات جستوجو شده در لیست برچسبهای آنها وجود دارد. در اینجا برای استخراج برچسب تصویر از متن سندی که تصویر به آن تعلق دارد استفاده شده است. زیرنویس و قسمتی از متن سند که در آن، به تصویر مورد نظر اشاره شده است در نظر گرفته میشود. عبارات اسمی در متن با استفاده از پنج روش متفاوت؛ فراوانی عبارات در سند، معکوس فراوانی سند، فراوانی کلمه- معکوس فراوانی سند، شباهت کسینوسی عبارات با زیرنویس و ترکیب روش فراوانی کلمه- معکوس فراوانی سند و شباهت کسینوسی با زیرنویس، رتبهبندی میشوند. برچسبهای انتخابی برای تصویر در هر روش، عبارات اسمی با رتبه بالاتر در آن روش است. روشهای معرفی شده با استفاده از داده آزمایشی ازگنج، ارزیابی میشوند. طبق نتایج بدست آمده بر روی داده آزمایشی در این تحقیق، روش فراوانی کلمه- معکوس فراوانی سند با معیار F1 ،38% بهترین روش برای برچسب زدن تصاویر و پس از آن ترکیب روش فراوانی کلمه- معکوس فراوانی سند و شباهت کسینوسی با زیرنویس با معیار F1 ،36% قرار دارد. از آنجاییکه در مواردی زیرنویس تصاویر توصیف کاملی از تصاویر نمیدهد، با در نظر گرفتن شباهت کسینوسی با زیرنویس تصاویر، معیار F1 کاهش مییابد.
فخرزاده، آزاده، و امیرحسین صدیقی. 1400. طراحی یک روش برای برچسبزدن تصاویر استخراجشده از پارساهای موجود در پایگاه اطلاعات علمی ایران (گنج). تهران: پژوهشگاه علوم و فناوری اطلاعات ایران.
