طراحی یک روش برای برچسب‌زدن تصاویر استخراج‌شده از پارساهای موجود در پایگاه اطلاعات علمی ایران (گنج)

طراحی یک روش برای برچسب‌زدن تصاویر استخراج‌شده از پارساهای موجود در پایگاه اطلاعات علمی ایران (گنج)
همکار(ان)
نوع طرح پژوهشی
دسته‌بندی موضوعی
تاریخ تصویب
وضعیت طرح
چکیده

در این طرح پژوهشی یک روش جدید برای برچسب‌گذاری تصاویر موجود در متون علمی فارسی معرفی می‌شود. در اسناد علمی، تصاویر حاوی اطلاعلات مهمی هستند و در بسیاری از موارد با بررسی آنها به تنهایی می‌توان به ایده اصلی و یا نتایج مهم مقاله علمی پی برد بدون اینکه لازم باشد کل مقاله را مطالعه کرد. به دلیل رشد روز افزون داده‌های تصویری، بسیاری از موتورهای جستجوگر مستندات علمی، به دنبال فراهم کردن امکان بازیابی تصاویر از پایگاه اطلاعاتی خود هستند، به طوری که کاربر با وارد کردن یک جست‌وجو، علاوه بر متن مقالات بتواند به تصاویر مربوط به آن جست‌و‌جو نیز دسترسی پیدا کند. هم اکنون در پایگاه اطلاعاتی گنج، که حاوی حجم زیادی از مستندات علمی و پایان‌نامه‌ها و رساله‌های فارسی کشور است، امکان جست‌و‌جو بر اساس یک عبارت متنی و بازیابی و نمایش نتایج جست‌و‌جو در قالب فراداده‌های متنی (عنوان، چکیده، پدیدآور، سال انتشار) وجود دارد. لیکن تصاویر موجود در اسناد «گنج» بازیابی نمی‌شود. فراهم کردن چنین امکانی در «گنج» به‌ عنوان یک ارزش ‌افزوده می‌تواند آن را از موتورهای جست‌وجوی مشابه متمایز سازد. برای بازیابی تصاویر نیاز است که برچسب‌های توصیف‌کننده‌ای برای هر تصویر استخراج شود. موتور جست‌و‌جو با استفاده از این برچسب‌ها می‌تواند تصاویری را بازیابی کند که کلمات جست‌و‌جو شده در لیست برچسب‌های آنها وجود دارد. در اینجا برای استخراج برچسب تصویر از متن سندی که تصویر به آن تعلق دارد استفاده شده است. زیرنویس و قسمتی از متن سند که در آن، به تصویر مورد نظر اشاره شده است در نظر گرفته می‌شود. عبارات اسمی در متن با استفاده از پنج روش متفاوت؛ فراوانی عبارات در سند، معکوس فراوانی سند، فراوانی کلمه- معکوس فراوانی سند، شباهت کسینوسی عبارات با زیرنویس و ترکیب روش فراوانی کلمه- معکوس فراوانی سند و شباهت کسینوسی با زیرنویس، رتبه‌بندی می‌شوند. برچسب‌های انتخابی برای تصویر در هر روش، عبارات اسمی با رتبه بالاتر در آن روش است. روش‌های معرفی شده با استفاده از داده آزمایشی ازگنج، ارزیابی می‌شوند. طبق نتایج بدست آمده بر روی داده آزمایشی در این تحقیق، روش فراوانی کلمه- معکوس فراوانی سند با معیار F1 ،38% بهترین روش برای برچسب زدن تصاویر و پس از آن ترکیب روش فراوانی کلمه- معکوس فراوانی سند و شباهت کسینوسی با زیرنویس با معیار F1 ،36% قرار دارد. از آنجاییکه در مواردی زیرنویس تصاویر توصیف کاملی از تصاویر نمی‌دهد، با در نظر گرفتن شباهت کسینوسی با زیرنویس تصاویر، معیار F1  کاهش می‌یابد.

استناد

فخرزاده، آزاده، و امیرحسین صدیقی. 1400. طراحی یک روش برای برچسب‌زدن تصاویر استخراج‌شده از پارساهای موجود در پایگاه اطلاعات علمی ایران (گنج). تهران: پژوهشگاه علوم و فناوری اطلاعات ایران.

فایل پیوست
دریافت نسخه pdf (180.89 کیلوبایت)
دریافت تمام متن (3.18 مگابایت)
شماره :
3578
آخرین به روزرسانی :
جمعه, 26 دی 1404 - 23:34
X
Chat Icon