تهیه مجموعه داده استاندارد فارسی برای مساله استخراج خودکار کلیدواژه از اسناد علمی

تهیه مجموعه داده استاندارد فارسی برای مساله استخراج خودکار کلیدواژه از اسناد علمی
نوع طرح پژوهشی
دسته‌بندی موضوعی
تاریخ تصویب
وضعیت طرح
چکیده

با توجه به حجم داده‌ها و مستندات ایجاد شده در پایگاه‌های تخصصی علمی مانند گنج، نیاز است که روش‌های هوشمند و خودکار برای افزایش دقت و سرعت تخصیص کلیدواژه به این مستندات به کار گرفته شود. توسعه و بکارگیری این روش‌ها نیازمند وجود معیارهای استاندارد برای ارزیابی و بهبود آنهاست. یکی از این معیارها، وجود یک مجموعه داده استاندارد است که حاوی مجموعه‌ای از اسناد و کلیدواژه‌های تخصیص داده شده درست و کامل به آنها است. اگر چنین مجموعه داده‌ای موجود نباشد، نمی‌توان به راحتی الگوریتم‌ها و روش‌های استخراج خودکار کلیدواژه از مستندات علمی را با یک معیار مشخص با هم مقایسه کرد و بکارگرفت.

در برخی از پژوهش‌های انجام شده در حوزه استخراج خودکار کلیدواژه از مستندات فارسی، از مجموعه داده‌هایی استفاده شده لیکن این مجموعه داده‌ها یا داده‌های علمی نیستند و یا در صورت استفاده از داده‌ها علمی، تنها کلیدواژه‌های نویسنده به عنوان کلیدواژه‌های تخصیص داده شده به یک سند علمی در آنها در نظر گرفته شده است. این در حالی است که در بسیاری از پژوهش‌های انجام شده در زبان انگلیسی، مجموعه داده‌های استاندارد و متعددی برای این منظور وجود دارد که در اغلب پژوهش‌ها از آنها استفاده می‌شود.

بنابراین در این طرح پژوهشی، مجموعه داده‌ای از اسناد علمی (پایان‌نامه‌ها و رساله‌ها) گنج به همراه کلیدواژه‌های مرتبط با آنها ایجاد می‌شود. مدارک نمایه‌ شده در گنج، می‌تواند منبعی غنی برای ساخت مجموعه داده برای مساله استخراج کلیدواژه از مستندات علمی فارسی باشد. لیکن کلیدواژه‌های تخصیص داده شده به هر مدرک در فرایند نمایه‌سازی اغلب محدود هستند و حتی در برخی از موارد به دلیل محدودیت‌های موجود در فرایند نمایه‌سازی، کامل نیستند. علاوه بر آن، مشخص نیست که هر کلیدواژه تخصیص داده شده به هر مدرک تا چه میزان به آن مدرک مرتبط است.

در فرایند ایجاد مجموعه داده در این طرح، ابتدا از مجموعه‌ای از اسناد پایگاه گنج که کلیدواژه‌های تخصصی نمایه‌ساز و نویسنده را دارند استفاده شده است. سپس براساس فرایندی ماشینی مجموعه کلیدواژه‌ وسیع‌تری، به عنوان کلیدواژه‌های کاندید برای هر سند در نظر گرفته شده و در انتها نیز متخصصین نمایه‌ساز، با بررسی مجدد هر سند و کلیدواژه‌های کاندید، کلیدواژه‌های تخصصی مناسب را از بین آنها انتخاب کرده‌اند. در نهایت 2838 داده در چهار حوزه موضوعی فنی و مهندسی، علوم انسانی، علوم و علوم کاربردی، و هنر در مجموعه داده قرار گرفته‌اند که هر یک به طور متوسط دارای 10 کلیدواژه هستند. در انتها نیز پیشنهادهایی برای چگونگی بهره‌برداری از مجموعه داده استاندارد توسط جامعه علمی و انتشار آن ارائه شده است.

استناد

محبی، آزاده، عمار جلالی‌منش، مرضیه زرین‌بال ماسوله، زهرا دهسرایی، علی سلیمی‌صدر، وحمید حسنی. 1400. تهیه مجموعه داده استاندارد فارسی برای مساله استخراج خودکار کلیدواژه از اسناد علمی. تهران: پژوهشگاه علوم و فناوری اطلاعات ایران.

فایل پیوست
دریافت نسخه pdf (114.92 کیلوبایت)
دریافت تمام متن (3.93 مگابایت)
شماره :
3291
آخرین به روزرسانی :
جمعه, 26 دی 1404 - 23:35
X
Chat Icon