ساخت پیکره متنی از مقاله‌های پژوهش‌نامه پردازش و مدیریت اطلاعات

ساخت پیکره متنی از مقاله‌های پژوهش‌نامه پردازش و مدیریت اطلاعات
نوع طرح پژوهشی
دسته‌بندی موضوعی
تاریخ تصویب
وضعیت طرح
چکیده

انجام بسیاری از پژوهش‌های زبان‌شناسی و تصمیم‌گیری‌ها در برنامه‌ریز‌های زبانی، تنها با استفاده از یک پیکره زبانی امکان‌پذیر است. در پژوهش حاضر پیکره‌ای ساخته شده است که شامل متون مقاله‌های موجود در پژوهش‌نامه پردازش و مدیریت اطلاعات است. 677 مقاله و ۴۷۷۴۷۹۰ واژه. موضوع این مقاله‌ها شامل کتابداری و اطلاع‌رسانی، علم اطلاعات و دانش‌شناسی، فناوری اطلاعات، مدیریت اطلاعات، مدیریت دانش، زبان‌شناسی، زبان‌شناسی رایانشی، اصطلاح‌شناسی، هستان‌شناسی و سایر حوزه‌های مرتبط با پردازش اطلاعات است. بنابراین، محتوای این پیکره عمومی نیست و حاوی متون بسیار تخصصی و میان‌رشته‌ای است و از این نظر برای پردازش‌هایی که مستلزم بهره‌گرفتن از متون تخصصی است، بسیار ارزشمند است. پس از نمونه‌گیری و وارد کردن متون مقاله‌ها در پیکره، فراداده مربوط به مقاله‌ها (مانند عنوان مقاله، نام نویسنده/نویسندگان و موضوع مقاله) نیز از طریق کاربرگه ثبت مقالات وارد پیکره شد. سپس، ابتدا نرمال‌سازی ماشینی و به دنبال آن، برچسب‌گذاری ماشینی (نوعاً برچسب‌گذاری اجزای واژگانی کلام (POS)) انجام شد و اطلاعات در پایگاه داده ذخیره شده است و در نهایت، برچسب‌ها دستی کنترل شده‌اند. همچنین در این طرح پژوهشی، در کنار ساخت پیکره، سامانه‌ای طراحی شد به نام «سامانه پیکره‌های ایرانداک» که پیکره متنی ایرانداک در این سامانه قرار گرفت و در آینده می‌توان پیکره‌های دیگری را نیز در این سامانه قرار داد.

استناد

علایی ابوذر، الهام، نصراله پاک‌نیت، علی‌اصغر حجت‌پناه، مجتبی زالی، و محمدهادی آقالویی آغمیونی. 1400. ساخت پیکره متنی از مقاله‌های پژوهش‌نامه پردازش و مدیریت اطلاعات. تهران: پژوهشگاه علوم وفناوری اطلاعات ایران.

فایل پیوست
دریافت نسخه pdf (150.85 کیلوبایت)
دریافت تمام متن (1.85 مگابایت)
شماره :
3566
آخرین به روزرسانی :
جمعه, 26 دی 1404 - 23:34
X
Chat Icon