طرح پژوهشی «ساخت پیکره متنی از مقاله‌های پژوهش‌نامه پردازش و مدیریت اطلاعات» به پایان رسید

طرح پژوهشی «ساخت پیکره متنی از مقاله‌های پژوهش‌نامه پردازش و مدیریت اطلاعات» به پایان رسید

طرح پژوهشی دکتر الهام علایی با نام «ساخت پیکره متنی از مقاله‌های پژوهش‌نامه پردازش و مدیریت اطلاعات» به پایان رسید.

طرح پژوهشی «ساخت پیکره متنی از مقاله‌های پژوهش‌نامه پردازش و مدیریت اطلاعات» به پایان رسید

 به گزارش «روابط‌ عمومی پژوهشگاه علوم و فناوری اطلاعات ایران» در نشست 406 شورای پژوهش که 18 فروردین ماه 1400 برگزار شد، طرح پژوهشی «ساخت پیکره متنی از مقاله‌های پژوهش‌نامه پردازش و مدیریت اطلاعات» توسط دکتر الهام علایی، عضو هیئت‌علمی پژوهشکده علوم اطلاعات به پایان رسید.

انجام بسیاری از پژوهش­‌های زبان­‌شناسی و تصمیم‌­گیری‌­ها در برنامه‌­ریز­ی‌های زبانی، تنها با استفاده از یک پیکره زبانی امکان­‌پذیر است. در این پژوهش پیکره‌­ای ساخته شده است که شامل متون مقاله­‌های موجود در پژوهش‌­نامه پردازش و مدیریت اطلاعات است. 677 مقاله و ۴۷۷۴۷۹۰ واژه. موضوع این مقاله‌ها شامل کتابداری و اطلاع‌­رسانی، علم اطلاعات و دانش‌­شناسی، فناوری اطلاعات­، مدیریت اطلاعات، مدیریت دانش، زبان­‌شناسی، زبان‌­شناسی رایانشی، اصطلاح‌­شناسی، هستان‌­شناسی و سایر حوزه‌­های مرتبط با پردازش اطلاعات است. بنابراین، محتوای این پیکره عمومی نیست و حاوی متون بسیار تخصصی و میان‌­رشته‌­ای است و از این نظر برای پردازش­‌هایی که مستلزم بهره­ گرفتن از متون تخصصی است، بسیار ارزشمند است. پس از نمونه­‌گیری و وارد کردن متون مقاله­‌ها در پیکره، فراداده مربوط به مقاله­‌ها (مانند عنوان مقاله، نام نویسنده/نویسندگان و موضوع مقاله) نیز از طریق کاربرگه ثبت مقالات وارد پیکره شده است. سپس، ابتدا نرمال‌­سازی ماشینی و به دنبال آن، برچسب­‌گذاری ماشینی (نوعاً برچسب­‌گذاری اجزای واژگانی کلام (POS)) انجام و اطلاعات در پایگاه داده ذخیره شده است و در نهایت، برچسب­‌ها دستی کنترل شده­‌اند. همچنین در این طرح پژوهشی، در کنار ساخت پیکره، سامانه‌­ای طراحی شده به نام «سامانه پیکره­‌های ایرانداک» که پیکره متنی ایرانداک در این سامانه قرار گرفته و در آینده می­‌توان پیکره‌­های دیگری را نیز در این سامانه قرار داد.

شماره :
4292
آخرین به روزرسانی :
جمعه, 26 دی 1404 - 23:32
X
Chat Icon