طرح پژوهشی «ساخت پیکره از کتابهای دیجیتال ایرانداک» به پایان رسید
طرح پژوهشی دکتر الهام علایی ابوذر با نام «ساخت پیکره از کتابهای دیجیتال پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک)» به پایان رسید.
به گزارش «روابط عمومی پژوهشگاه علوم و فناوری اطلاعات ایران» طرح پژوهشی «ساخت پیکره از کتابهای دیجیتال پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک)» توسط الهام علایی ابوذر، عضو هیئت علمی پژوهشکده علوم اطلاعات به پایان رسید.
ما در دنیای اطلاعات زندگی میکنیم؛ گردآوری منسجم اطلاعات، کاری زیرساختی و مهم محسوب میشود. یکی از روشهای گردآوری منسجم دادهها، تهیه پیکرههای زبانی است. تاکنون پیکرههای عمومی بسیاری در زبانهای گوناگون، از جمله زبان فارسی، ساخته شده است. اما تعداد پیکرههای تخصصی که برای اهداف خاص و پردازشهای خاص زبانی استفاده میشود، به اندازه پیکرههای عمومی نیست. بنابراین، ساخت پیکرههایی که شامل متون تخصصی و میانرشتهای است، بسیار کاربردی است. در این طرح پژوهشی پیکرهایی ساخته شده است که محتوای آن متون کتابهای دیجیتال پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک) است. برای ساخت این پیکره، پس از طی فرآیند نمونهگیری 65 کتاب انتخاب شده و فراداده مربوط به کتابها (عنوان مقاله، نام نویسنده/نویسندگان و موضوع مقاله) به طور جداگانه تهیه شده است؛ نزدیک به نیمی از کتابها به صورت فایل پی.دی.اف بوده که از طریق استفاده از ابزار اٌ.سی.آر به فایل ورد تبدیل شده و برای وارد شدن در پیکره، ویرایشهای نگارشی و ماشینی روی آنها انجام شده است. برای هنجارسازی دادههای وارد شده در پیکره از ابزار هضم، اطلاعات ساختواژی زبان فارسی (وندهای اشتقاقی و تصریفی و واژهبستها) و برنامهنویسی ماشینی استفاده شده است. پس از هنجارسازی، ابتدا برچسبگذاری ماشینی دادهها (برچسبگذاری اجزای واژگانی کلام (POS)) انجام و در نهایت برچسبها به صورت دستی نیز کنترل شده و اطلاعات در پایگاه داده ذخیره و پیکره در سامانه پیکرههای ایرانداک (ساپا) قرار گرفته است. این پیکره شامل 3329281 واژه است که حوزههای میانرشتهای کتابداری، مدیریت، زبانشناسی، مدیریت اطلاعات و غیره را پوشش داده است.
