ما در دنیای اطلاعات زندگی میکنیم؛ گردآوری منسجم اطلاعات، کاری زیرساختی و مهم محسوب میشود. یکی از روشهای گردآوری منسجم دادهها، تهیه پیکرههای زبانی است. تاکنون پیکرههای عمومی بسیاری در زبانهای گوناگون، از جمله زبان فارسی، ساخته شده است. اما تعداد پیکرههای تخصصی که برای اهداف خاص و پردازشهای خاص زبانی استفاده میشود، به اندازه پیکرههای عمومی نیست. بنابراین، ساخت پیکرههایی که شامل متون تخصصی و میانرشتهای است، بسیار کاربردی است. در این طرح پژوهشی پیکرهای ساخته شده است که محتوای آن متون کتابهای دیجیتال پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک) است. برای ساخت این پیکره، پس از طی فرآیند نمونهگیری 65 کتاب انتخاب شدند و فراداده مربوط به کتابها (عنوان مقاله، نام نویسنده/نویسندگان و موضوع مقاله) به طور جداگانه تهیه شد؛ نزدیک به نیمی از کتابها به صورت فایل پی.دی.اف (PDF) بودند که از طریق استفاده از ابزار اٌ.سی.آر (OCR) به فایل ورد (WORD) تبدیل شدند و برای وارد شدن در پیکره ویرایشهای نگارشی و ماشینی روی آنها انجام گرفت. برای هنجارسازی دادههای واردشده در پیکره از ابزار هضم، اطلاعات ساختواژی زبان فارسی (وندهای اشتقاقی و تصریفی و واژهبستها) و برنامهنویسی ماشینی استفاده شد. پس از هنجارسازی، ابتدا برچسبگذاری ماشینی دادهها (برچسبگذاری اجزای واژگانی کلام (POS)) انجام شد و در نهایت برچسبها به صورت دستی نیز کنترل شدند و اطلاعات در پایگاه داده ذخیره شد و پیکره در سامانه پیکرههای ایرانداک (ساپا) قرار گرفت. این پیکره شامل 3329281 واژه است که حوزههای میانرشتهای کتابداری، مدیریت، زبانشناسی، مدیریت اطلاعات و غیره را پوشش میدهد.
علایی ابوذر، الهام، و علیاصغر حجتپناه. 1401. ساخت پیکره از کتابهای دیجیتال پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک). تهران: پژوهشگاه علوم و فناوری اطلاعات ایران.
