ساخت پیکره از کتاب‌های دیجیتال پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک)

ساخت پیکره از کتاب‌های دیجیتال پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک)
نوع طرح پژوهشی
دسته‌بندی موضوعی
تاریخ تصویب
وضعیت طرح
گروه پژوهشی
چکیده

ما در دنیای اطلاعات زندگی می‌کنیم؛ گردآوری منسجم اطلاعات، کاری زیرساختی و مهم محسوب می‌شود. یکی از روش‌های گردآوری منسجم داده‌ها، تهیه پیکره‌های زبانی است. تاکنون پیکره‌های عمومی بسیاری در زبان‌های گوناگون، از جمله زبان فارسی، ساخته شده است. اما تعداد پیکره‌های تخصصی که برای اهداف خاص و پردازش‌های خاص زبانی استفاده می‌شود، به اندازه پیکره‌های عمومی نیست. بنابراین، ساخت پیکره‌هایی که شامل متون تخصصی و میان‌رشته‌ای است، بسیار کاربردی است. در این طرح پژوهشی پیکره‌ای ساخته شده است که محتوای آن متون کتاب‌های دیجیتال پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک) است. برای ساخت این پیکره، پس از طی فرآیند نمونه‌گیری 65 کتاب انتخاب شدند و فراداده مربوط به کتاب‌ها (عنوان مقاله، نام نویسنده/نویسندگان و موضوع مقاله) به طور جداگانه تهیه شد؛ نزدیک به نیمی از کتاب‌ها به صورت فایل پی.دی.اف (PDF) بودند که از طریق استفاده از ابزار اٌ.سی.آر (OCR) به فایل ورد (WORD) تبدیل شدند و برای وارد شدن در پیکره ویرایش‌های نگارشی و ماشینی روی آن‌ها انجام گرفت. برای هنجارسازی داده‌های واردشده در پیکره از ابزار هضم، اطلاعات ساختواژی زبان فارسی (وندهای اشتقاقی و تصریفی و واژه‌بست‌ها) و برنامه‌نویسی ماشینی استفاده شد. پس از هنجارسازی، ابتدا برچسب‌گذاری ماشینی داده‌ها (برچسب‌گذاری اجزای واژگانی کلام (POS)) انجام شد و در نهایت برچسب‌ها به صورت دستی نیز کنترل شدند و اطلاعات در پایگاه داده ذخیره شد و پیکره در سامانه پیکره‌های ایرانداک (ساپا) قرار گرفت. این پیکره شامل 3329281 واژه است که حوزه‌های میان‌رشته‌ای کتابداری، مدیریت، زبان‌شناسی، مدیریت اطلاعات و غیره را پوشش می‌دهد.

استناد

علایی ابوذر، الهام، و علی‌اصغر حجت‌پناه. 1401. ساخت پیکره از کتاب‌های دیجیتال پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک). تهران: پژوهشگاه علوم و فناوری اطلاعات ایران.

فایل پیوست
دریافت خلاصه (119.51 کیلوبایت)
تمام متن (1.68 مگابایت)
شماره :
4151
آخرین به روزرسانی :
جمعه, 26 دی 1404 - 23:33
X
Chat Icon