طرح پژوهشی «ساخت پیکره مقایسه‌ای تخصصی از چکیده‌های فارسی و انگلیسی (پارساهای) ثبت شده در (ایرانداک)» به پایان رسید

طرح پژوهشی «ساخت پیکره مقایسه‌ای تخصصی از چکیده‌های فارسی و انگلیسی (پارساهای) ثبت شده در (ایرانداک)» به پایان رسید

طرح پژوهشی دکتر الهام علایی با نام «ساخت پیکره مقایسه‌ای تخصصی از چکیده‌های فارسی و انگلیسی پایان‌نامه‌ها و رساله‌های (پارساهای) ثبت شده در پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک)» به پایان رسید.

طرح پژوهشی «ساخت پیکره مقایسه‌ای تخصصی از چکیده‌های فارسی و انگلیسی (پارساهای) ثبت شده در (ایرانداک)» به پایان رسید

به گزارش «روابط‌ عمومی پژوهشگاه علوم و فناوری اطلاعات ایران» طرح پژوهشی «ساخت پیکره مقایسه‌ای تخصصی از چکیده‌های فارسی و انگلیسی پایان‌نامه‌ها و رساله‌های (پارساهای) ثبت شده در پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک)» توسط دکتر الهام علایی، عضو هیئت علمی پژوهشکده علوم اطلاعات به پایان رسید.

امروزه ظهور فناوری­‌های رایانه‌­ای و تولید حجم بسیار بزرگی از متون به زبان­‌های گوناگون، منابع پیکره­ای عظیمی برای پژوهشگران مشتاق به ساخت پیکره فراهم کرده است. تاکنون پیکره‌­های عمومی بسیاری در زبان­‌های گوناگون، از جمله زبان فارسی، ساخته شده است. اما تعداد پیکره­‌های تخصصی که برای اهداف خاص و پردازش­‌های خاص زبانی استفاده می‌­شود، به اندازه پیکره­‌های عمومی نیست. بنابراین، ساخت پیکره­‌هایی که شامل متون تخصصی یا میان­‌رشته‌­ای است، بسیار ارزشمند است. پیکره مقایسه‌­ای، پیکره‌­ای است دوزبانه یا چندزبانه که شامل متونی است مشابه در حوزه­‌های موضوعی یکسان. چنین پیکره‌­ای می‌­تواند در پژوهش‌­های تطبیقی زبان­‌ها، داده­‌کاوی، موتورهای جست‌و‌جوی دوزبانه، پژوهش‌­های بین‌­زبانی، ترجمه ماشینی، فرهنگ‌­نگاری محاسباتی و بازیابی اطلاعات مورد استفاده قرار گیرد. در این پژوهش یک پیکره مقایسه‌­ای تخصصی ساخته شده است که شامل متون فارسی و انگلیسی چکیده‌­های پایان‌نامه­‌ها و رساله‌­های ثبت شده در پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک) است. این پیکره شامل بیش از 89 میلیون واژه فارسی و 79 میلیون واژه انگلیسی است. محتوای این پیکره عمومی نیست و حاوی متون بسیار تخصصی در حوزه‌­های موضوعی کلان مانند علوم اجتماعی، علوم انسانی و هنر، فنی ­‌و مهندسی و رشته­‌های مربوط به این حوزه­‌ها است و از این نظر برای پردازش‌­های زبانی که مستلزم بهره­ گرفتن از متون تخصصی است، بسیار ارزشمند است. برای ساخت این پیکره، پس از نمونه‌گیری، داده‌های فارسی وارد فرایند پیش ­پردازش (هنجارسازی و واحدسازی) و سپس، داده‌ها برچسب­‌گذاری شده‌اند (برچسب‌گذاری اجزای واژگانی کلام (POS tagging)). سپس، برچسب­‌های داده­‌های فارسی کنترل شده‌اند. داده‌­های انگلیسی نیز به صورت ماشینی برچسب­‌گذاری و در نهایت، پیکره ساخته شده در سامانه پیکره­‌های ایرانداک (ساپا) در کنار دو پیکره دیگر این سامانه قرار داده شده است. همچنین در کنار ساخت پیکره، کارهایی نیز برای ارتقای سامانه انجام شده است.

شماره :
5026
آخرین به روزرسانی :
جمعه, 26 دی 1404 - 23:30
X
Chat Icon