پیکره مقایسهای/ تطبیقی، پیکرهای است دوزبانه یا چندزبانه که شامل متونی است مشابه در حوزههای موضوعی یکسان. در پیکره مقایسهای، برخلاف پیکره موازی، متون لزوما ترجمه یکدیگر نیستند، اما به یک حوزه یکسان و فراداده یکسان مربوط میشوند. نمونهای از پیکره مقایسهای، پیکرهای است که از ویکیپدیا (wikipedia) ساخته شده است و به زبانهای گوناگون است. چنین پیکرههایی این امکان را فراهم میآورند که بتوان زبانهای گوناگون یا گونههای زبانی مختلف را در بافت مشابه مقایسه کرد و از تحریف اجتنابناپذیر که در ترجمه متون در پیکرههای موازی ایجاد میشود، پرهیز کرد. پیکرههای مقایسهای میتوانند از متون عمومی ساخته شوند که امکانات گوناگونی را برای تحلیل گفتمان، کاربردشناسی، تجزیه و تحلیل ژانرهای متون و زبانشناسی اجتماعی فراهم میکنند؛ نمونههایی از چنین پیکرههایی میتواند شامل مجموعه مدخلهای دایرهالمعارفها یا متون ادبی یک دوره زمانی خاص باشد. اما متداولترین نوع پیکرههای مقایسهای که مخاطبان بسیاری دارد، آنهایی هستند که به حوزه(های) تخصصی مربوط میشوند و دارای تراکم بالای واژگان و اصطلاحات تخصصی هستند. چنین پیکرههایی، پیکره تخصصی مقایسهای نامیده میشوند. برخی از کاربردهای چنین پیکرههایی در پژوهشهای تطبیقی زبانها، ترجمه ماشینی، فرهنگنگاری محاسباتی و بازیابی اطلاعات است.
در طرح پژوهشی «ساخت پیکره متنی از مقالههای پژوهشنامه پردازش و مدیریت اطلاعات»، سامانهای نیز ساخته شد به نام «سامانه پیکرههای ایرانداک (ساپا)» که پیکرهها در این سامانه قرار میگیرند. اکنون «پیکره پژوهشنامه» در این سامانه قرار دارد و پیکره تخصصی دیگری (از کتابهای دیجیتال ایرانداک) نیز در دستور کار قرار دارد و به سامانه اضافه خواهد شد. در این طرح پژوهشی قصد داریم پیکره تخصصی دیگری را به سامانه پیکرههای ایرانداک (ساپا) اضافه کنیم. این پیکره مقایسهای است و از چکیدههای فارسی و انگلیسی پایاننامهها و رسالههای (پارساها) ایرانداک ساخته خواهد شد. در مرحله نمونهگیری به بررسی حوزههای موضوعی پرداخته خواهد شد و از میان آنها انتخاب خواهد شد. به نظر میرسد حداقل تعداد چکیده که برای این پیکره میتوان در نظر گرفت، احتمالا بین 100 تا 200 هزار است که حوزههای موضوعی گوناگونی را در بر میگیرد. همچنین همانند دو پیکره تخصصی دیگر ساپا (پیکره پژوهشنامه و پیکرهای که از کتابهای دیجیتال ایرانداک ساخته میشود)، در این طرح پژوهشی، متون پیکره برچسبگذاری اجزای واژگانی کلام (POS tagging) خواهند داشت. در این راستا، همانند پژوهشهای پیشین برای متون فارسی (چکیدههای فارسی) از کدهای ابزار «هضم» استفاده خواهد شد و برای متون انگلیسی (چکیدههای انگلیسی) از ابزار POS tagging (از مجموعه ابزارهای پیکره) دانشگاه لنکستر استفاده خواهد شد.
علایی ابوذر، الهام، و علیاصغر حجتپناه. 1402. ساخت پیکره مقایسهای تخصصی از چکیدههای فارسی و انگلیسی پایاننامهها و رسالههای (پارساهای) ثبت شده در پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک). تهران: پژوهشگاه علوم و فناوری اطلاعات ایران.
