ساخت پیکره مقایسه‌ای تخصصی از چکیده‌های فارسی و انگلیسی پایان‌نامه‌ها و رساله‌های (پارساهای) ثبت شده در پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک)

ساخت پیکره مقایسه‌ای تخصصی از چکیده‌های  فارسی و انگلیسی پایان‌نامه‌ها و رساله‌های (پارساهای) ثبت شده در پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک)
نوع طرح پژوهشی
دسته‌بندی موضوعی
تاریخ تصویب
وضعیت طرح
گروه پژوهشی
چکیده

پیکره مقایسه‌­ای/ تطبیقی، پیکره‌ای است دوزبانه یا چندزبانه که شامل متونی است مشابه در حوزه‌­های موضوعی یکسان. در پیکره مقایسه‌­ای، برخلاف پیکره موازی، متون لزوما ترجمه یکدیگر نیستند، اما به یک حوزه یکسان و فراداده یکسان مربوط می‌­شوند. نمونه‌ای از پیکره مقایسه‌­ای، پیکره­ای است که از وی­کی‌­پدیا (wikipedia) ساخته شده است و به زبان­‌های گوناگون است. چنین پیکره‌هایی این امکان را فراهم می­‌آورند که بتوان زبان­‌های گوناگون یا گونه­‌های زبانی مختلف را در بافت مشابه مقایسه کرد و از تحریف اجتناب‌­ناپذیر که در ترجمه متون در پیکره­‌های موازی ایجاد می‌­شود، پرهیز کرد. پیکره­‌های مقایسه‌­ای می‌­توانند از متون عمومی ساخته شوند که امکانات گوناگونی را برای تحلیل گفتمان، کاربردشناسی، تجزیه‌­ و تحلیل ژانرهای متون و زبان‌­شناسی اجتماعی فراهم می­‌کنند؛ نمونه­‌هایی از چنین پیکره‌­هایی می‌تواند شامل مجموعه مدخل‌­های دایره‌­المعارف‌­ها یا متون ادبی یک دوره زمانی خاص باشد. اما متداول‌­ترین نوع پیکره‌­های مقایسه‌­ای که مخاطبان بسیاری دارد، آن­‌هایی هستند که به حوزه‌(های) تخصصی مربوط می‌­شوند و دارای تراکم بالای واژگان و اصطلاحات تخصصی هستند. چنین پیکره­‌هایی، پیکره تخصصی مقایسه‌­ای نامیده می­‌شوند. برخی از کاربردهای چنین پیکره‌­هایی در پژوهش­‌های تطبیقی زبان‌­ها، ترجمه ماشینی، فرهنگ‌‌‌نگاری محاسباتی و بازیابی اطلاعات است.

در طرح پژوهشی «ساخت پیکره متنی از مقاله‌­های پژوهش­نامه پردازش و مدیریت اطلاعات»، سامانه‌­ای نیز ساخته شد به نام «سامانه پیکره­‌های ایرانداک (ساپا)» که پیکره‌­ها در این سامانه قرار می‌­گیرند. اکنون «پیکره پژوهش­نامه» در این سامانه قرار دارد و پیکره تخصصی دیگری (از کتاب‌­های دیجیتال ایرانداک)  نیز در دستور کار قرار دارد و به سامانه اضافه خواهد شد. در این طرح پژوهشی قصد داریم پیکره تخصصی دیگری را به سامانه پیکره‌­های ایرانداک (ساپا) اضافه کنیم. این پیکره مقایسه‌­ای است و از چکیده‌­های فارسی و انگلیسی پایان‌­نامه‌­ها و رساله‌های (پارساها) ایرانداک ساخته خواهد شد. در مرحله نمونه‌­گیری به بررسی حوزه­‌های موضوعی پرداخته خواهد شد و از میان آن‌­ها انتخاب خواهد شد. به نظر می­‌رسد حداقل تعداد چکیده که برای این پیکره می‌­توان در نظر گرفت، احتمالا بین 100 تا  200 هزار است که حوزه­‌های موضوعی گوناگونی را در بر می‌­گیرد. همچنین همانند دو پیکره تخصصی دیگر ساپا (پیکره پژوهش­نامه و پیکره­ای که از کتاب‌­های دیجیتال ایرانداک ساخته می­‌شود)، در این طرح پژوهشی، متون پیکره برچسب­‌گذاری اجزای واژگانی کلام (POS tagging) خواهند داشت. در این راستا، همانند پژوهش‌­های پیشین برای متون فارسی (چکیده­‌های فارسی) از کدهای ابزار «هضم» استفاده خواهد شد و برای متون انگلیسی (چکیده­‌های انگلیسی) از ابزار POS tagging (از مجموعه ابزارهای پیکره) دانشگاه لنکستر استفاده خواهد شد.

استناد

علایی ابوذر، الهام، و علی‌اصغر حجت‌پناه. 1402. ساخت پیکره مقایسه‌ای تخصصی از چکیده‌های  فارسی و انگلیسی پایان‌نامه‌ها و رساله‌های (پارساهای) ثبت شده در پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک). تهران: پژوهشگاه علوم و فناوری اطلاعات ایران.

فایل پیوست
دریافت خلاصه متن (705.25 کیلوبایت)
شماره :
4280
آخرین به روزرسانی :
جمعه, 26 دی 1404 - 23:32
X
Chat Icon