همنگارههای بسیاری در فارسی به دلیل پیچیدگیهای موجود در ساختواژه فارسی، به وجود میآیند. بررسی همنگارهها در پیکرههای متنی فارسی نشان میدهد اکثر این همنگارهها، در اثر یکسانبودن نمود نوشتاری تکواژ یای نکره، یای اسمساز، شناسه دوم شخص مفرد، یای صفتساز و یای متصل به گروه اسمی ایجاد شدهاند. در صورت رفع ابهام از برچسب نحوی این همنگارهها (همنگارههای اسمی و صفتی مختوم به «ی»)، رفع ابهام معنایی از کلمات که گامی مهم در پردازش متن است و کاربردهای بسیاری، از جمله یادگیری ماشینی، بازیابی اطلاعات، ترجمه ماشینی، تبدیل متن به گفتار، تجزیه معنایی، تشخیص و سنتز گفتار و واژهنگاری در حوزه زبانشناسی رایانشی دارد، نیز با سهولت بیشتری انجام خواهد شد. در پژوهش حاضر ابتدا فهرست مبسوطی از همنگارههای اسمی و صفتی مختوم به «ی» با تعریف تعداد 10 پنجره، به عبارتی دیگر، 10 کلمه قبل و بعد از هر همنگاره مختوم به «ی»، در پیکره بیجنخان (که پیکرهای است برچسبخورده) تهیه شد؛ از آنجاییکه همه کلمات موجود در چنین پیکرهای دارای برچسب نحوی میباشند، قواعد حساس به بافت نحوی جهت رفع ابهام از برچسب نحوی همنگارههای مختوم به «ی» استخراج شد. سپس جهت بررسی صحت قواعد مذکور، برنامه ماشینی تهیه شد که صحت قواعد مستخرج از بررسی همنگارههای مختوم به «ی» را با در نظر گرفتن تعداد همنگارههای بررسی شده در پیکره که میتوان قاعده را در مورد آنها بررسی کرد، تعداد موارد منطبق با هر قاعده، درصد موارد منطبق با هر قاعده، تعداد موارد مغایر با هر قاعده (تعداد موارد نقض) و درصد موارد مغایر با هر قاعده میسنجید. در نهایت بررسی ماشینی صحت قواعد نشان میدهد، صحت بیش از نیمی از قواعد بالای 70% است.
علایی ابوذر، الهام. 1395. رفع ابهام از برچسب نحوی همنگارههای اسمی و صفتی فارسی. تهران: پژوهشگاه علوم و فناوری اطلاعات ایران.
