ابهام، یکی از چالشهای بزرگ در پردازش زبان طبیعی است؛ در پردازش رایانهای متون، همنگارهها و چگونگی رفع ابهام از آنها از اهمیت بالایی برخوردار است. در زبانهایـی ماننـد زبـان فارسـی که سـاختواژه پیچیـدهای دارنـد، همنگارههـای بســیاری ســاخته میشــوند. در این راستا شناخت همنگارهها و دستهبندی انواع آنها بسیار مهم است. در پژوهش حاضر به منظور بررسی پیکره-بنیاد همنگارههای فارسی، واژههایی که بیش از یک برچسب اجزای واژگانی کلام داشتند، از پیکره متنی فارسی استخراج شدند که شامل 10978 واژه است. سپس، فراوانی برچسبهای هر همنگاره مورد بررسی قرار گرفت و فهرست دیگری استخراج شد که شامل همنگارههایی است که علاوه بر فراوانی بالای برچسب اول آنها (بیش از 20) فراوانی برچسب دوم آنها نیز در پیکره متنی فارسی بیش از 10 بوده است؛ این فهرست شامل 1675 همنگاره است. ماهیت ساختواژی، آوایی یا معنایی همنگارههای استخراج شده در این مرحله مورد بررسی قرار گرفت و بر اساس آن همنگارههای استخراج شده در یازده دسته طبقهبندی شدند که از میان آنها، تنها همنگارههای موجود در یک دسته بر اساس معیار معنایی طبقهبندی شدهاند و بقیه بر اساس ویژگیهای ساختواژی و تفاوتها آوایی آنها در دستههای گوناگون قرار گرفتهاند. نتایج این پژوهش شامل فهرست گستردهای از همنگارههای فارسی استخراج شده از پیکره متنی فارسی است که هر کدام بر اساس معیارهای ساختواژی و آوایی در یک یا بیش از یک دسته از مجموع یازده دسته قرار گرفتهاند، این فهرست و دستهبندی مربوط به همنگارهها میتواند در سیستمهای رفع ابهام معنایی از واژگان مورد استفاده قرار گیرد.
علایی ابوذر، الهام. 1402. دستهبندی پیکرهبنیاد همنگارههای فارسی. پژوهشنامه پردازش و مدیریت اطلاعات 38 (3): 825-900.
