روزانه هزاران مستند متنی متنوع در حوزههای مختلف علمی بر روی وب جهانگستر قرار میگیرد. این مستندات میتوانند شامل پایاننامهها، مقالهها، گزارشهای علمی و مواردی از این قبیل باشد. نگارش متن این مستندات علمی جهت حفظ یکنواختی باید بر اساس اصول ثابت انجام گیرد، اما همواره به طور غیر عمدی دستخوش سلیقههای مختلفی در طول تاریخ میشود. اگرچه این تغییرات ناشی از پویا بودن زبان و خلاقیت ذهنی بشر است، اما این پویایی و خلاقیت پردازش ماشینی متن را با چالشهای متعددی روبرو میکند و دقت پردازش دادهها را به میزان چشمگیری پایین میآورد. علاوه بر تنوع نگارشی، غلطهای سهوی املایی نیز وجود دارد که فحوای گفتمانی متن را منحرف کرده و درک آن را با مشکل مواجه میکند. بنابراین کلیه نویسههای متن باید به حالت استاندارد تبدیل شوند و عاری از هرگونه خطاهای املایی گردند. پژوهشگران طرح حاضر سامانهای برای استانداردسازی و خطایابی متون علمی فارسی طراحی کردهاند که این سامانه متون نوشتاری علمی و تخصصی فارسی را به لحاظ صحت نگارشی و املایی بررسی میکند و متن را به شکل استاندارد در میآورد. این سامانه با معیار اف 90.08 و معیار بلوی 91.66 به استانداردسازی میپردازد و با معیار اف 92 درصد و با رتبهبندی 82 درصد به اصلاح خطای املایی میپردازد.
حسینی بهشتی، ملوکالسادات. 1397. سامانه استانداردساز و خطایاب متون علمی فارسی. تهران: چاپار.
