تبدیل تصویر اسکن شده و یا چاپ شده از یک متن به متن قابل ویرایش توسط کامپیوتر را تشخیص کاراکتر نوری (OCR) یا نویسهخوانی نوری میگویند. نویسهخوانی نوری از موضوعات چالشی در پردازش تصویر و یکی از موضوعات پرکاربرد در کتابخانههای دیجیتال است. پایگاه اطلاعات علمی ایران (گنج) یک کتابخانه دیجیتال است که حاوی اسناد علمی، پایاننامهها و رسالههای دانشگاههای کشور است. در مواردی فایلهای ارسال شده به گنج به صورت پیدیاف است و موتور جستجو گنج به متن این فایلها دسترسی ندارد. برای این منظور کتابخانه گنج نیاز است که به یک سیستم OCR مجهز باشد که فایلهای پیدیاف را به متن قابل ویرایش تبدیل کند. نویسهخوانی نوری در تشخیص و استخراج متنهای انگلیسی پیشرفت زیادی کرده است و الگوریتمها و روشهای متنوعی معرفی شدهاند. کلمات فارسی به صورت پیوسته و شکسته نوشته میشود و روشهایی که منجر به تقسیمبندی و تشخیص حروف در زبان انگلیسی میشود در تشخیص حروف فارسی کاربرد ندارند. در این تحقیق ابزارها و روشهای OCR بررسی میشود، سپس روشهایی که قابلیت استفاده در زبان فارسی را دارند، مورد ارزیابی قرار میدهیم و یک روش برای تبدیل متن پیدیاف اسناد گنج به متن قابل ویرایش بهینهسازی میشود. روش معرفی شده بر روی نمونه آزمایشی دادههای گنج آزمایش میشود.
فخرزاده، آزاده، و امیر حسین صدیقی. زودآیند. بهینهسازی یک الگوریتم نویسهخوان نوری برای پایاننامهها و رسالههای فارسی. تهران: پژوهشگاه علوم و فناوری اطلاعات ایران.
