بهینه‌‌سازی یک الگوریتم نویسه‌خوان نوری برای پایان‌نامه‌ها و رساله‌های فارسی

بهینه‌‌سازی یک الگوریتم نویسه‌خوان نوری برای پایان‌نامه‌ها و رساله‌های فارسی
همکار(ان)
نوع طرح پژوهشی
دسته‌بندی موضوعی
تاریخ تصویب
وضعیت طرح
چکیده

 تبدیل تصویر اسکن شده و یا چاپ شده از یک متن به متن قابل ویرایش توسط کامپیوتر را تشخیص کاراکتر نوری (OCR)  یا نویسه‌خوانی نوری می‌گویند. نویسه‌خوانی نوری از موضوعات چالشی در پردازش تصویر و یکی از موضوعات پرکاربرد در کتابخانه‌های دیجیتال است. پایگاه اطلاعات علمی ایران (گنج) یک کتابخانه دیجیتال است که حاوی اسناد علمی، پایان‌نامه‌ها و رساله‌های دانشگاه‌های کشور است. در مواردی فایل‌های ارسال شده به گنج به صورت پی‌دی‌اف است و موتور جستجو گنج به متن این فایل‌ها دسترسی ندارد. برای این منظور کتابخانه گنج نیاز است که به یک سیستم OCR مجهز باشد که فایل‌های پی‌دی‌اف را به متن قابل ویرایش تبدیل کند. نویسه‌خوانی نوری در تشخیص و استخراج متن‌های انگلیسی پیشرفت زیادی کرده است و الگوریتم‌ها و روش‌های متنوعی معرفی شده‌اند. کلمات فارسی به صورت پیوسته و شکسته نوشته می‌شود و روش‌هایی که  منجر به تقسیم‌بندی و تشخیص حروف در زبان انگلیسی می‌شود در تشخیص حروف فارسی کاربرد ندارند. در این تحقیق ابزارها و روش‌های  OCR بررسی می‌شود، سپس روش‌هایی که قابلیت استفاده در زبان فارسی را دارند، مورد ارزیابی قرار می‌دهیم و یک روش برای تبدیل متن پی‌دی‌اف اسناد گنج به متن قابل ویرایش بهینه‌سازی می‌شود. روش معرفی شده بر روی نمونه آزمایشی داده‌های گنج آزمایش می‌شود.

 

استناد

فخرزاده، آزاده، و امیر حسین  صدیقی. زودآیند. بهینه‌‌سازی یک الگوریتم نویسه‌خوان نوری برای پایان‌نامه‌ها و رساله‌های فارسی. تهران: پژوهشگاه علوم و فناوری اطلاعات ایران.

شماره :
5074
آخرین به روزرسانی :
چهارشنبه, 20 خرداد 1405 - 07:59
X
Chat Icon