ف‍از م‍طال‍ع‍ات‍ی‌ و ام‍ک‍ان‌‌س‍ن‍ج‍ی‌ ش‍ن‍اس‍ای‍ی‌ ش‍م‍اره‌ ص‍ف‍ح‍ات‌ پ‍ای‍ان‌‌ن‍ام‍ه‌‌ه‍ا در ب‍خ‍ش‌ ف‍ه‍رس‍ت‌ م‍طال‍ب‌ و ص‍ف‍ح‍ات‌ اص‍ل‍ی‌ ج‍ه‍ت‌ زم‍ی‍ن‍ه‌‌س‍ازی‌ ب‍رق‍راری‌ ارت‍ب‍اط خ‍ودک‍ار ب‍ی‍ن‌ آن‍ه‍ا

ف‍از م‍طال‍ع‍ات‍ی‌ و ام‍ک‍ان‌‌س‍ن‍ج‍ی‌ ش‍ن‍اس‍ای‍ی‌ ش‍م‍اره‌ ص‍ف‍ح‍ات‌ پ‍ای‍ان‌‌ن‍ام‍ه‌‌ه‍ا در ب‍خ‍ش‌ ف‍ه‍رس‍ت‌ م‍طال‍ب‌ و ص‍ف‍ح‍ات‌ اص‍ل‍ی‌ ج‍ه‍ت‌ زم‍ی‍ن‍ه‌‌س‍ازی‌ ب‍رق‍راری‌ ارت‍ب‍اط خ‍ودک‍ار ب‍ی‍ن‌ آن‍ه‍ا
نوع طرح پژوهشی
دسته‌بندی موضوعی
تاریخ تصویب
وضعیت طرح
چکیده

امروزه حجم زیادی از اسناد کاغذی موجود، توسط اسکنرها و یا دوربین‌ها به اسناد تصویری دیجیتالی تبدیل می‌شوند. ذخیره­‌سازی، بازیابی و مدیریت کارآمد این آرشیوهای تصویری، در بسیاری از کاربردها نظیر اتوماسیون اداری و کتابخانه­‌های دیجیتالی حائز اهمیت فراوانی است. در نتیجه دستیابی به الگوریتم‌های موثر به منظور آنالیز تصویری اسناد، یک نیاز اساسی به حساب می‌­آید. مبحث "آنالیز اسناد" یا DIA مشتمل بر کلیه مراحل پردازشی است که محتویات یک سند اسکن یا فکس شده را به یک فرم الکترونیکی مناسب کد می‌نماید. تکنیک‌های DIA اجزا مختلف "ساختاری" سند یعنی قسمت‌های متنی (پاراگراف‌ها، کلمات، حروف، ...)، گرافیکی (خطوط، نمادها، نمودارها، ...) و تصویری (تصاویر موجود در متن) را از یکدیگر تفکیک نموده، پردازش مناسب را بر روی هر دسته از اجزا اعمال می‌نمایند. همچنین با توجه به ارتباط "منطقی" بین اجزای مختلف، نقش هر یک از این اجزا در سند را مشخص می­‌سازند. DIA دربردارنده دسته بزرگی از تکنیک‌ها به نام تکنیک‌های "بازشناسی نوری حروف" یا OCR است. این تکنیک‌ها به اجزایی از سند که توسط تکنیک‌های آنالیز ساختاری در DIA به عنوان متن تشخیص داده شده­‌اند، اعمال می­‌گردند. اصطلاح OCR به تکنیک‌هایی اطلاق می­‌شود که کاراکترها را از روی تصویر اسکن شده آنها شناسایی می­‌نمایند. اکثر کارهای انجام شده در زمینه OCR، در رابطه با متون لاتین، چینی و ژاپنی بوده است؛ در نتیجه ضرورت انجام تحقیقات بیشتر در زمینه متون فارسی و عربی کاملا احساس می‌­شود. به واسطه وجود تفاوت‌های اساسی بین نحوه نگارش کلمات فارسی و کلمات لاتین نظیر چسبیده بودن حروف سازنده یک کلمه به یکدیگر و تغییر شکل حروف بر اساس موقعیت نسبی قرارگیری آن در یک کلمه فارسی، امکان اعمال مستقیم روش‌های متداول در بازشناسی حروف انگلیسی به منظور شناسایی حروف تشکیل‌دهنده کلمات فارسی وجود ندارد. پایان­‌نامه‌های موجود بر روی سایت مرکز اسناد و مدارک علمی ایران، به فرمت PDF تمام تصویر ذخیره شده‌اند و لذا امکان قرائت متن آنها توسط کامپیوتر به صورت مستقیم وجود ندارد. متاسفانه شماره اختصاص یافته به هر یک از این صفحات، با شماره واقعی صفحات پایان‌نامه‌ها مطابقت ندارد. دلیل این مساله نیز آن است که در ابتدای هر پایان­‌نامه­ صفحاتی نظیر عنوان، تقدیر و تشکر، تقدیم به ...، فرم تاییدیه دانشگاه، فهرست مطالب، فهرست جداول، فهرست نمودارها و غیره وجود دارند که یا شماره صفحه ندارند و یا شماره­‌های آنها متفاوت از شماره صفحات اصلی می­‌باشد. این مساله سبب می‌­شود که رجوع به یک صفحه خاص، با مقداری دشواری همراه باشد. چرا که به عنوان مثال کاربر شماره صفحه 50 را وارد می­‌کند، در حالی که شماره 35 پایان­‌نامه­ در معرض دید وی قرار می­‌گیرد. بخش فهرست مطالب (TOC) در هر سند (از جمله مجله، کتاب، پایان­‌نامه­) به نحو مناسبی ساختار منطقی آن را بیان می‌کند و توسط آن می‌­توان مطالب مطروحه در سند و نحوه تنظیم آنها را به سرعت مشاهده نمود. به علاوه کاربران با مشاهده این بخش به راحتی می‌­توانند مطالب مورد نظر خود را یافته و مستقیما (بدون مرور صفحات قبل) به صفحه مورد نظر خود در سند پرش نمایند. برخی از پایگاه‌های داده دیجیتالی نیز از اطلاعات TOC به منظور ساختارسنجی و شاخص‌­گذاری مستندات بهره می­‌جویند. در این طرح مطالعه و بررسی نوعی سیستم DIA مد نظر است که قادر به تشخیص خودکار شماره صفحات (PNها) این پایان­‌نامه­‌ها در بخش فهرست مطالب (TOC) و صفحات اصلی (MPها) باشد؛ به نحوی که زمینه­‌ای به منظور برقراری ارتباط خودکار بین آنها فراهم گردد و یا به عبارتی، کاربر با کلیک نمودن بر روی هر یک از عناوین موجود در بخش TOC بتواند مستقیما MP مورد نظر را مشاهده نماید. متاسفانه هیچ نوع استاندارد مشترکی در رابطه با تدوین پایان‌نامه‌ها در کشور وجود ندارد و نحوه ترازبندی صفحات TOC و MPها، از یک پایان‌نامه به پایان‌نامه دیگر و حتی در مواردی از یک صفحه به صفحه دیگر یک پایان‌نامه متفاوت است. به علاوه بسیاری از نویسندگان پایان‌نامه‌ها، قاب‌های  دلخواهی را دور صفحات قرار می‌دهند یا خطوطی افقی را در بالا یا پایین صفحات اضافه می‌نمایند و یا PNها را درون قاب یا بین کاراکترهای خاصی نظیر پرانتز، گیومه و غیره محصور می‌سازند. یک سیستم DIA مناسب بایستی از قابلیت پردازش حالت‌های مختلف برخوردار باشد. مسئله اصلی در اینجا، یکی تشخیص خودکار TOC  بر اساس اطلاعات فرمت‌بندی و عنوان آن (توجه شود که بخش‌هایی نظیر فهرست نمودارها، اشکال، جداول، واژه‌ها، علائم اختصاری و غیره نیز فرمتی مشابه با TOC دارند) و دیگری تشخیص صحیح مکان درج PNها در TOC و MPهاست. نشان خواهیم داد که درصورتی که این دو مورد به درستی انجام شوند، بازشناسی ارقام از تصاویر آنها کار مشکلی نخواهد بود. نحوه تنظیم مطالب در این تحقیق بدین شرح است: در فصل 1 سیستم‌های OCR و DIA به صورت کلی معرفی شده، بلوک‌های مختلف پردازشی در آنها به صورت مختصر معرفی می‌گردند. همچنین در مورد جایگاه سیستم‌های OCR لاتین و فارسی (یا عربی) و نیز قواعد نگارشی خاص زبان فارسی بحث خواهد شد. در فصل 2 بلوک‌های پردازشی سیستم‌های OCR به صورت جامع‌تری مورد بررسی قرار گرفته، روش‌های مختلف توسعه داده شده در مقالات برای آنها ارزیابی می‌شوند. فصل 3 به معرفی پایان‌نامه‌ها و چند مقاله منحصرا در رابطه با سیستم‌های OCR فارسی و عربی می‌پردازد. در فصل چهارم یک سیستم OCR آزمایشی، معرفی شده، روش پیاده‌سازی آن تشریح می‌گردد. فصل 5 مبحث آنالیز اسناد و برخی مقالات مرتبط با آن را توضیح می‌دهد و در نهایت، امکان‌سنجی پروژه و نتیجه‌گیری در فصل 6 خواهد آمد. در بخش ضمیمه نیز به معرفی شرکت عربی Sakhr که معروفترین محصولات را در رابطه با پردازش زبان عربی ارائه می‌نماید، خواهیم پرداخت.

استناد

ف‍رام‍رزی‌، اس‍م‍اع‍ی‍ل‌. 1382. ف‍از م‍طال‍ع‍ات‍ی‌ و ام‍ک‍ان‌س‍ن‍ج‍ی‌ ش‍ن‍اس‍ای‍ی‌ ش‍م‍اره‌‎ ص‍ف‍ح‍ات‌ پ‍ای‍ان‌‌ن‍امه‌ه‍ا در ب‍خ‍ش‌ ف‍ه‍رس‍ت‌ م‍طال‍ب‌ و ص‍ف‍ح‍ات‌ اص‍ل‍ی‌ ج‍ه‍ت‌ زم‍ی‍ن‍ه‌‌س‍ازی‌ ب‍رق‍راری‌ ارت‍ب‍اط خ‍ودک‍ار ب‍ی‍ن‌ آن‍ه‍ا. تهران: پژوهشگاه اطلاع‍ات‌ و م‍دارک‌ ع‍ل‍م‍ی‌ ای‍ران‌.

فایل پیوست
دریافت تمام متن (3.18 مگابایت)
شماره :
391
آخرین به روزرسانی :
جمعه, 26 دی 1404 - 23:41
X
Chat Icon