پایان طرح پژوهشی «شناسایی مسائل و ارائه راهکارهای زبانشناختی سازماندهی و بازیابی اطلاعات در سامانه اطلاعات علمی ایران (گنج)»
طرح پژوهشی دکتر زهرا محمودزاده با عنوان «شناسایی مسائل و ارائه راهکارهای زبانشناختی سازماندهی و بازیابی اطلاعات در سامانه اطلاعات علمی ایران (گنج)» به پایان رسید.
به گزارش«روابط عمومی پژوهشگاه علوم و فناوری اطلاعات ایران» در نشست 293 شورای پژوهش که در 19 تیر ۱۳۹۷ برگزار شد، طرح پژوهشی «شناسایی مسائل و ارائه راهکارهای زبانشناختی سازماندهی و بازیابی اطلاعات در سامانه اطلاعات علمی ایران (گنج)» توسط دکتر زهرا محمودزاده، عضو هیئتعلمی پیشین به پایان رسید.
در این پژوهش ابتدا با بررسی میدانی پایگاه اطلاعات علمی ایران (گنج)، مسائل زبانشناختی بازیابی و ساماندهی اطلاعات در این پایگاه بدست آمده و سپس راهکارهایی ارائه شده است. مسائل نمایهسازی شامل موارد زیر است: ترجمه به فارسی یا انگلیسی اطلاعات کتابشناختی، استفاده از معادلهای متعدد برای یک واژه لاتین، یافتن معادل فارسی کلیدواژههای لاتین، تعیین اختصار فارسی برای یک واژه لاتین، نوشتن صورتهای مخفف لاتین به اشکال مختلف، انواع خطاهای املایی و نگارشی در هر دو سطح فارسی و لاتین، مسائل مربوط به درج علائم ریاضی و فرمولهای شیمی در چکیده و عنوان، مطالب نامربوط در چکیده. برای حل مسائل زبانشناختی ساماندهی و نمایهسازی به نظر رسید علاوه بر بهبود قابلیت نرمافزار نمایهسازی، لازم است دانش تخصصی در زمینه علوم مختلف و نیز زبان فارسی و زبانشناسی بکار گرفته شود.
مسائل بازیابی به دو دسته تقسیم شدند: الف) صورتهای متفاوت نوشتاری ناشی از کاربرد علامتهای مختلف نوشتاری: تشدید، همزه، تنوین، آوا، نقطه، خط تیره، صورتهای متفاوت کسره اضافه و صورتهای مختلف جمع و صورتهای مختلف اختصارات و ب) صورتهای متفاوت ناشی از مسائل معنایی، صرفی و نحوی: کلمات چندمعنا با املای یکسان (اما صورت آوایی یکسان یا متفاوت)، صورتهای متفاوت واژگانی با معنای یکسان یا مرتبط و صورتهای کوتاه / کامل اسامی یا سازمانها. بررسی ادبیات مربوط به بازیابی اطلاعات نشان میدهد که بکارگیری روشها و تکنیکهای پردازش زبان طبیعی تاثیر معناداری در بهبود دقت و بازخوانی سیستمهای بازیابی اطلاعات دارد.
