در این پژوهش ابتدا با بررسی میدانی پایگاه اطلاعات علمی ایران (گنج)، مسائل زبانشناختی بازیابی و ساماندهی اطلاعات در این پایگاه بدست آمد و سپس راهکارهایی ارائه شد. مسائل نمایهسازی شامل موارد زیر است: ترجمه به فارسی یا انگلیسی اطلاعات کتابشناختی، استفاده از معادلهای متعدد برای یک واژه لاتین، یافتن معادل فارسی کلیدواژههای لاتین، تعیین اختصار فارسی برای یک واژه لاتین، نوشتن صورتهای مخفف لاتین به اشکال مختلف، انواع خطاهای املایی و نگارشی در هر دو سطح فارسی و لاتین، مسائل مربوط به درج علائم ریاضی و فرمولهای شیمی در چکیده و عنوان، مطالب نامربوط در چکیده. برای حل مسائل زبانشناختی ساماندهی و نمایهسازی به نظر میرسد علاوه بر بهبود قابلیت نرمافزار نمایهسازی، لازم است دانش تخصصی در زمینه علوم مختلف و نیز زبان فارسی و زبانشناسی به کار گرفته شود.
مسائل بازیابی به دو دسته تقسیم می شوند: الف) صورتهای متفاوت نوشتاری ناشی از کاربرد علامتهای مختلف نوشتاری: تشدید، همزه، تنوین، آوا، نقطه، خط تیره، صورتهای متفاوت کسره اضافه و صورتهای مختلف جمع و صورتهای مختلف اختصارات و ب) صورتهای متفاوت ناشی از مسائل معنایی، صرفی و نحوی: کلمات چندمعنا با املای یکسان (اما صورت آوایی یکسان یا متفاوت)، صورتهای متفاوت واژگانی با معنای یکسان یا مرتبط و صورتهای کوتاه/کامل اسامی یا سازمانها. بررسی ادبیات مربوط به بازیابی اطلاعات نشان می دهد که بکارگیری روشها و تکنیکهای پردازش زبان طبیعی تاثیر معناداری در بهبود دقت و بازخوانی سیستمهای بازیابی اطلاعات دارد.
محمودزاده، زهرا، و زهرا دهسرایی.1397. شناسایی مسائل و ارائه راهکارهای زبانشناختی سازماندهی و بازیابی اطلاعات در سامانه اطلاعات علمی ایران (گنج). تهران: پژوهشگاه علوم و فناوری اطلاعات ایران.
