پژوهشهای اندکی با هدف خودکارسازی ایجاد شبکه استنادی منابع فارسیزبان انجام شده است. در سالهای اخیر، دو پروژه در پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک) با عناوین «طراحی روش هوشمند تجزیه زنجیرههای مرجع در زبان فارسی» و «ارائه ماژول نرمافزاری جهت ساخت شبکه استنادی در پایگاه اطلاعات علمی ایران (گنج)» اجرا شد. روشهای ارائه شده در این پروژهها مبتنی بر روش یادگیری ماشینی «ماشین بردار پشتیبان» هستند. تحولات اخیر در حوزه پردازش زبان طبیعی و توان محاسباتی فرصتهای جدیدی برای ارائه روشهای بهتر و دقیقتر برای مساله ایجاد خودکار شبکههای استنادی فراهم ساخته است. با توجه این مهم، در این پژوهش از مدلهای شبکه عصبی برای خودکارسازی ایجاد شبکه استنادی منابع فارسیزبان استفاده خواهیم کرد. به طور مشخص، دو روش مبتنی بر شبکه عصبی که در زبان انگلیسی با نتایج بسیار خوب همراه شده است، یعنی روش مبتنی بر CRF–BLSTM (Uddin, 2022) و روش مبتنی بر ترنسفورمرها (Prasad et al. 2018)، را بر روی منابع علمی فارسیزبان پیادهسازی کرده و آموزش خواهیم داد. در ادامه، ضمن مقایسه روشهای موجود و پیشنهادی، به عنوان کاربردی محدود، بهترین روش را بر روی سامانه انتشارات دانشگاهی (ساد) پیادهسازی خواهیم کرد. سامانه ساد، که با هدف بهبود فرایند نشر کتابهای علمی و دانشگاهی و ارتقای تجربه نویسندگان، ناشران و مخاطبان طراحی شده است، مبتنی بر قالب EPub بوده و امکان مطالعه برخط کتابها را فراهم میکند. از آنجا که این سامانه به صورت داخلی توسعه یافته، بستری مناسب برای به کارگیری محدود روش پیشنهادی به شمار میآید. لازم به بیان است که همانند پژوهشهای پیشین، بهدلیل محدودیتهای زیرساختی نسخه فعلی پایگاه گنج و عدم امکان توسعه آن، امکان به کارگیری نتایج این پژوهش بر روی نسخه فعلی این پایگاه وجود ندارد؛ امید است با توسعه پایگاه گنج جامع (نسخه بعدی این پایگاه که در بردارنده طیف وسیعی از مدارک علمی خواهد بود)، نتایج این پژوهش به پیادهسازی خودکار شبکه استنادی منابع فارسیزبان در مقیاس وسیع منجر شود.
پاکنیت، نصراله، امیر صیادی، علیاصغر حجتپناه، و مصطفی شعبانی. زودآیند. ایجاد شبکه استنادی سامانه انتشارات دانشگاهی (ساد) با استفاده از مدلهای شبکه عصبی. تهران: پژوهشگاه علوم و فناوری اطلاعات ایران.
