PersianSciQA: مجموعه داده جدید برای سیستم پرسش و پاسخ در حوزه علمی

PersianSciQA: مجموعه داده جدید برای سیستم پرسش و پاسخ در حوزه علمی
نوع مقاله
عنوان همایش
کنفرانس بین‌المللی پیشرفت‌های اخیر در پردازش زیان طبیعی
شهر محل برگزاری همایش
وارنا
مؤسسه برگزارکننده
فایل پیوست
دریافت نسخه PDF (559.08 کیلوبایت)
چکیده

فقدان مجموعه‌ داده‌های تخصصی مرتبط با متون علمی توسعه الگوریتم‌ها و روش‌ها در حوزه پردازش زبان طبیعی (NLP) را در زبان‌های کم‌منبعی مانند فارسی با مانع مواجه می‌سازد. در این پژوهش، برای مقابله با این چالش، PersianSciQA معرفی شده که مشتمل بر ۳۹,۸۰۹ جفت پرسش-پاسخ است. هر جفت شامل یک پرسش و یک قطعه پاسخ علمی مستخرج از چکیده‌های مستندات علمی مستخرج از مخزن پایگاه علمی «گنج» متعلق به ایرانداک است. پرسش‌ها و پاسخ‌ها با تخصیص یک امتیازی بین ۰ تا ۳ با هم مرتبط هستند که با استفاده از مدل زبانی بزرگ (LLM) تعیین شده است. هر امتیاز میزان ارتباط پرسش را با محتوای قطعه پاسخ همراه آن مشخص می‌کند. این مجموعه‌ داده با به‌ کارگیری یک روش دو مرحله‌ای prompting تولید و از طریق یک فرایند پیوسته (پایپلاین) شامل نرمال‌سازی متنی و حذف تکرارهای معنایی، پالایش شده است. اعتبارسنجی انسانی بر روی ۱,۰۰۰ نمونه توسط دو پژوهشگر حوزه پردازش زبان طبیعی، کیفیت مجموعه‌داده را بهبود داده و همبستگی (ضریب کاپای کوهن ۰.۶۶۴۲ = κ) بین مدل‌های زبانی بزرگ و ارزیابی انسانی را تأیید کرده است. برای تعیین میزان ارزش و اثربخشی PersianSciQA ، نشان داده‌ایم که تنظیم دقیق (fine-tuning) مدل‌ها با استفاده از این مجموعه داده ، می‌تواند عملکرد مدل را روی داده‌های فارسی علمی به طور چشمگیری بهبود بخشد و ضریب همبستگی اسپیرمن ۰.۸۹۵ بدست آید. PersianSciQA منبع جدیدی برای تسهیل پژوهش در حوزه بازیابی اطلاعات و پاسخ به پرسش در قلمرو داده‌های علمی فارسی است.

استناد

آقاداود جلفایی، صفورا، آزاده محبی، و زهرا همت. 1404. PersianSciQA: مجموعه داده جدید برای سیستم پرسش و پاسخ در حوزه علمی . مقاله ارائه شده در کنفرانس بین‌المللی پیشرفت‌های اخیر در پردازش زیان طبیعی، وارنا. 

شماره :
6349
آخرین به روزرسانی :
شنبه, 29 فروردین 1405 - 11:33
X
Chat Icon