ارائه مدلی ترکیبی مبتنی بر CNN – LSTM جهت تشخیص هیجان از سیگنال گفتار | ||
| پدافند الکترونیکی و سایبری | ||
| مقاله 3، دوره 12، شماره 4 - شماره پیاپی 48، زمستان 1403، صفحه 21-32 اصل مقاله (1.27 M) | ||
| نوع مقاله: مقاله پژوهشی | ||
| نویسندگان | ||
| رضا احمدیان1؛ حسین رعیتپرور1؛ ابوالفضل سرکرده ئی* 2 | ||
| 1کارشناسی ارشد،دانشگاه جامع امام حسین (ع)، تهران،ایران | ||
| 2پژوهشگر،دانشگاه جامع امام حسین (ع)، تهران،ایران | ||
| چکیده | ||
| داده های منتشرشده در فضای مجازی شامل متن، تصویر، ویدئو و صوت به منبعی معتبر برای سنجش افکار، عقاید و هیجانات مخاطب نسبت به اشیا مختلف مانند دولتها، سیاستها، شخصیتها، محصولات و غیره تبدیلشدهاند، ب همنظور مقابله با تهدیدات شناختی فضای سایبری، تشخیص شاکله شناختی مخاطبان خودی و غیرخودی بسیار حائز اهمیت است. پژوهش حاضر بهمنظور ارائهی مدلی محاسباتی برای تشخیص هیجان گفتار مخاطب مبتنی بر ترکیب دوطبقه بند CNN – LSTM صورت گرفته است. در این مقاله در ابتدا مقدمهای در مورد تشخیص هیجان گفتار و کاربردهای آن گفتهشده، سپس طرحهای ارائهشده در مجلات معتبر مرور و دقت آنها ارزیابیشده است، در ادامه روشی کاربردی جهت تشخیص هشت هیجان پایه مخاطب شامل شادی، غم، ترس، آرام، خشم، نفرت، شگفتزده و خنثی ارائهشده است. در این پژوهش بهمنظور داشتن تعداد داده بالا، با ترکیب دو مجموعه داده RAVDESS و TESS یک مجموعه داده کلی جمعآوریشده، در مرحله استخراج ویژگی سه ویژگی MFCC، MEL و ZCR استخراج و ترکیبشده و سپس در مدل طراحیشده از ترکیب طبقهبندی کنندههای CNN و LSTM جهت آموزش و تست استفادهشده است. با ارزیابیهای انجامشده، دقت مدل بر رویدادههای تست، 92.57 درصد است، که نسبت به مدل های موجود دارای دقت بالاتری می باشد. | ||
| کلیدواژهها | ||
| تشخیص هیجان گفتار؛ مخاطب سنجی؛ شبکه عصبی کانولوشن؛ شبکه عصبی بازگشتی؛ ضرایب کپسترال فرکانس مل | ||
| مراجع | ||
|
| ||
|
آمار تعداد مشاهده مقاله: 452 تعداد دریافت فایل اصل مقاله: 89 |
||