| تعداد نشریات | 38 |
| تعداد شمارهها | 1,423 |
| تعداد مقالات | 10,238 |
| تعداد مشاهده مقاله | 12,217,385 |
| تعداد دریافت فایل اصل مقاله | 7,148,395 |
ارائه ی یک مدل لب خوانی فارسی مبتنی بر ترکیب شبکههای پیچشی و ترنسفورمر | ||
| پدافند الکترونیکی و سایبری | ||
| مقالات آماده انتشار، پذیرفته شده، انتشار آنلاین از تاریخ 09 اردیبهشت 1405 | ||
| نوع مقاله: مقاله پژوهشی | ||
| نویسندگان | ||
| ژینا شهیدی زندی؛ ولی درهمی* ؛ علیمحمد لطیف؛ محمد تقی صادقی | ||
| دانشگاه یزد | ||
| تاریخ دریافت: 20 بهمن 1404، تاریخ بازنگری: 06 فروردین 1405، تاریخ پذیرش: 31 فروردین 1405 | ||
| چکیده | ||
| گفتار رایجترین شکل ارتباط بین انسانها است و شامل درک اطلاعات صوتی و تصویری میشود. لبخوانی فرایندی است که برای تشخیص گفتار از روی حرکات لب گوینده استفاده میشود. ازآنجاکه محرمانگی گفتار در محیطهای امنیتی به دلایل مسائل شنود بسیار اهمیت دارد؛ بنابراین لبخوانی به یکی از مهمترین مسائل امروزه تبدیل شده است. در این مقاله روشی نوین مبتنی بر ترکیب شبکههای پیچشی و شبکهی ترنسفورمر در تشخیص گفتار از تصویر حرکات لب افراد مختلف ارائه میشود. در این ساختار ویژگیها با استفاده از شبکههای پیچشی استخراج میگردند. سپس این ویژگیها بهعنوان ورودی به ساختار ترنسفورمر پیشنهادی برای تولید متن عبارت گفتاری در خروجی منتقل میشوند. الگوریتم پیشنهادی بر روی مجموعهدادگان پاوید در زبان فارسی ارزیابی گردیده است. نوآوری روش پیشنهادی بازشناسی حرکات لب در سطح واحدهای واج یا ویزم است. این رویکرد امکان تعمیمپذیری بهتر و بازسازی گفتار پیوسته را فراهم میسازد. علاوه بر این آزمایشها نشان میدهد رویکرد پیشنهادی زمان آموزش را کاهش میدهد و عملکرد سامانه را ارتقا میبخشد. دقت روش پیشنهادی در تشخیص واجهای دادههای آزمون، ۸۹ درصد است که نسبت به مدلهای دیگر دارای دقت بالاتری است. | ||
| کلیدواژهها | ||
| لب خوانی؛ بازشناسی دیداری گفتار؛ شبکههای عصبی پیچشی؛ استخراج ویژگی؛ ترنسفورمر | ||
| موضوعات | ||
| امنیت اطلاعات، رمزنگاری، پنهان نگاری، پروتکل ها و استانداردها | ||
| عنوان مقاله [English] | ||
| A Persian Lipreading Model Based on the Combination of CNN and Transformer Networks | ||
| نویسندگان [English] | ||
| zhina shahidi zandi؛ Vali Derhami؛ ali mohammad latif؛ mohammad taghi sadeghi | ||
| Yazd University | ||
| چکیده [English] | ||
| Speech is the primary medium of human communication and involves the interpretation of both auditory and visual information. Lipreading, or visual speech recognition, aims to infer spoken content by analyzing lip movements. With the growing importance of speech confidentiality in security-sensitive environments and the increasing vulnerability to acoustic eavesdropping, lipreading has attracted significant research attention in recent years. This paper presents a novel visual speech recognition framework that integrates convolutional neural networks (CNNs) with Transformer architectures to recognize speech from lip movement images of multiple speakers. In the proposed framework, CNNs extract discriminative spatial features, which are subsequently processed by a Transformer-based model to generate the corresponding textual output. The proposed method is evaluated on the Persian PAVID dataset. A key contribution of this work is viseme-level lip movement recognition, which improves generalization capability and enables continuous speech reconstruction. Experimental results demonstrate that the proposed approach reduces training time while enhancing overall recognition performance, achieving an accuracy of 89% in phoneme recognition on the test set and outperforming existing state-of-the-art methods. | ||
| کلیدواژهها [English] | ||
| Lip reading, Visual speech recognition, convolutional neural networks (CNNs), Feature extraction, Transformer | ||
| مراجع | ||
|
| ||
|
آمار تعداد مشاهده مقاله: 3 |
||