Konuşma duygusu tanımada derin öğrenme tabanlı modellerin karşılaştırmalı analizi
Comparative analysis of deep learning-based models in speech emotion recognition
- Tez No: 1016099
- Danışmanlar: DR. ÖĞR. ÜYESİ EMRE ÖLMEZ
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Bilim ve Teknoloji, Mühendislik Bilimleri, Computer Engineering and Computer Science and Control, Science and Technology, Engineering Sciences
- Anahtar Kelimeler: Derin öğrenme, Makine öğrenmesi, Yapay zeka, İnsan-yapay zeka etkileşimi, Deep learning, Machine learning, Artificial intelligence, Human-artificial intelligence interaction
- Yıl: 2026
- Dil: Türkçe
- Üniversite: İzmir Bakırçay Üniversitesi
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Biyomedikal Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Biyomedikal Mühendisliği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Konuşma duygu tanıma (KDT), insan-makine etkileşiminden, ruh sağlığı takibi gibi biyomedikal uygulama alanlarına kadar geniş bir yelpazede artan bir öneme sahip, zorlu bir araştırma alanıdır. Bu tez çalışmasının temel amacı, konuşma duygusu tanıma başarısını artırmak ve model verimliliğini kıyaslamak amacıyla, literatürdeki farklı yaklaşımları temsil eden dört farklı derin öğrenme mimarisini (Önerilen Hibrit ESA+ÖSA, Temel Transformer, PANNs-CNN14 ve Wav2Vec 2.0) karşılaştırmaktır. Çalışmada modellerin başarısını ve genelleme yeteneğini ölçmek için stüdyo ortamında kaydedilen RAVDESS ve gürültülü/doğal ortam koşullarını barındıran CREMA-D veri setleri kullanılmıştır. Metodolojik tutarlılık adına tüm modeller PyTorch kütüphanesi üzerinde geliştirilmiş, veri setlerinde sınıflar arası veri dengesizliğini gidermek için veri arttırma (augmentation) teknikleri uygulanmıştır. Özellik çıkarımı aşamasında ESA, ÖSA ve PANNs modelleri için Mel-Spektrogram (görüntü tabanlı) yaklaşımı benimsenirken Wav2Vec 2.0 modeli için ham ses dalgaları (raw waveform) kullanılarak uçtan uca öğrenme gerçekleştirilmektedir. Deneysel sonuçlar, transfer öğrenme tabanlı modellerin üstünlüğünü ortaya koymaktadır. Ham ses dalgalarını işleyen Wav2Vec 2.0 modeli, RAVDESS veri setinde %90.62, CREMA-D veri setinde ise %75.42 doğruluk oranıyla en yüksek başarıyı elde etmektedir. Öte yandan, bu çalışmada önerilen hibrit ESA+ ÖSA mimarisi, sadece 380 bin parametreye sahip olmasına rağmen, kendisinden yaklaşık 200 kat daha büyük olan PANNs (80 Milyon) ve Wav2Vec (90 Milyon) modellerine yaklaşan bir performans (RAVDESS: %78.47) sergilemektedir. Bu durum, kaynak kısıtı olan sistemlerde hibrit mimarilerin, yüksek hesaplama maliyetli Transformer tabanlı modellere göre daha verimli bir alternatif olduğunu göstermektedir.
Özet (Çeviri)
Speech emotion recognition (SER) is a challenging research area with increasing importance across a wide range of applications, from human-machine interaction to biomedical applications such as mental health monitoring. The main objective of this thesis is to improve the success of speech emotion recognition and compare model efficiency by considering four different deep learning architectures (Proposed Hybrid CNN+RNN, Vanilla Transformer, PANNs-CNN14, and Wav2Vec 2.0) representing different approaches in the literature. RAVDESS datasets recorded in a studio environment and CREMA-D datasets containing noisy/natural environment conditions were used to measure the success and generalization ability of the models. For methodological consistency, all models were developed on the PyTorch library, and data enrichment techniques were applied to address data imbalance. The Mel-Spectrogram (image-based) approach was adopted for CNN, RNN, and PANNs models in the feature extraction phase; End-to-end learning was performed for the Wav2Vec 2.0 model using raw sound waves. Experimental results revealed the superiority of transfer learning-based models. The Wav2Vec 2.0 model, which processes raw sound waves, achieved the highest success rate with an accuracy rate of 90.62% in the RAVDESS dataset and 75.42% in the CREMA-D dataset. On the other hand, the hybrid CNN+RNN architecture proposed in this study, despite having only 380,000 parameters, exhibited a performance approaching that of PANNs (80 million) and Wav2Vec (90 million) models, which are approximately 200 times larger (RAVDESS: 78.47%). This shows that hybrid architectures are a more efficient alternative to high-computational-cost Transformer-based models in resourceconstrained systems.
Benzer Tezler
- Yahya Kemal'de bedii tefekkür unsurları: 1 Kendi Gök Kubbemiz'de duygu
Başlık çevirisi yok
MUSTAFA ÖZBALCI
Yüksek Lisans
Türkçe
1985
Türk Dili ve EdebiyatıGazi ÜniversitesiTürk Dili ve Edebiyatı Ana Bilim Dalı
DOÇ. DR. SADIK K. TURAL
- Ameliyat öncesi hastaların ameliyata ilişkin duyguları, düşünceleri ve bilgi istekleri
The Pre-operative patiensts feelings throughts and information requirements concerning their surgical operations
KADRİYE BULDUKOĞLU
Yüksek Lisans
Türkçe
1987
HemşirelikCumhuriyet ÜniversitesiHemşirelik Ana Bilim Dalı
YRD. DOÇ. DR. MELİHA ATALAY
- Çatışmacı toplum paradigması: Teorik ve meta-teorik düzeylerin ilişkisi
Conflict paradigm of society
ADNAN TÜREGİN