Geri Dön

Konuşma duygusu tanımada derin öğrenme tabanlı modellerin karşılaştırmalı analizi

Comparative analysis of deep learning-based models in speech emotion recognition

  1. Tez No: 1016099
  2. Yazar: SEÇKİN YILDIZ
  3. Danışmanlar: DR. ÖĞR. ÜYESİ EMRE ÖLMEZ
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Bilim ve Teknoloji, Mühendislik Bilimleri, Computer Engineering and Computer Science and Control, Science and Technology, Engineering Sciences
  6. Anahtar Kelimeler: Derin öğrenme, Makine öğrenmesi, Yapay zeka, İnsan-yapay zeka etkileşimi, Deep learning, Machine learning, Artificial intelligence, Human-artificial intelligence interaction
  7. Yıl: 2026
  8. Dil: Türkçe
  9. Üniversite: İzmir Bakırçay Üniversitesi
  10. Enstitü: Lisansüstü Eğitim Enstitüsü
  11. Ana Bilim Dalı: Biyomedikal Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Biyomedikal Mühendisliği Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Konuşma duygu tanıma (KDT), insan-makine etkileşiminden, ruh sağlığı takibi gibi biyomedikal uygulama alanlarına kadar geniş bir yelpazede artan bir öneme sahip, zorlu bir araştırma alanıdır. Bu tez çalışmasının temel amacı, konuşma duygusu tanıma başarısını artırmak ve model verimliliğini kıyaslamak amacıyla, literatürdeki farklı yaklaşımları temsil eden dört farklı derin öğrenme mimarisini (Önerilen Hibrit ESA+ÖSA, Temel Transformer, PANNs-CNN14 ve Wav2Vec 2.0) karşılaştırmaktır. Çalışmada modellerin başarısını ve genelleme yeteneğini ölçmek için stüdyo ortamında kaydedilen RAVDESS ve gürültülü/doğal ortam koşullarını barındıran CREMA-D veri setleri kullanılmıştır. Metodolojik tutarlılık adına tüm modeller PyTorch kütüphanesi üzerinde geliştirilmiş, veri setlerinde sınıflar arası veri dengesizliğini gidermek için veri arttırma (augmentation) teknikleri uygulanmıştır. Özellik çıkarımı aşamasında ESA, ÖSA ve PANNs modelleri için Mel-Spektrogram (görüntü tabanlı) yaklaşımı benimsenirken Wav2Vec 2.0 modeli için ham ses dalgaları (raw waveform) kullanılarak uçtan uca öğrenme gerçekleştirilmektedir. Deneysel sonuçlar, transfer öğrenme tabanlı modellerin üstünlüğünü ortaya koymaktadır. Ham ses dalgalarını işleyen Wav2Vec 2.0 modeli, RAVDESS veri setinde %90.62, CREMA-D veri setinde ise %75.42 doğruluk oranıyla en yüksek başarıyı elde etmektedir. Öte yandan, bu çalışmada önerilen hibrit ESA+ ÖSA mimarisi, sadece 380 bin parametreye sahip olmasına rağmen, kendisinden yaklaşık 200 kat daha büyük olan PANNs (80 Milyon) ve Wav2Vec (90 Milyon) modellerine yaklaşan bir performans (RAVDESS: %78.47) sergilemektedir. Bu durum, kaynak kısıtı olan sistemlerde hibrit mimarilerin, yüksek hesaplama maliyetli Transformer tabanlı modellere göre daha verimli bir alternatif olduğunu göstermektedir.

Özet (Çeviri)

Speech emotion recognition (SER) is a challenging research area with increasing importance across a wide range of applications, from human-machine interaction to biomedical applications such as mental health monitoring. The main objective of this thesis is to improve the success of speech emotion recognition and compare model efficiency by considering four different deep learning architectures (Proposed Hybrid CNN+RNN, Vanilla Transformer, PANNs-CNN14, and Wav2Vec 2.0) representing different approaches in the literature. RAVDESS datasets recorded in a studio environment and CREMA-D datasets containing noisy/natural environment conditions were used to measure the success and generalization ability of the models. For methodological consistency, all models were developed on the PyTorch library, and data enrichment techniques were applied to address data imbalance. The Mel-Spectrogram (image-based) approach was adopted for CNN, RNN, and PANNs models in the feature extraction phase; End-to-end learning was performed for the Wav2Vec 2.0 model using raw sound waves. Experimental results revealed the superiority of transfer learning-based models. The Wav2Vec 2.0 model, which processes raw sound waves, achieved the highest success rate with an accuracy rate of 90.62% in the RAVDESS dataset and 75.42% in the CREMA-D dataset. On the other hand, the hybrid CNN+RNN architecture proposed in this study, despite having only 380,000 parameters, exhibited a performance approaching that of PANNs (80 million) and Wav2Vec (90 million) models, which are approximately 200 times larger (RAVDESS: 78.47%). This shows that hybrid architectures are a more efficient alternative to high-computational-cost Transformer-based models in resource￾constrained systems.

Benzer Tezler

  1. Yahya Kemal'de bedii tefekkür unsurları: 1 Kendi Gök Kubbemiz'de duygu

    Başlık çevirisi yok

    MUSTAFA ÖZBALCI

    Yüksek Lisans

    Türkçe

    Türkçe

    1985

    Türk Dili ve EdebiyatıGazi Üniversitesi

    Türk Dili ve Edebiyatı Ana Bilim Dalı

    DOÇ. DR. SADIK K. TURAL

  2. Ameliyat öncesi hastaların ameliyata ilişkin duyguları, düşünceleri ve bilgi istekleri

    The Pre-operative patiensts feelings throughts and information requirements concerning their surgical operations

    KADRİYE BULDUKOĞLU

    Yüksek Lisans

    Türkçe

    Türkçe

    1987

    HemşirelikCumhuriyet Üniversitesi

    Hemşirelik Ana Bilim Dalı

    YRD. DOÇ. DR. MELİHA ATALAY

  3. Tanzimattan Cumhuriyet'e Türkiye'de aydınlar ve aydın sosyolojisi

    Başlık çevirisi yok

    İHSAN KESER

    Yüksek Lisans

    Türkçe

    Türkçe

    1986

    SosyolojiCumhuriyet Üniversitesi

    Sosyoloji Ana Bilim Dalı

    DOÇ. DR. HALİL ÇİVİ

  4. Çatışmacı toplum paradigması: Teorik ve meta-teorik düzeylerin ilişkisi

    Conflict paradigm of society

    ADNAN TÜREGİN

    Yüksek Lisans

    Türkçe

    Türkçe

    1985

    SosyolojiCumhuriyet Üniversitesi

    Sosyoloji Ana Bilim Dalı

    DR. İNAN ÖZER

  5. Enflasyon ve Gelir Vergisi arasındaki ilişkiler

    Başlık çevirisi yok

    E.ÖZCAN ALTAN

    Yüksek Lisans

    Türkçe

    Türkçe

    1987

    Ekonomiİstanbul Üniversitesi

    Maliye Ana Bilim Dalı

    PROF. DR. SALİH TURHAN