Geri Dön

Büyük dil modelleri tabanlı veri artırımı ile duygu analizi: ham ve sentetik veri konfigürasyonlarının performans ve tutarlılık açısından karşılaştırmalı analizi

Large language model–based data augmentation for sentiment analysis: a comparative analysis of raw and synthetic data configurations in terms of performance and consistency

  1. Tez No: 1018197
  2. Yazar: BÜŞRA TEKİNAY
  3. Danışmanlar: DR. ÖĞR. ÜYESİ MANSUR ALP TOÇOĞLU
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: Türkçe
  9. Üniversite: İzmir Katip Çelebi Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Yazılım Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu çalışma, büyük dil modelleri tabanlı veri artırmanın Türkçe duygu analizi üzerindeki etkisini, sentetik verinin farklı veri kümesi yapılandırmaları altında model performansını nasıl etkilediğini inceleyerek ele almaktadır. Pozitif ve negatif olarak etiketlenmiş otel ve film yorumlarından oluşan dengeli bir veri kullanılarak altı farklı veri seti yapılandırılması oluşturulmuştur: Ham, Ham+GPT, Ham+Claude, Ham+GPT+Claude, GPT ve Claude. Sentetik örnekler, GPT-4o ve Claude modelleri kullanılarak zero-shot prompting yöntemiyle üretilmiş ve sadece eğitim veri kümesine dâhil edilmiştir. NB, SVM, LR, CNN, LSTM ve BERT dâhil olmak üzere birden fazla sınıflandırıcı; doğruluk (accuracy), kesinlik (precision), geri çağırım (recall) ve F1-skoru ölçütleri kullanılarak eğitilmiş ve değerlendirilmiştir. Deneysel sonuçlar, yalnızca sentetik verilerden oluşan veri kümelerinin model performansında belirgin bir düşüşe yol açtığını; buna karşın hibrit veri kümelerinin (Ham + Sentetik), Ham veri kümesiyle istatistiksel olarak karşılaştırılabilir sonuçlar elde ettiğini göstermektedir. Bu bulgular, büyük dil modelleri tarafından üretilen sentetik verilerin, gerçek verilerle birlikte kullanıldığında model sağlamlığını korurken eğitim çeşitliliğini artırabildiğini ve düşük kaynaklı diller için pratik bir çözüm sunduğunu ortaya koymaktadır.

Özet (Çeviri)

This study examines the impact of large language model-based data augmentation on Turkish sentiment analysis by analyzing how synthetic data influences model performance across different dataset configurations. A balanced corpus of hotel and movie reviews labeled with positive and negative sentiments was used to construct six dataset variants: Raw, Raw+GPT, Raw+Claude, Raw+GPT+Claude, GPT, and Claude. Synthetic samples were generated through zero-shot prompting using GPT-4o and Claude models and incorporated exclusively into the training set. Multiple classifiers—including NB, SVM, LR, CNN, LSTM, and BERT—were trained and evaluated using accuracy, precision, recall, and F1-score metrics. Experimental results reveal that while synthetic-only datasets lead to substantial performance degradation, hybrid datasets (Raw + Synthetic) achieve results statistically comparable to the Raw dataset, demonstrating that synthetic reviews can effectively complement real data. These findings highlight that large language model-generated synthetic data, when combined with authentic samples, preserves model robustness while expanding training diversity, offering a practical solution for low-resource language datasets.

Benzer Tezler

  1. Sosyal ağlarda görsel duygu analizi

    Visual sentiment analysis on social networks

    MEHMET YILMAZ

    Yüksek Lisans

    Türkçe

    Türkçe

    2026

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolBandırma Onyedi Eylül Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ ARZUM KARATAŞ

  2. Devrelerin büyük işaret cevaplarının bilgisayar yardımıyla bulunması

    Başlık çevirisi yok

    NÜKHET GÜNEYİ

    Yüksek Lisans

    Türkçe

    Türkçe

    1985

    Elektrik ve Elektronik MühendisliğiUludağ Üniversitesi

    Elektrik-Elektronik Mühendisliği Ana Bilim Dalı

    PROF. DR. ERGÜR TÜTÜNCÜOĞLU

  3. Organize sanayi bölgelerinde iş güvenliği sorunlarının teknik ve bilimsel araştırılmasında bir yöntem önerisi

    Başlık çevirisi yok

    MEHMET ALİ YILDIRIM

    Yüksek Lisans

    Türkçe

    Türkçe

    1986

    Çalışma Ekonomisi ve Endüstri İlişkileriGazi Üniversitesi

    Kazaların Çevresel ve Teknik Araştırması Ana Bilim Dalı (disiplinlerarası)

    DOÇ. DR. İBRAHİM BOYNUKALIN

  4. Bazı sert çekirdekli meyve türlerinde döllenme biyolojisi üzerinde yöntem çalışmaları

    Başlık çevirisi yok

    ATBİMOĞLU ADALET

    Yüksek Lisans

    Türkçe

    Türkçe

    1985

    ZiraatEge Üniversitesi

    Bahçe Bitkileri Ana Bilim Dalı

    PROF. DR. RUHİNAZ GÜLCAN

  5. Sivas'ta kadınların işgücüne katılım farklılıkları

    Başlık çevirisi yok

    BİNNUR ERCEM

    Yüksek Lisans

    Türkçe

    Türkçe

    1984

    SosyolojiCumhuriyet Üniversitesi

    Kurumlar Sosyolojisi Ana Bilim Dalı

    YRD. DOÇ. DR. FARUK KOCACIK