Geri Dön

Büyük dil modelleri tabanlısoru-cevap sistemlerinin performans karşılaştırması

Performance comparison of large language model-based question answering systems

  1. Tez No: 977070
  2. Yazar: OĞUZHAN KIRLAR
  3. Danışmanlar: DR. ÖĞR. ÜYESİ MEHMET ALİ ALTUNCU
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2025
  8. Dil: Türkçe
  9. Üniversite: Kocaeli Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu tez çalışmasında, DDİ alanında sıklıkla başvurulan bağlamsal soru-cevaplama görevine odaklanılmış ve transformer tabanlı dil modellerinin bu alandaki başarıları Stanford Question Answering Dataset'in ikinci versiyonu (SQuAD v2.0) üzerinde karşılaştırmalı olarak değerlendirilmiştir. SQuAD v2.0, içinde hem cevaplanabilir hem de cevapsız bırakılması gereken soruların yer aldığı karmaşık bir veri yapısına sahiptir ve bu yönüyle modellerin yalnızca bilgiye ulaşma değil, aynı zamanda“cevap verilemez”durumlarını da doğru şekilde tespit edebilme becerilerini test etmeye imkân tanır. Bu kapsamda, BERT, RoBERTa, ALBERT ve DistilBERT olmak üzere dört farklı transformer tabanlı model, aynı eğitim parametreleri ve önişleme adımlarıyla eğitilmiştir. Eğitim süreci, Google Colab platformunda karma hassasiyetli hesaplama (mixed precision / FP16) desteği ile optimize edilmiş, modellerin performansları ise Exact Match (EM) ve F1 skoru metrikleriyle ölçülmüştür. Değerlendirme sonuçlarına göre RoBERTa modeli, %85,90 EM ve %88,69 F1 skorlarıyla en yüksek başarıyı sağlamış; onu sırasıyla BERT, ALBERT ve DistilBERT takip etmiştir. Bireysel model performanslarının yanı sıra, bu tezde topluluk (ensemble) öğrenme yöntemleri de uygulanmıştır. RoBERTa ve BERT modellerinin çıktıları, naive metin birleştirme, logit skoru tabanlı güven ölçümü (confidence voting) ve ağırlıklı birleştirme (weighted voting) gibi stratejilerle bir araya getirilmiştir. Ancak elde edilen bulgular, bu topluluk öğrenme yaklaşımlarının RoBERTa'nın tek başına sunduğu başarıyı anlamlı şekilde aşamadığını göstermiştir. Özellikle hatalı feature eşleştirmelerinden kaynaklanan performans kayıpları ve modellerin tahmin hatalarının benzerlik göstermesi, topluluk öğrenme yöntemlerinin beklenen katkıyı sağlayamamasına neden olmuştur. Ek olarak, tezde veri kümesine dair istatistiksel analizler yapılmış; soru ve cevap uzunlukları, cevapların metin içindeki konumları ve sık kullanılan soru başlangıç kelimeleri gibi yapılar incelenmiştir. Bu analizler, modellerin kısa ve öz cevaplar üretmeye daha uygun olduğunu ve metinlerin başındaki bilgileri daha iyi öğrendiğini ortaya koymuştur. Sonuç olarak, bu çalışma transformer tabanlı dil modellerinin SQuAD v2.0 gibi zorlu benchmark veri kümelerinde sundukları performansı ayrıntılı biçimde ortaya koymakta; aynı zamanda topluluk öğrenme yöntemlerinin dikkatli planlanmadığı takdirde yüksek performanslı bireysel modellerin gerisinde kalabileceğini göstermektedir. Gelecek çalışmalar için önerilen yol haritası, model çeşitliliği, stacking tabanlı topluluk öğrenme yapıları, dil çeşitliliği ve metrik odaklı değerlendirme stratejileri gibi başlıklar üzerinden yönlendirilmiştir.

Özet (Çeviri)

This thesis focuses on the contextual question answering task, which is widely used in the field of Natural Language Processing (NLP), and presents a comparative evaluation of the performance of transformer-based language models on the second version of the Stanford Question Answering Dataset (SQuAD v2.0). SQuAD v2.0 contains both answerable and unanswerable questions, providing a complex data structure that enables testing not only the information retrieval capability of models but also their ability to detect when a question is unanswerable. In this context, four different transformer-based models—BERT, RoBERTa, ALBERT, and DistilBERT—were trained using identical preprocessing steps and training parameters. The training process was optimized on the Google Colab platform using mixed-precision (FP16) support, and model performance was measured with the Exact Match (EM) and F1 score metrics. According to the evaluation results, RoBERTa achieved the highest performance with 85,90% EM and 88,69% F1, followed by BERT, ALBERT, and DistilBERT, respectively. In addition to evaluating individual model performance, ensemble learning methods were also applied in this thesis. The outputs of RoBERTa and BERT were combined using strategies such as naive text merging, logit score-based confidence voting, and weighted voting. However, the findings revealed that these ensemble approaches did not significantly outperform RoBERTa's standalone performance. In particular, performance losses caused by incorrect feature alignments and the similarity of prediction errors across models limited the benefits of ensemble methods. Furthermore, the thesis includes statistical analyses of the dataset, examining aspects such as question and answer lengths, answer positions within the context, and the most frequently used question starters. These analyses showed that the models are more suited to generating short and concise answers and tend to better learn information located at the beginning of the context. In conclusion, this study provides a detailed analysis of transformer-based language models' performance on a challenging benchmark dataset like SQuAD v2.0 and demonstrates that ensemble strategies, if not carefully designed, may underperform compared to strong individual models. The roadmap for future work is outlined around topics such as model diversity, stacking-based ensemble architectures, language diversity, and metric-focused evaluation strategies.

Benzer Tezler

  1. Devrelerin büyük işaret cevaplarının bilgisayar yardımıyla bulunması

    Başlık çevirisi yok

    NÜKHET GÜNEYİ

    Yüksek Lisans

    Türkçe

    Türkçe

    1985

    Elektrik ve Elektronik MühendisliğiUludağ Üniversitesi

    Elektrik-Elektronik Mühendisliği Ana Bilim Dalı

    PROF. DR. ERGÜR TÜTÜNCÜOĞLU

  2. Organize sanayi bölgelerinde iş güvenliği sorunlarının teknik ve bilimsel araştırılmasında bir yöntem önerisi

    Başlık çevirisi yok

    MEHMET ALİ YILDIRIM

    Yüksek Lisans

    Türkçe

    Türkçe

    1986

    Çalışma Ekonomisi ve Endüstri İlişkileriGazi Üniversitesi

    Kazaların Çevresel ve Teknik Araştırması Ana Bilim Dalı (disiplinlerarası)

    DOÇ. DR. İBRAHİM BOYNUKALIN

  3. Bazı sert çekirdekli meyve türlerinde döllenme biyolojisi üzerinde yöntem çalışmaları

    Başlık çevirisi yok

    ATBİMOĞLU ADALET

    Yüksek Lisans

    Türkçe

    Türkçe

    1985

    ZiraatEge Üniversitesi

    Bahçe Bitkileri Ana Bilim Dalı

    PROF. DR. RUHİNAZ GÜLCAN

  4. Sivas'ta kadınların işgücüne katılım farklılıkları

    Başlık çevirisi yok

    BİNNUR ERCEM

    Yüksek Lisans

    Türkçe

    Türkçe

    1984

    SosyolojiCumhuriyet Üniversitesi

    Kurumlar Sosyolojisi Ana Bilim Dalı

    YRD. DOÇ. DR. FARUK KOCACIK

  5. Analog dijital çeviricilerin analiz ve sentezi

    Başlık çevirisi yok

    ALİ ÇAPRAZ

    Yüksek Lisans

    Türkçe

    Türkçe

    1985

    Elektrik ve Elektronik MühendisliğiUludağ Üniversitesi

    Elektronik Mühendisliği Ana Bilim Dalı

    PROF. DR. ERGÜR TÜTÜNCÜOĞLU