Büyük dil modelleri tabanlısoru-cevap sistemlerinin performans karşılaştırması
Performance comparison of large language model-based question answering systems
- Tez No: 977070
- Danışmanlar: DR. ÖĞR. ÜYESİ MEHMET ALİ ALTUNCU
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: Türkçe
- Üniversite: Kocaeli Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu tez çalışmasında, DDİ alanında sıklıkla başvurulan bağlamsal soru-cevaplama görevine odaklanılmış ve transformer tabanlı dil modellerinin bu alandaki başarıları Stanford Question Answering Dataset'in ikinci versiyonu (SQuAD v2.0) üzerinde karşılaştırmalı olarak değerlendirilmiştir. SQuAD v2.0, içinde hem cevaplanabilir hem de cevapsız bırakılması gereken soruların yer aldığı karmaşık bir veri yapısına sahiptir ve bu yönüyle modellerin yalnızca bilgiye ulaşma değil, aynı zamanda“cevap verilemez”durumlarını da doğru şekilde tespit edebilme becerilerini test etmeye imkân tanır. Bu kapsamda, BERT, RoBERTa, ALBERT ve DistilBERT olmak üzere dört farklı transformer tabanlı model, aynı eğitim parametreleri ve önişleme adımlarıyla eğitilmiştir. Eğitim süreci, Google Colab platformunda karma hassasiyetli hesaplama (mixed precision / FP16) desteği ile optimize edilmiş, modellerin performansları ise Exact Match (EM) ve F1 skoru metrikleriyle ölçülmüştür. Değerlendirme sonuçlarına göre RoBERTa modeli, %85,90 EM ve %88,69 F1 skorlarıyla en yüksek başarıyı sağlamış; onu sırasıyla BERT, ALBERT ve DistilBERT takip etmiştir. Bireysel model performanslarının yanı sıra, bu tezde topluluk (ensemble) öğrenme yöntemleri de uygulanmıştır. RoBERTa ve BERT modellerinin çıktıları, naive metin birleştirme, logit skoru tabanlı güven ölçümü (confidence voting) ve ağırlıklı birleştirme (weighted voting) gibi stratejilerle bir araya getirilmiştir. Ancak elde edilen bulgular, bu topluluk öğrenme yaklaşımlarının RoBERTa'nın tek başına sunduğu başarıyı anlamlı şekilde aşamadığını göstermiştir. Özellikle hatalı feature eşleştirmelerinden kaynaklanan performans kayıpları ve modellerin tahmin hatalarının benzerlik göstermesi, topluluk öğrenme yöntemlerinin beklenen katkıyı sağlayamamasına neden olmuştur. Ek olarak, tezde veri kümesine dair istatistiksel analizler yapılmış; soru ve cevap uzunlukları, cevapların metin içindeki konumları ve sık kullanılan soru başlangıç kelimeleri gibi yapılar incelenmiştir. Bu analizler, modellerin kısa ve öz cevaplar üretmeye daha uygun olduğunu ve metinlerin başındaki bilgileri daha iyi öğrendiğini ortaya koymuştur. Sonuç olarak, bu çalışma transformer tabanlı dil modellerinin SQuAD v2.0 gibi zorlu benchmark veri kümelerinde sundukları performansı ayrıntılı biçimde ortaya koymakta; aynı zamanda topluluk öğrenme yöntemlerinin dikkatli planlanmadığı takdirde yüksek performanslı bireysel modellerin gerisinde kalabileceğini göstermektedir. Gelecek çalışmalar için önerilen yol haritası, model çeşitliliği, stacking tabanlı topluluk öğrenme yapıları, dil çeşitliliği ve metrik odaklı değerlendirme stratejileri gibi başlıklar üzerinden yönlendirilmiştir.
Özet (Çeviri)
This thesis focuses on the contextual question answering task, which is widely used in the field of Natural Language Processing (NLP), and presents a comparative evaluation of the performance of transformer-based language models on the second version of the Stanford Question Answering Dataset (SQuAD v2.0). SQuAD v2.0 contains both answerable and unanswerable questions, providing a complex data structure that enables testing not only the information retrieval capability of models but also their ability to detect when a question is unanswerable. In this context, four different transformer-based models—BERT, RoBERTa, ALBERT, and DistilBERT—were trained using identical preprocessing steps and training parameters. The training process was optimized on the Google Colab platform using mixed-precision (FP16) support, and model performance was measured with the Exact Match (EM) and F1 score metrics. According to the evaluation results, RoBERTa achieved the highest performance with 85,90% EM and 88,69% F1, followed by BERT, ALBERT, and DistilBERT, respectively. In addition to evaluating individual model performance, ensemble learning methods were also applied in this thesis. The outputs of RoBERTa and BERT were combined using strategies such as naive text merging, logit score-based confidence voting, and weighted voting. However, the findings revealed that these ensemble approaches did not significantly outperform RoBERTa's standalone performance. In particular, performance losses caused by incorrect feature alignments and the similarity of prediction errors across models limited the benefits of ensemble methods. Furthermore, the thesis includes statistical analyses of the dataset, examining aspects such as question and answer lengths, answer positions within the context, and the most frequently used question starters. These analyses showed that the models are more suited to generating short and concise answers and tend to better learn information located at the beginning of the context. In conclusion, this study provides a detailed analysis of transformer-based language models' performance on a challenging benchmark dataset like SQuAD v2.0 and demonstrates that ensemble strategies, if not carefully designed, may underperform compared to strong individual models. The roadmap for future work is outlined around topics such as model diversity, stacking-based ensemble architectures, language diversity, and metric-focused evaluation strategies.
Benzer Tezler
- Devrelerin büyük işaret cevaplarının bilgisayar yardımıyla bulunması
Başlık çevirisi yok
NÜKHET GÜNEYİ
Yüksek Lisans
Türkçe
1985
Elektrik ve Elektronik MühendisliğiUludağ ÜniversitesiElektrik-Elektronik Mühendisliği Ana Bilim Dalı
PROF. DR. ERGÜR TÜTÜNCÜOĞLU
- Organize sanayi bölgelerinde iş güvenliği sorunlarının teknik ve bilimsel araştırılmasında bir yöntem önerisi
Başlık çevirisi yok
MEHMET ALİ YILDIRIM
Yüksek Lisans
Türkçe
1986
Çalışma Ekonomisi ve Endüstri İlişkileriGazi ÜniversitesiKazaların Çevresel ve Teknik Araştırması Ana Bilim Dalı (disiplinlerarası)
DOÇ. DR. İBRAHİM BOYNUKALIN
- Bazı sert çekirdekli meyve türlerinde döllenme biyolojisi üzerinde yöntem çalışmaları
Başlık çevirisi yok
ATBİMOĞLU ADALET
- Sivas'ta kadınların işgücüne katılım farklılıkları
Başlık çevirisi yok
BİNNUR ERCEM
Yüksek Lisans
Türkçe
1984
SosyolojiCumhuriyet ÜniversitesiKurumlar Sosyolojisi Ana Bilim Dalı
YRD. DOÇ. DR. FARUK KOCACIK
- Analog dijital çeviricilerin analiz ve sentezi
Başlık çevirisi yok
ALİ ÇAPRAZ
Yüksek Lisans
Türkçe
1985
Elektrik ve Elektronik MühendisliğiUludağ ÜniversitesiElektronik Mühendisliği Ana Bilim Dalı
PROF. DR. ERGÜR TÜTÜNCÜOĞLU