Evaluati̇ng the performance of large language models on long-context bi̇omedi̇cal questi̇on answeri̇ng
Büyük dil modellerinin uzun bağlamlı biyomedikal soru cevaplama üzerindeki performansının değerlendirilmesi
- Tez No: 1019801
- Danışmanlar: PROF. FERDİ SÖNMEZ
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: İngilizce
- Üniversite: İstanbul Aydın Üniversitesi
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Yapay Zeka ve Veri Bilimi Ana Bilim Dalı
- Bilim Dalı: Yapay Zeka ve Veri Bilimi Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Büyük Dil Modellerinin (LLM) klinik uygulanabilirliğini değerlendirmek, mevcut metodolojilerdeki önemli bir boşluğu doldurarak, uzun ve karmaşık Elektronik Sağlık Kayıtları (EHR) üzerindeki gerçek dünya akıl yürütmesini yansıtan kıyaslamalar gerektirir. Bu tez, görev formülasyonunun, bağlam uzunluğunun, model özelliklerinin ve tam bağlamlı istemcilik ile Geri-Getirme Destekli Üretim (RAG) arasındaki ödünleşmelerin etkisini sistematik olarak değerlendirerek, açık kaynaklı BDM'lerin uzun bağlamlı biyomedikal soru cevaplama performansı üzerine kapsamlı bir değerlendirme sunmaktadır. MIMIC-III ve MIMIC-IV'ten türetilen insan tarafından doğrulanmış dört SC veri seti kullanılarak, bu çalışma farklı boyut (7B, 32B) ve tiplerdeki Qwen model ailesini test etmiştir. Tam hasta kaydını bağlam olarak sunmanın etkinliği, yoğun, seyrek ve geç etkileşimli geri getirmeyi birleştiren hibrit bir RAG boru hattına karşı karşılaştırılmıştır. Üretken, çıkarımsal ve çoktan seçmeli görevlerdeki performansı ölçmek için, BDM-değerlendirici metriklerini de içeren çok yönlü bir değerlendirme çerçevesi kullanılmıştır. Sonuçlar, RAG stratejilerinin tam bağlamlı istemcilikten tutarlı bir şekilde daha iyi performans gösterdiğini ve hiyerarşik geri getirmenin çoklu not akıl yürütmesi için en uygun yöntem olduğunu göstermektedir. Daha büyük modeller daha iyi performans gösterse de, artan bağlam uzunluğuyla performans düşerek uzun bağlamları yönetme zorluğunu vurgulamıştır. Odaklanmış ve tasarlanmış bağlam genellikle tam kaydı sağlamayı geride bırakmış ve alana özgü akıl yürütme verileriyle yapılan ince ayar, özellikle daha küçük model boyutları için talimat takip becerileriyle potansiyel bir ödünleşmeye işaret ederek, iyileşmeyi garanti etmemiştir. Bu çalışma, sağlam bir değerlendirme çerçevesi ve ayrıntılı bir hata analizi sunarak, sağlık hizmetlerinde daha güvenli ve etkili LLM uygulamaları geliştirmek için pratik bilgiler sağlamaktadır.
Özet (Çeviri)
Evaluating the clinical viability of Large Language Models (LLMs) requires benchmarks that mirror real-world reasoning over long and complex Electronic Health Records (EHRs), a notable gap in current methodologies. This thesis investigates open LLMs comprehension on long-context biomedical question answering tasks, systematically assessing the impact of task formulation, context length, model characteristics, and the trade-offs between full-context prompting and RAG. Using four human-validated QA datasets derived from MIMIC-III and MIMIC-IV, this work evaluated Qwen family models of varying sizes (7B, 32B) and types. We compared multiple context settings against a hybrid RAG pipeline combining dense, sparse, and late-interaction retrieval. A varied evaluation framework, including LLM-as-a-judge metrics, was used to measure performance across generative, extractive, and multiple-choice tasks on the different context settings. Results show that RAG strategies outperform full-context prompting, with hierarchical retrieval method being the better approach for multi-note reasoning. Although larger models performed better overall, performance got worse with longer context lengths, indicating the challenge of handling longer contexts and showing the importance of proper context engineering. Domain-specific fine tuning with reasoning on reasoning trajectories did not show improved results on most tasks, indicating a potential trade-off with instruction-following skills and long context capabilities of smaller models. By providing a strong evaluation framework and detailed error analysis, this work offers insights for developing safer, more effective LLM applications in the healthcare system.
Benzer Tezler
- Ticari banka yönetimi ve Türk ticari bankalarının temel yönetim sorunları
The management of the commercial bank and the basic problems of the Turkish comercial bank
AYŞE ÇİĞDEM ÖNAL
- Toplam kalite yönetimi, kalite güvencesi sistemleri ve Türkiye'deki uygulamaları
Total quality management, quality assurance systems and their applications in Turkey
AHMET BEŞKESE
Yüksek Lisans
Türkçe
1995
Endüstri ve Endüstri Mühendisliğiİstanbul Teknik ÜniversitesiPROF.DR. ATAÇ SOYSAL
- Kalite güvence sistemindeki bazı öğelerin denetim sürecine ilişkin bilgi tabanlı bir uzman sistem yaklaşımı
Başlık çevirisi yok
DEMET BAYRAKTAR
- An Integrated approach of construction risk management and evaluation
Yapı risk yönetimi ve değerlendirilmesine bütünleşik bir yaklaşım
WAEL ABABNEH
Doktora
İngilizce
2000
Endüstri ve Endüstri Mühendisliğiİstanbul Teknik ÜniversitesiPROF.DR. GÖNÜL YENERSOY ERDOĞAN
- The significance and the contribution of 6+1 traits of writing to the success of the students in writing courses in English language teaching
Yazmanın 6+1 özelliğinin İngilizce öğretiminde yazılı anlatım derslerindeki öğrenci başarısına katkısı ve önemi
ÖZLEM YAZAR
Yüksek Lisans
İngilizce
2004
Eğitim ve ÖğretimGazi Üniversitesiİngiliz Dili Eğitimi Ana Bilim Dalı
YRD. DOÇ. DR. PAŞA TEVFİK CEPHE
- Türkiye Cumhuriyeti'nde müzik kurumlaşması ve kültürel kimlik değişimi
Musical institutionalization and cultural identity change in Turkish Republic
GÜRSEL YURTSEVEN
Doktora
Türkçe
2018
MüzikYıldız Teknik ÜniversitesiSanat ve Tasarım Ana Bilim Dalı
PROF. DR. TURAN SAĞER