Geri Dön

Evaluati̇ng the performance of large language models on long-context bi̇omedi̇cal questi̇on answeri̇ng

Büyük dil modellerinin uzun bağlamlı biyomedikal soru cevaplama üzerindeki performansının değerlendirilmesi

  1. Tez No: 1019801
  2. Yazar: FERAS AL MANNAA
  3. Danışmanlar: PROF. FERDİ SÖNMEZ
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2025
  8. Dil: İngilizce
  9. Üniversite: İstanbul Aydın Üniversitesi
  10. Enstitü: Lisansüstü Eğitim Enstitüsü
  11. Ana Bilim Dalı: Yapay Zeka ve Veri Bilimi Ana Bilim Dalı
  12. Bilim Dalı: Yapay Zeka ve Veri Bilimi Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Büyük Dil Modellerinin (LLM) klinik uygulanabilirliğini değerlendirmek, mevcut metodolojilerdeki önemli bir boşluğu doldurarak, uzun ve karmaşık Elektronik Sağlık Kayıtları (EHR) üzerindeki gerçek dünya akıl yürütmesini yansıtan kıyaslamalar gerektirir. Bu tez, görev formülasyonunun, bağlam uzunluğunun, model özelliklerinin ve tam bağlamlı istemcilik ile Geri-Getirme Destekli Üretim (RAG) arasındaki ödünleşmelerin etkisini sistematik olarak değerlendirerek, açık kaynaklı BDM'lerin uzun bağlamlı biyomedikal soru cevaplama performansı üzerine kapsamlı bir değerlendirme sunmaktadır. MIMIC-III ve MIMIC-IV'ten türetilen insan tarafından doğrulanmış dört SC veri seti kullanılarak, bu çalışma farklı boyut (7B, 32B) ve tiplerdeki Qwen model ailesini test etmiştir. Tam hasta kaydını bağlam olarak sunmanın etkinliği, yoğun, seyrek ve geç etkileşimli geri getirmeyi birleştiren hibrit bir RAG boru hattına karşı karşılaştırılmıştır. Üretken, çıkarımsal ve çoktan seçmeli görevlerdeki performansı ölçmek için, BDM-değerlendirici metriklerini de içeren çok yönlü bir değerlendirme çerçevesi kullanılmıştır. Sonuçlar, RAG stratejilerinin tam bağlamlı istemcilikten tutarlı bir şekilde daha iyi performans gösterdiğini ve hiyerarşik geri getirmenin çoklu not akıl yürütmesi için en uygun yöntem olduğunu göstermektedir. Daha büyük modeller daha iyi performans gösterse de, artan bağlam uzunluğuyla performans düşerek uzun bağlamları yönetme zorluğunu vurgulamıştır. Odaklanmış ve tasarlanmış bağlam genellikle tam kaydı sağlamayı geride bırakmış ve alana özgü akıl yürütme verileriyle yapılan ince ayar, özellikle daha küçük model boyutları için talimat takip becerileriyle potansiyel bir ödünleşmeye işaret ederek, iyileşmeyi garanti etmemiştir. Bu çalışma, sağlam bir değerlendirme çerçevesi ve ayrıntılı bir hata analizi sunarak, sağlık hizmetlerinde daha güvenli ve etkili LLM uygulamaları geliştirmek için pratik bilgiler sağlamaktadır.

Özet (Çeviri)

Evaluating the clinical viability of Large Language Models (LLMs) requires benchmarks that mirror real-world reasoning over long and complex Electronic Health Records (EHRs), a notable gap in current methodologies. This thesis investigates open LLMs comprehension on long-context biomedical question answering tasks, systematically assessing the impact of task formulation, context length, model characteristics, and the trade-offs between full-context prompting and RAG. Using four human-validated QA datasets derived from MIMIC-III and MIMIC-IV, this work evaluated Qwen family models of varying sizes (7B, 32B) and types. We compared multiple context settings against a hybrid RAG pipeline combining dense, sparse, and late-interaction retrieval. A varied evaluation framework, including LLM-as-a-judge metrics, was used to measure performance across generative, extractive, and multiple-choice tasks on the different context settings. Results show that RAG strategies outperform full-context prompting, with hierarchical retrieval method being the better approach for multi-note reasoning. Although larger models performed better overall, performance got worse with longer context lengths, indicating the challenge of handling longer contexts and showing the importance of proper context engineering. Domain-specific fine tuning with reasoning on reasoning trajectories did not show improved results on most tasks, indicating a potential trade-off with instruction-following skills and long context capabilities of smaller models. By providing a strong evaluation framework and detailed error analysis, this work offers insights for developing safer, more effective LLM applications in the healthcare system.

Benzer Tezler

  1. Ticari banka yönetimi ve Türk ticari bankalarının temel yönetim sorunları

    The management of the commercial bank and the basic problems of the Turkish comercial bank

    AYŞE ÇİĞDEM ÖNAL

    Yüksek Lisans

    Türkçe

    Türkçe

    1994

    BankacılıkMarmara Üniversitesi

    Bankacılık Ana Bilim Dalı

    PROF. DR. NAZIM EKREN

  2. Toplam kalite yönetimi, kalite güvencesi sistemleri ve Türkiye'deki uygulamaları

    Total quality management, quality assurance systems and their applications in Turkey

    AHMET BEŞKESE

    Yüksek Lisans

    Türkçe

    Türkçe

    1995

    Endüstri ve Endüstri Mühendisliğiİstanbul Teknik Üniversitesi

    PROF.DR. ATAÇ SOYSAL

  3. An Integrated approach of construction risk management and evaluation

    Yapı risk yönetimi ve değerlendirilmesine bütünleşik bir yaklaşım

    WAEL ABABNEH

    Doktora

    İngilizce

    İngilizce

    2000

    Endüstri ve Endüstri Mühendisliğiİstanbul Teknik Üniversitesi

    PROF.DR. GÖNÜL YENERSOY ERDOĞAN

  4. The significance and the contribution of 6+1 traits of writing to the success of the students in writing courses in English language teaching

    Yazmanın 6+1 özelliğinin İngilizce öğretiminde yazılı anlatım derslerindeki öğrenci başarısına katkısı ve önemi

    ÖZLEM YAZAR

    Yüksek Lisans

    İngilizce

    İngilizce

    2004

    Eğitim ve ÖğretimGazi Üniversitesi

    İngiliz Dili Eğitimi Ana Bilim Dalı

    YRD. DOÇ. DR. PAŞA TEVFİK CEPHE

  5. Türkiye Cumhuriyeti'nde müzik kurumlaşması ve kültürel kimlik değişimi

    Musical institutionalization and cultural identity change in Turkish Republic

    GÜRSEL YURTSEVEN

    Doktora

    Türkçe

    Türkçe

    2018

    MüzikYıldız Teknik Üniversitesi

    Sanat ve Tasarım Ana Bilim Dalı

    PROF. DR. TURAN SAĞER