Geri Dön

Opti̇mi̇zi̇ng di̇abetes predi̇cti̇on usi̇ng ensemble learni̇ng: A stacked model of tree-based and ANN-PSO approaches

Topluluk öğrenmesi kullanılarak diyabet tahmininin optimizasyonu: Ağaç tabanlı ve yapay sinir ağı (ANN) yaklaşımlarına dayalı yığılmış bir model

  1. Tez No: 1014685
  2. Yazar: AHMED E. M. ABU SHAMLEH
  3. Danışmanlar: Prof. Dr. FERDİ SÖNMEZ
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: İngilizce
  9. Üniversite: İstanbul Aydın Üniversitesi
  10. Enstitü: Lisansüstü Eğitim Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Yapay Zeka ve Veri Bilimi Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Diabetes mellitus, zamanında ve doğru bir şekilde teşhis edilmediği takdirde ciddi komplikasyonlara yol açabilen, küresel ölçekte önemli bir halk sağlığı problemidir. Mevcut literatürde, makine öğrenmesi tekniklerinin diyabetin erken tanı ve tespitinde doğruluğu önemli ölçüde artırabildiğine dair güçlü kanıtlar bulunmaktadır. Bu çalışmada, diyabet tahmin doğruluğunu artırmak amacıyla XGBoost, CatBoost ve Extra Trees sınıflandırıcıları ile Yapay Sinir Ağı (ANN) modellerinden oluşan yığılmış (stacked) bir topluluk öğrenme yaklaşımı önerilmektedir. Veri hazırlama sürecinde özellik ölçekleme, kategorik değişkenlerin kodlanması ve sınıf dengesizliğinin giderilmesi amacıyla tabakalı k-katlı çapraz doğrulama (stratified k-fold cross-validation) ve sınıf ağırlıklandırma (class weight) yöntemleri uygulanmıştır. Ağaç tabanlı modellerin hiperparametre optimizasyonu GridSearchCV kullanılarak gerçekleştirilmiş; ANN mimarisi ise nöron sayısı, dropout oranı ve öğrenme hızı gibi farklı yapılandırmalar denenerek manuel olarak ayarlanmıştır. Önerilen çerçeve, herkese açık bir diyabet veri kümesi üzerinde tabakalı 5-katlı çapraz doğrulama yöntemiyle doğrulanmıştır. Deneysel sonuçlar, yığılmış topluluk modelinin %98,4 doğruluk (accuracy) ve %98 F1 skoru elde ettiğini ve bu değerlerin tekil sınıflandırıcıların tamamından daha yüksek olduğunu göstermektedir. Bu bulgular, SHAP tabanlı açıklanabilirlik analizi ile desteklenmiş olup, HbA1C düzeyi, kan glukozu, vücut kitle indeksi (BMI) ve yaş değişkenlerinin tip 2 diyabet için klinik açıdan anlamlı risk faktörleri olduğunu ortaya koymuştur. Ablasyon çalışması, üç temel modelin her birinin genel performansa anlamlı katkı sağladığını doğrulamış; ayrıca yapılan kalibrasyon analizi, modelin güvenilir olasılık tahminleri üretebildiğini göstermiştir. Son olarak, gerçek zamanlı çıkarım (inference) ve Grad-CAM görselleştirmelerini birleştiren bir web uygulaması geliştirilmiş ve bu uygulama, makine öğrenmesi tabanlı yaklaşımların klinik ortamda bir karar destek sistemi olarak kullanılmasına yönelik bir ön kanıt (proof of concept) sunmuştur. Özetle, bu çalışmada önerilen yöntemler, tip 2 diyabetin erken evrede tespitine yönelik yüksek performanslı, sağlam ve yorumlanabilir bir yaklaşım sunmakta olup, klinik karar destek sistemlerinin bir parçası olarak önemli bir katma değer sağlayabilir.

Özet (Çeviri)

Diabetes mellitus is a serious global health problem, which can lead to serious complications if not diagnosed quickly and accurately. There is evidence that machine learning techniques can significantly improve the accuracy of early diagnosis and detection of diabetes. In the proposed study, a stacked ensemble of XGBoost, CatBoost, and ExtraTrees classifiers along with an ANN will be used as a method to increase the accuracy of predicting diabetes. Data preparation consisted of feature scaling, encoding categorical variables, and addressing class imbalance by utilizing stratified k-fold cross-validation and class weight. Hyperparameter tuning was performed using GridSearchCV for the tree based models and tuning manually the ANN architecture using multiple configurations of the number of neurons, dropout, and learning rate. The proposed framework was validated with the publicly available diabetes dataset using stratified 5-fold cross-validation. In terms of accuracy, the stacked ensemble was able to achieve 98.4%, while F1 score was 98%—both of which surpassed any individual classifier's results. These findings were corroborated through SHAP-based explanatory analysis using predictors identified to be HbA1C levels, blood glucose, body mass index and age as clinically significant risk factors for type 2 diabetes. The ablation study verified that each of the three base models contributed to overall accuracy, as well as through calibration analysis demonstrating fair probability estimates from the model. Finally, a web application combining real-time inference. In summary, the methods proposed in this paper represent a robust, interpretable and high performing method for detecting type 2 diabetes at an early stage that may provide value as part of a clinical decision support system.

Benzer Tezler

  1. Ankara-Polatlı-Kabak köyü sulama pompaj tesisinin optimizasyonu

    Optimizing of Ankara-Polatlı-Kabak villages watering pumping plant

    İLKNUR GÖKNUR

    Yüksek Lisans

    Türkçe

    Türkçe

    1987

    ZiraatAnkara Üniversitesi

    Tarımsal Mekanizasyon Ana Bilim Dalı

    DOÇ. DR. RAHMİ KESKİN

  2. Vücut sıvılarında atomik absorpsiyon spektrometresi ile iz element analizleri ve bazı uygulamaları

    Başlık çevirisi yok

    MÜŞERREF ATLI

    Yüksek Lisans

    Türkçe

    Türkçe

    1988

    KimyaÇukurova Üniversitesi

    Kimya Ana Bilim Dalı

    PROF. DR. ŞEREF KUNÇ

  3. Sürekli gelir hipotezi ile tüketici harcamaları modeli

    Başlık çevirisi yok

    F.GÜL ÇAKMAK

    Yüksek Lisans

    Türkçe

    Türkçe

    1988

    İstatistikHacettepe Üniversitesi

    İstatistik Ana Bilim Dalı

    YRD. DOÇ. DR. AHMET YALNIZ