Geri Dön

Veri madenciliğinde eksik verilerin doldurulmasında makine öğrenmesi yöntemlerinin karşılaştırmalı analizi ve özgün bir model önerisi

Comparative evaluation of machine learning imputation methods in data mining with the proposal of a novel model

  1. Tez No: 995383
  2. Yazar: ÜMİT TERZİOĞLU
  3. Danışmanlar: DOÇ. DR. CAFER BUDAK
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Elektrik ve Elektronik Mühendisliği, Computer Engineering and Computer Science and Control, Electrical and Electronics Engineering
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: Türkçe
  9. Üniversite: Dicle Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Elektrik-Elektronik Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Eksik veri problemi, özellikle çok boyutlu ve heterojen veri setlerinde sıkça karşılaşılan ve analiz sonuçlarını doğrudan etkileyen önemli bir sorundur. Eksik değerler, bilgi kaybına yol açmakta ve kullanılan tahmin modellerinin doğruluğunu düşürebilmektedir. Bu nedenle, eksik verilerin uygun yöntemlerle doldurulması, veri madenciliği ve makine öğrenmesi uygulamalarında kritik bir aşama olarak değerlendirilmektedir. Bu tez çalışmasında, eksik verilerin doldurulması problemine yönelik olarak Soft Cluster-Weighted Transformer Imputer (SCWTI) adı verilen yeni bir yöntem önerilmiştir. Önerilen SCWTI yöntemi, yumuşak kümeleme yaklaşımı ile Transformer tabanlı derin öğrenme mimarisini bir araya getiren hibrit bir yapı sunmaktadır. Yumuşak kümeleme aşamasında, her bir veri örneğinin kümelere olasılıksal olarak ait olması sağlanarak veri içerisindeki belirsizliklerin modele yansıtılması amaçlanmıştır. Bu çalışmada yumuşak kümeleme yöntemi olarak Fuzzy C-Means (FCM) algoritması kullanılmıştır. Transformer encoder yapısı ise attention mekanizması sayesinde değişkenler arasındaki karmaşık ve doğrusal olmayan ilişkileri öğrenebilmekte ve bağlamsal temsiller üretebilmektedir. Kümeleme sonucunda elde edilen üyelik olasılıkları, Transformer'ın dikkat mekanizmasına entegre edilerek modelin hem küme bazlı yerel örüntüleri hem de veri setinin genel yapısını birlikte dikkate alması sağlanmıştır. SCWTI yöntemi, farklı yapısal özelliklere sahip beş farklı veri seti üzerinde test edilmiştir. Deneysel çalışmalarda eksik veriler, tamamen rastgele (MCAR), koşullu rastgele (MAR) ve rastgele olmayan (MNAR) eksiklik mekanizmaları altında ve %5 ile %50 arasında değişen oranlarda oluşturulmuştur. Model performansı, Ortalama Kare Hatası (MSE), Kök Ortalama Kare Hatası (RMSE), Ortalama Mutlak Hata (MAE) ve Belirleme Katsayısı (R²) metrikleri kullanılarak değerlendirilmiş ve elde edilen sonuçlar literatürde yaygın olarak kullanılan istatistiksel ve makine öğrenmesi tabanlı yöntemlerle karşılaştırılmıştır. Elde edilen sonuçlar, SCWTI yönteminin özellikle yüksek eksiklik oranlarında ve MNAR mekanizmasında kararlı ve başarılı bir performans sergilediğini göstermektedir. Yöntem, birçok karşılaştırmalı çalışmada daha düşük hata değerleri ve daha yüksek R² sonuçları üretmiştir. Bu bulgular, SCWTI'nin eksik veri doldurma problemlerinde güvenilir ve genellenebilir bir yöntem olduğunu ortaya koymakta ve yöntemin farklı uygulama alanlarında kullanılabileceğini göstermektedir.

Özet (Çeviri)

Missing data is a critical issue that frequently occurs in high-dimensional and heterogeneous datasets and directly affects the reliability of data analysis results. Missing values lead to information loss and reduce the predictive accuracy of learning models. Therefore, properly handling missing data is considered a crucial step in data mining and machine learning applications. In this thesis, a novel method called Soft Cluster-Weighted Transformer Imputer (SCWTI) is proposed to address the missing data imputation problem. The proposed SCWTI method presents a hybrid framework that combines a soft clustering approach with a Transformer-based deep learning architecture. In the soft clustering stage, each data instance is probabilistically assigned to multiple clusters, allowing uncertainty in the data to be explicitly incorporated into the model. In this study, the Fuzzy C-Means (FCM) algorithm is employed as the soft clustering technique. The Transformer encoder architecture, through its attention mechanism, is capable of learning complex and nonlinear relationships among variables and generating contextual representations. The cluster membership probabilities obtained from the clustering stage are integrated into the attention mechanism of the Transformer, enabling the model to jointly consider both cluster-based local patterns and global data dependencies. The SCWTI method is evaluated on five different datasets with diverse structural characteristics. In the experimental studies, missing values are generated under completely missing at random (MCAR), missing at random (MAR), and missing not at random (MNAR) mechanisms, with missing rates ranging from 5% to 50%. Model performance is assessed using four widely adopted regression metrics: Mean Squared Error (MSE), Root Mean Squared Error (RMSE), Mean Absolute Error (MAE), and the coefficient of determination (R²). The obtained results are compared with commonly used statistical and machine learning-based imputation methods reported in the literature. Experimental results demonstrate that the SCWTI method exhibits stable and robust performance, particularly at high missing rates and under the MNAR mechanism. The proposed approach consistently achieves lower error values and higher R² scores compared to competing methods. These findings indicate that SCWTI is a reliable and generalizable solution for missing data imputation and can be effectively applied to various real-world problem domains.

Benzer Tezler

  1. Veri madenciliği uygulamalarında ağaç tohum algoritmasının kullanımı

    Using tree seed algorithm on data mining applications

    ABDÜLKADİR PEKTAŞ

    Yüksek Lisans

    Türkçe

    Türkçe

    2022

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolNecmettin Erbakan Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ ONUR İNAN

  2. Eksik değerleri en olası değer ile doldurmanın sınıflandırma algoritmaları üzerinden karşılaştırılması

    Comparison of filling missing values with the best fit over classification algorithms

    ÇAĞDAŞ KEKLİK

    Yüksek Lisans

    Türkçe

    Türkçe

    2017

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolBeykent Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    YRD. DOÇ. DR. CENGİZ ÖRENCİK

  3. Fonksiyonel veri analizinin karar ağaçlarında kullanımı

    Utilization of functional data analysis in decision trees

    BURCU KOCARIK GACAR

    Doktora

    Türkçe

    Türkçe

    2023

    İstatistikDokuz Eylül Üniversitesi

    Ekonometri Ana Bilim Dalı

    DOÇ. DR. İSTEM KESER

  4. Kategorik ve kategorik olmayan verilerden oluşan veri setleri için K-ortalama tabanlı bir yaklaşım

    K-means based approach for categorical and non categorical data sets

    MUSTAFA DEMİRKAN

    Yüksek Lisans

    Türkçe

    Türkçe

    2014

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolBeykent Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. GÖKHAN SİLAHTAROĞLU

  5. Matematik alanında üstün yetenekli ve zekalı öğrencilerin bazı değişkenler açısından veri madenciliği ile belirlenmesi

    Determination of the mathematically gifted and talented students using data mining in terms of some variables

    ESRA AKSOY

    Yüksek Lisans

    Türkçe

    Türkçe

    2014

    Eğitim ve ÖğretimDokuz Eylül Üniversitesi

    İlköğretim Ana Bilim Dalı

    DOÇ. DR. SERKAN NARLI