Geri Dön

Veri madenciliği sınıflama yöntemlerinin başarılarının; bağımlı değişken prevelansı, örneklem büyüklüğü ve bağımsız değişkenler arası ilişki yapısına göre karşılaştırılması

Comparison of the performances of data mining classification methods based on prevalence of the dependent variable, sample size and the correlation of the independent variables

  1. Tez No: 375002
  2. Yazar: MUHSİN ÖZGÜR DOLGUN
  3. Danışmanlar: PROF. DR. OSMAN SARAÇBAŞI
  4. Tez Türü: Doktora
  5. Konular: İstatistik, Biyoistatistik, Bilim ve Teknoloji, Statistics, Biostatistics, Science and Technology
  6. Anahtar Kelimeler: Benzetim, Biyoistatistik, Destek vektör makineleri, Karar ağacı, Sınıflama yöntemleri, Veri madenciliği, Simulation, Bioistatistics, Support vector machines, Decision tree, Classification methods, Data mining
  7. Yıl: 2014
  8. Dil: Türkçe
  9. Üniversite: Hacettepe Üniversitesi
  10. Enstitü: Sağlık Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Biyoistatistik Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Karar Ağaçları, Bayesci Ağlar ve Destek Vektör Makinaları literatürde ve uygulamalarda en çok kullanılan istatistiksel ve veri madenciliği kökenli sınıflama yöntemleri arasında yer almaktadır. Bu yöntemler kullanılırken bağımsız değişkenlerin ölçüm seviyesi (sürekli, kesikli vb.), bağımsız değişkenlerin dağılımı (simetrik, çarpık, vb.), bağımlı değişkenin dağılımı (simetrik, çarpık, vb.) bağımsız değişkenler arasındaki ilişki miktarı (düşük, orta veya yüksek ilişki), örneklem hacmi gibi başlıca önemli unsurların model başarısına ve yöntemler üzerine olan etkileri göz ardı edilmektedir. Bu nedenle çalışmada, bağımlı ve bağımsız değişkenlerin farklı yapılarının; Karar Ağaçları, Bayesci Ağlar ve Destek Vektör Makinaları yöntemlerinin başarıları üzerine olan etkileri benzetim çalışması yardımıyla karşılaştırılmıştır. Benzetim çalışmasında, bağımsız değişkenler arasındaki ilişki miktarı için üç farklı seçenek, bağımsız değişken sayısı için üç farklı seçenek, örneklem hacmi için üç farklı seçenek, bağımsız değişkenler ile bağımlı değişken arasındaki ilişki miktarı için üç farklı seçenek, bağımlı değişken prevelansı için de üç farklı seçenek dikkate alınarak toplamda 243 farklı kombinasyon kullanılmıştır. Her bir senaryo 1000 kez tekrar edilmiş, her bir tekrarda sözü edilen sınıflama yöntemleri uygulanmış ve her bir modelin model başarı kriterleri elde edilerek karşılaştırılmıştır. Elde edilen sonuçlar ışığında, araştırmacılara bağımlı ve bağımsız değişkenlerin farklı yapıda olduğu durumlarda hangi sınıflama yöntemini kullanmaları veya hangi yöntemden kaçınmaları konusunda bilgi verilmiştir.

Özet (Çeviri)

Decision Trees, Bayesian Networks, and Support Vector Machines are the most commonly used statistical and data mining based methods of classification in the literature and practice. While using these methods, the impact of important factors on the model success, such as, the measuring level of the independent variables (i.e., continuous, discrete, etc.), the distribution of the independent variables (i.e., symmetric, skewed, etc.), the amount of correlation between independent variables (i.e., low, medium or strong relationship), and the sample size are often ignored. Therefore, in this study, the impact of different structures of dependent and independent variables on the model performances of Decision Trees, Bayesian Networks, Support Vector Machines methods are compared by a simulation study. A total of 243 different simulation scenarios were obtained by taking into account three levels for the degree of correlation between independent variables, three levels for the number of independent variables in a model, three levels for the sample size, three levels for the amount of the correlation between dependent and independent variables, and three levels for the prevalence of the dependent variable. Each scenario was repeated 1000 times, for each repetition mentioned classification methods are applied and they were compared by their model success criteria. At the end of the thesis, some general suggestions are given to the researchers on which classification method should be used or avoided under different structures of dependent and independent variables.

Benzer Tezler

  1. Hanehalkı işgücü araştırma verileri ile veri madenciliği yöntemlerinin uygulanması ve modellerin karşılaştırılması

    Implementation of data mining methods on household labor research data and comparison of models

    MERVE BARAN KILIÇALAN

    Yüksek Lisans

    Türkçe

    Türkçe

    2018

    İstatistikHacettepe Üniversitesi

    İstatistik Ana Bilim Dalı

    DOÇ. DR. ÇAĞDAŞ HAKAN ALADAĞ

  2. Tıbbi araştırmalarda destek vektör makinelerinin kullanımı

    Using of support vector machines in medical research

    ÖZGE AKŞEHİRLİ

    Yüksek Lisans

    Türkçe

    Türkçe

    2012

    BiyoistatistikDüzce Üniversitesi

    Biyoistatistik ve Tıbbi Bilişim Ana Bilim Dalı

    PROF. DR. HANDAN ANKARALI

  3. E-öğrenme ortamlarında bir öğrenme analitiği aracı olarak öğrenme panelleri ile etkileşimin öğrenme çıktılarıyla ilişkisi

    The relation of interaction with learning dashboards as a learning analytics tool in e-learning environment between learning outcomes

    MEHMET KOKOÇ

    Doktora

    Türkçe

    Türkçe

    2016

    Eğitim ve ÖğretimHacettepe Üniversitesi

    Bilgisayar ve Öğretim Teknolojileri Eğitimi Ana Bilim Dalı

    PROF. DR. ARİF ALTUN

  4. Tıbbi karar destek sisteminin veri madenciliği yöntemleriyle gerçekleştirilmesi

    Verifying medical decision support system with the methods of data mining

    TUBA PALA

    Yüksek Lisans

    Türkçe

    Türkçe

    2013

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolMarmara Üniversitesi

    Elektronik-Bilgisayar Eğitimi Ana Bilim Dalı

    PROF. DR. A. YILMAZ ÇAMURCU

  5. Tüketici kredisi taleplerinin yapay öğrenme modelleriyle değerlendirilmesi

    Evaluation of consumer credit requests via machine learning models

    NECATİ ALPEREN

    Yüksek Lisans

    Türkçe

    Türkçe

    2019

    Endüstri ve Endüstri Mühendisliğiİstanbul Teknik Üniversitesi

    İşletme Mühendisliği Ana Bilim Dalı

    DOÇ. DR. TOLGA KAYA