Veri madenciliği sınıflama yöntemlerinin başarılarının; bağımlı değişken prevelansı, örneklem büyüklüğü ve bağımsız değişkenler arası ilişki yapısına göre karşılaştırılması
Comparison of the performances of data mining classification methods based on prevalence of the dependent variable, sample size and the correlation of the independent variables
- Tez No: 375002
- Danışmanlar: PROF. DR. OSMAN SARAÇBAŞI
- Tez Türü: Doktora
- Konular: İstatistik, Biyoistatistik, Bilim ve Teknoloji, Statistics, Biostatistics, Science and Technology
- Anahtar Kelimeler: Benzetim, Biyoistatistik, Destek vektör makineleri, Karar ağacı, Sınıflama yöntemleri, Veri madenciliği, Simulation, Bioistatistics, Support vector machines, Decision tree, Classification methods, Data mining
- Yıl: 2014
- Dil: Türkçe
- Üniversite: Hacettepe Üniversitesi
- Enstitü: Sağlık Bilimleri Enstitüsü
- Ana Bilim Dalı: Biyoistatistik Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Karar Ağaçları, Bayesci Ağlar ve Destek Vektör Makinaları literatürde ve uygulamalarda en çok kullanılan istatistiksel ve veri madenciliği kökenli sınıflama yöntemleri arasında yer almaktadır. Bu yöntemler kullanılırken bağımsız değişkenlerin ölçüm seviyesi (sürekli, kesikli vb.), bağımsız değişkenlerin dağılımı (simetrik, çarpık, vb.), bağımlı değişkenin dağılımı (simetrik, çarpık, vb.) bağımsız değişkenler arasındaki ilişki miktarı (düşük, orta veya yüksek ilişki), örneklem hacmi gibi başlıca önemli unsurların model başarısına ve yöntemler üzerine olan etkileri göz ardı edilmektedir. Bu nedenle çalışmada, bağımlı ve bağımsız değişkenlerin farklı yapılarının; Karar Ağaçları, Bayesci Ağlar ve Destek Vektör Makinaları yöntemlerinin başarıları üzerine olan etkileri benzetim çalışması yardımıyla karşılaştırılmıştır. Benzetim çalışmasında, bağımsız değişkenler arasındaki ilişki miktarı için üç farklı seçenek, bağımsız değişken sayısı için üç farklı seçenek, örneklem hacmi için üç farklı seçenek, bağımsız değişkenler ile bağımlı değişken arasındaki ilişki miktarı için üç farklı seçenek, bağımlı değişken prevelansı için de üç farklı seçenek dikkate alınarak toplamda 243 farklı kombinasyon kullanılmıştır. Her bir senaryo 1000 kez tekrar edilmiş, her bir tekrarda sözü edilen sınıflama yöntemleri uygulanmış ve her bir modelin model başarı kriterleri elde edilerek karşılaştırılmıştır. Elde edilen sonuçlar ışığında, araştırmacılara bağımlı ve bağımsız değişkenlerin farklı yapıda olduğu durumlarda hangi sınıflama yöntemini kullanmaları veya hangi yöntemden kaçınmaları konusunda bilgi verilmiştir.
Özet (Çeviri)
Decision Trees, Bayesian Networks, and Support Vector Machines are the most commonly used statistical and data mining based methods of classification in the literature and practice. While using these methods, the impact of important factors on the model success, such as, the measuring level of the independent variables (i.e., continuous, discrete, etc.), the distribution of the independent variables (i.e., symmetric, skewed, etc.), the amount of correlation between independent variables (i.e., low, medium or strong relationship), and the sample size are often ignored. Therefore, in this study, the impact of different structures of dependent and independent variables on the model performances of Decision Trees, Bayesian Networks, Support Vector Machines methods are compared by a simulation study. A total of 243 different simulation scenarios were obtained by taking into account three levels for the degree of correlation between independent variables, three levels for the number of independent variables in a model, three levels for the sample size, three levels for the amount of the correlation between dependent and independent variables, and three levels for the prevalence of the dependent variable. Each scenario was repeated 1000 times, for each repetition mentioned classification methods are applied and they were compared by their model success criteria. At the end of the thesis, some general suggestions are given to the researchers on which classification method should be used or avoided under different structures of dependent and independent variables.
Benzer Tezler
- Hanehalkı işgücü araştırma verileri ile veri madenciliği yöntemlerinin uygulanması ve modellerin karşılaştırılması
Implementation of data mining methods on household labor research data and comparison of models
MERVE BARAN KILIÇALAN
Yüksek Lisans
Türkçe
2018
İstatistikHacettepe Üniversitesiİstatistik Ana Bilim Dalı
DOÇ. DR. ÇAĞDAŞ HAKAN ALADAĞ
- Tıbbi araştırmalarda destek vektör makinelerinin kullanımı
Using of support vector machines in medical research
ÖZGE AKŞEHİRLİ
Yüksek Lisans
Türkçe
2012
BiyoistatistikDüzce ÜniversitesiBiyoistatistik ve Tıbbi Bilişim Ana Bilim Dalı
PROF. DR. HANDAN ANKARALI
- E-öğrenme ortamlarında bir öğrenme analitiği aracı olarak öğrenme panelleri ile etkileşimin öğrenme çıktılarıyla ilişkisi
The relation of interaction with learning dashboards as a learning analytics tool in e-learning environment between learning outcomes
MEHMET KOKOÇ
Doktora
Türkçe
2016
Eğitim ve ÖğretimHacettepe ÜniversitesiBilgisayar ve Öğretim Teknolojileri Eğitimi Ana Bilim Dalı
PROF. DR. ARİF ALTUN
- Tıbbi karar destek sisteminin veri madenciliği yöntemleriyle gerçekleştirilmesi
Verifying medical decision support system with the methods of data mining
TUBA PALA
Yüksek Lisans
Türkçe
2013
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolMarmara ÜniversitesiElektronik-Bilgisayar Eğitimi Ana Bilim Dalı
PROF. DR. A. YILMAZ ÇAMURCU
- Tüketici kredisi taleplerinin yapay öğrenme modelleriyle değerlendirilmesi
Evaluation of consumer credit requests via machine learning models
NECATİ ALPEREN
Yüksek Lisans
Türkçe
2019
Endüstri ve Endüstri Mühendisliğiİstanbul Teknik Üniversitesiİşletme Mühendisliği Ana Bilim Dalı
DOÇ. DR. TOLGA KAYA