Çok gruplu veri setlerinde eksik gözlem sorununun çözümlenmesi ve sağlık alanında bir uygulama
The solution of missing value promlem in multigrouped data sets and an application in health
- Tez No: 137921
- Danışmanlar: PROF. DR. KAZIM ÖZDAMAR
- Tez Türü: Doktora
- Konular: Tıbbi Biyoloji, Medical Biology
- Anahtar Kelimeler: Atama yöntemleri, Regresyon atama, Listwise, Pairwise, Ortalama atama. V, Imputation Methods, Regression, Listwise, Pairwise, Mean Imputation. VI
- Yıl: 2003
- Dil: Türkçe
- Üniversite: Eskişehir Osmangazi Üniversitesi
- Enstitü: Sağlık Bilimleri Enstitüsü
- Ana Bilim Dalı: Biyoistatistik Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
ÖZET Eksik veri problemi, yıllardır araştırmacıların bilimsel bilgiyi üretmelerinde önlerindeki en büyük engellerden biri olmuştur. Özellikle sağlık alanında toplanan verilerde eksik gözlem değerleri, analiz aşamasında ve sonuçların genellenmesi aşamasında karar verirken, araştırmacıya zor anlar yaşatmakta ve hatalı kararlar vermesine neden olabilmektedir. Eksik veriler, gerek saha araştırmalarında gerekse laboratuar koşullarında yapılan çalışmalarda araştırmacının karşısına çıkabilmektedir. Araştırmacılar öncelikle eksik veriyi ortaya çıkartan nedenleri ve eksik verinin araştırma içerisindeki önem derecesini belirlemelidirler. Bu araştırma bir benzetim çalışmasıdır ve farklı birim sayılarına sahip türetilmiş veri setleri yardımıyla, eksik veri atama yöntemleri karşılaştınlmıştır. Türetilen veri setleri, sırasıyla; 50, 100, 200, 300, 400 ve 500 birim içerecek şekilde, çok değişkenli standartlaştınlmış normal dağılım varsayımından yararlanılarak ve düşük ve yüksek korelasyonlu değişkenleri içerecek şekilde türetilmiştir. Rasgele koşullar altında %5, %10, %15 ve %20 eksiltilen veri setleri TROK (MCAR) yapıya sahiptir. Elde edilen veri setlerinin analizleri sonucunda Listwise, Pairwise, Ortalama, Regresyon ve EM atama yöntemleri düşük hacimli örneklerde tutarsız sonuçlar vermişlerdir (n<200). Fakat tam veri setine en yakın sonuçlar, EM atama yönteminden elde edilmiştir. Benzer şekilde, yüksek hacimli örneklerden elde edilen sonuçlarda da, EM atama yöntemi tam veri setlerine oldukça yakın sonuçlar vermiştir. EM atama yöntemi özelikle 200 birim ve üzerindeki veri setlerinde, %5-%20 arasındaki eksik veri yapılarında diğer atama yöntemlerine göre daha iyi sonuçlar vermiştir. Türetilmiş veri setlerinden elde edilen sonuçlara göre, bazı değişkenlerinde yaklaşık %20 gözlem değeri eksik olan sağlık alanındaki gerçek bir veri seti EM atama yöntemi ile tamamlanmış ve analizler eksik veri seti ile karşılaştırmalı olarak sunulmuştur.
Özet (Çeviri)
SUMMARY The problem of missing values has been a big difficulty to produce scientific information. Especially missing observations create difficulties for the analysis and for the generalization of the results in health sciences and could make one give wrong decisions. Missing values can come up in either survey research or in laboratory conditions. Researchers, first of all, should investigate the reasons for missing value and the importance of missing values in data set. In this thesis, simulation study is done, using simulated data sets having different sample sizes, and also some imputation methods are compared. Simulated data is taken from multivariate Normal distribution in which either high correlation matrix or low correlaton matrix is assumed, and the sample sizes are set to 50, 100, 200, 300, 400, and 500. 5%, 10%, 15%, and 20% of simulated samples are randomly set missing, and MCAR (TROK) property is observed on the reduced samples. It is seen that Listwise, Pairwise, Mean, Regression, and EM imputation methods have consistency problems for small sample sizes (n<200). However, the closest results to the results of full data set are produced by EM method. Similarly, for large sample sizes, EM produced the closest results to the full data set. Also, EM imputation produced better results for large samples (n>200) with missing value percentages between 5-20. Based on the information gained by the simulation study, a case data set on which some variables having 20% missing value is completed using EM imputation method, and the results are given in detail.
Benzer Tezler
- Referans örgülerin ENDF/ B-VI, JEF-2.2 ve TENDL-3 verileri ile analizi
Analysis of Benchmark Lattices with ENDF/B-VI, JEF-2.2 and JENDL-3 Data
MEHMET SAĞLAM
Yüksek Lisans
Türkçe
1995
Nükleer MühendislikHacettepe ÜniversitesiNükleer Enerji Mühendisliği Ana Bilim Dalı
DR. CEMAL NİYAZİ SÖKMEN
- Çok gruplu çarpışma olasılıklı integral transport yöntemi ile hızlı spektrum hesabı
Fast spectrum colculation with integral transport method
GÜLİSTAN ALTAY
- Çok gruplu ayırma analizinin bazı yeni kriterler yardımıyla gerçekleştirilmesi ve bir uygulama
Discriminant analysis between two or more groups with respect to the some new criteria and an application
HALİL BAYRAKÇI
- Triga tipi araştırma reaktörleri için bir termalizasyon yöntemi
A Thermalization method for triga-type research reactors
GÜLTEN SADULLAHOĞLU
Yüksek Lisans
Türkçe
2000
Nükleer Mühendislikİstanbul Teknik ÜniversitesiNükleer Mühendislik Ana Bilim Dalı
PROF. DR. ATİLLA ÖZGENER
- İlköğretim 8. sınıf türün devamlılığını sağlayan canlılık olayı (üreme) konusunun çalışma yaprakları ile öğretiminin öğrenci erişisine ve kalıcılığa etkisi
The effect of instruction the life event which enables continuity of species (reproduction) subject through worksheets on primary school eighth grade students` achievement and retention
ÖZBEN ÖZDEMİR
Yüksek Lisans
Türkçe
2006
Eğitim ve ÖğretimDokuz Eylül Üniversitesiİlköğretim Ana Bilim Dalı
PROF.DR. TEOMAN KESERCİOĞLU