Geri Dön

Computationally efficient multiple imputation routines in clustered data

Kümelenmiş verilerde hesaplama yönünden verimli çoklu atama yöntemleri

  1. Tez No: 989625
  2. Yazar: TUĞBA AKKAYA HOCAGİL
  3. Danışmanlar: PROF. DR. RECAİ MURAT YÜCEL
  4. Tez Türü: Doktora
  5. Konular: Biyoistatistik, Biostatistics
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2017
  8. Dil: İngilizce
  9. Üniversite: Unıversıty At Albany, State Unıversıty Of New York
  10. Enstitü: Yurtdışı Enstitü
  11. Ana Bilim Dalı: Biyoistatistik Ana Bilim Dalı
  12. Bilim Dalı: Biyoistatistik Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bagintih veri yapilarinda eksik veri varhigi siradan bir problem degildir. Çoklu atama yöntemiyle yapilan gikarmlar, analistler için uygulanabilir bir çözim sunmasina karsin eksik veri problemi, olgüm lgeklerindeki gesitlilik, atlama desenleri, sinrlar ve kisitlamalar nedeniyle genelikle daha karmasik hale gelir. Degisken bazli atama olarak da bilinen sirali regresyon atamasi özellikle karmagik veri yapilarnda yaygin bir modelleme yaklasimi olarak ortaya gikmistir. Bu tezde hiyerarsik olarak is içe geçmis ve gegmemis çok seviyeli veri yapilarinda eksik verilerin yönetimi igin sirali regresyon atamasi yaklagimiyla galigan üs yöntem gelistirdik. Ilk yöntem eksik Gaus degigkenleriyle ilgilidir. Bu yöntem, sirah regresyon atama baglaminda hesaplama açisindan verimli algoritmalari kullanir. Meveut yöntemler eksik verinin kosullu posterior tahmin dagihmindan örnekleme yapmak için taninmis bir Markov Zinciri Monte Carlo (MCMC) yöntemi olan geleneksel Gibbs örnekleyicisini kullanir. Ancak bu algoritmalar yalnizca ham eksik veriyi degil, ayni zamanda rastgele etkiler içeren eksik veriyi de ele aldiklari igin yavas karisma egilimindedir. Önerdigimiz yöntem, rastgele etkilerin simüle edilmis degerlerine kosulsuzluk uygulayarak geleneksel Gibbs örnekleyicisinin yavas yakinsamasini agar. Bu yöntemin performansi, diger iki çoklu atama rutini (Zincirlenmis denklemlerle çok degiskenli veri yükleme -MICE- ve Çok Degiskenli Panel veya Kümelenmig Veriler igin Çoklu Tahmin - pan- paketleri) ile simülasyon çahsmalari yoluyla kargilastirilmistir. Sonuçlar, önerilen yöntemin hesaplama süresi ve islem özellikleri (dogruluk gibi) açisindan diger alternatiflere üstünlük sagladigini göstermektedir. Ayrica, yöntem New York Eyaleti dogum sertifikasi verisi kullamlarak da uygulanmistir. ikinci yöntemimiz en düsük gözlem birimlerinin birden çok benzersiz olmayan üst düzey gözlem birimleri iginde yer aldigi (birden fazla sinifa ait ögrenciler gibi) yapilarda sirah regresyon atama algoritmasi önermektedir. Bu algoritmilar eksik verilerin dağılımından örnekleme yapmak için MCMC simülasyon yöntemlerine dayanmaktadır. Bu dagilmlar, birden fazla kümenin örtük etkilerinin birlegimini yansitacak sekilde uyarlanmis karma etkili modellerden türetilmistir. Önerilen atama algoritmasinin performansini benzersiz olmayan küme üyeligi oraninin nasil etkiledigini incelemek amaciyla üg simülasyon galismasi gerçeklestirdik. Eksik veri orani ve benzersiz olmayan küme üyeligi orani orta seviyelerde oldugunda sonuglar önerilen algoritmanin basaril sonuglar verdigini göstermektedir. Uçünci yöntemimiz, ilk bölümde gelistirilen hesaplama açisindan verimli algoritmalari kategorik veri yapilarinda kullamlacak gekilde genigletmektedir. Özellikle ikili ve/veya sirali degiskenler ele alnmaktadir. Bu yöntemler sürekli yaklagimlar altinda elde edilen atanan degerlere uygulanan kalibrasyon temelli yuvarlama kurallarina dayanmaktadir. Bu kurallar, kategorik verilerin atanan veri dagilimlarinin gözlenen veri dagilmlariyla tutarh olmasini saglamak amaciyla gelistirilmistir. Sinirh kapsamli simülasyon çalismamiz bu yöntemin uygulayicilarin sapma, kapsama orani ve dogruluk açisindan anlamli gikarimlar yapilabilen çoklu atama (MI) tekniklerini kalibrasyon kurallarimiz çerçevesinde kullanmalarim sagladigini göstermektedir.

Özet (Çeviri)

Presenceofmissingdataincorrelateddatasettingsisanon-trivialproblem. Inferenceby multipleimputationo↵ersaviablesolutiontoanalysts. However,themissingdataproblem istypicallymorecomplicatedduetodiversemeasurementscales,skippatterns,boundsand restrictions. Sequentialregressionimputationalsoknownasvariable-by-variableimputation hasemergedasapopularimputationmodelingtechnique,especiallyinthecomplexdata structures. In this dissertation, we develop three methods to handle incomplete data in hierarchicallynestedandnon-nestedmultileveldatastructuresusingsequentialregression imputationapproach. ThefirstmethodisconcernedwithincompleteGaussianvariables. Thismethodmakes useofcomputationale�cientalgorithmsinthecontextsequentialregressionimputation. TheexistingmethodsmakeuseoftraditionalGibbssampler,awell-knownMarkovChain MonteCarlo(MCMC)method,tosamplefromconditionalposteriorpredictivedistribution ofmissingdata. Thesealgorithmsareknowntomixslowlyastheytreatrandome↵ects missingdatainadditiontorawmissingdata. Ourmethodbypassestheslowconvergence oftraditionalGibbssamplerbyde-conditioningonsimulatedvaluesofrandome↵ects. We evaluateandcomparetheperformanceofourmethodwithothertwomultipleimputation routines(MICEandpanpackages)throughsimulationstudies. Theresultsdemonstratethat ourmethodoutperformsthealternativeswithrespecttocomputationtimeandoperational characteristics(e.g. accuracy). ThismethodisalsoillustratedusingNewYorkStatebirth certificatedata. Oursecondmethodproposesansequentialregressionimputationalgorithminsettings where the lowest observational units are nested within possibly non-unique higher order observationalunits(e.g. studentswithinmultipleclassrooms). Thesealgorithmsrelyon MCMC simulation methods to sample from the predictive distribution of missing data. These distributionsarederivedfrommixed-e↵ectsmodelstailoredtoreflectthecombinationof latentimpactsofmultipleclusters. Weconductthreesimulationstudiestoinvestigatehow therateofnon-uniqueclustermembershipa↵ectstheperformanceoftheproposedimputation algorithm. Theresultsshowthattheproposedalgorithmperformswellwhenthepercentage ofmissingdataandtherateofnon-uniqueclustermembershiparemoderate. Ourthirdmethodextendcomputationally-e�cientalgorithmsofthefirstpapertobe usedincategoricaldata. Inparticular,weconsiderbinaryand/orordinalvariables. These methodsarebasedoncalibration-basedroundingrulestoappliedtoimputedvaluesdrawn underthecontinuousapproximations. Theserulesaredevelopedtoensuretheimputeddata distributionsofcategoricaldataareconsistentwiththeobserveddatadistributions. Our limitedsimulationstudydemonstratesthat,thismethodallowspractitionerstofacilitatethe inferentiallysoundMItechniquesusingourcalibrationruleswithrespecttobias,coverage rateandaccuracy.

Benzer Tezler

  1. Robust and efficient learning methods for time series processing under missing data

    Eksik veri içeren zaman serilerinin işlenmesi için gürbüz ve etkin öğrenme yöntemleri

    SAFA ONUR ŞAHİN

    Doktora

    İngilizce

    İngilizce

    2025

    Elektrik ve Elektronik Mühendisliğiİhsan Doğramacı Bilkent Üniversitesi

    Elektrik ve Elektronik Mühendisliği Ana Bilim Dalı

    PROF. DR. SÜLEYMAN SERDAR KOZAT

  2. Çoklu bölümlenmelerin birleştirilmesinde yeni verimli ve ölçeklenebilir yöntemler

    Novel efficient and scalable methods for combining multiple clusterings

    ARİF MURAT YAĞCI

    Yüksek Lisans

    İngilizce

    İngilizce

    2010

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolBahçeşehir Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    YRD. DOÇ. DR. SELİM NECDET MİMAROĞLU

  3. An efficient design optimization framework for rf and optical applications

    Başlık çevirisi yok

    ORKUN KARABAŞOĞLU

    Yüksek Lisans

    İngilizce

    İngilizce

    2008

    Mekatronik MühendisliğiSabancı Üniversitesi

    Mühendislik Bilimleri Ana Bilim Dalı

    DOÇ. DR. GULLU KIZILTAS

  4. UTILIZING SCANPATH TREND ANALYSIS FOR EFFICIENT REAL-TIME PRIVACY-PRESERVING HUMAN ACTIVITY RECOGNITION WITH WEARABLE SENSORS

    SCANPATH TREND ANALİZİNDEN YARARLANARAK GİYİLEBİLİR SENSÖRLERLE VERİMLİ GERÇEK ZAMANLI GİZLİLİĞİ KORUYAN İNSAN AKTİVİTE TANIMA

    ZEKİCAN BUDİN

    Yüksek Lisans

    İngilizce

    İngilizce

    2023

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolOrta Doğu Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. ENVER EVER

    DR. ÖĞR. ÜYESİ ŞÜKRÜ ERASLAN

  5. Issues in multiple criteria decision making with discrete alternatives

    Başlık çevirisi yok

    PAUL N.S. SAGALA

    Doktora

    İngilizce

    İngilizce

    1990

    Endüstri ve Endüstri MühendisliğiOrta Doğu Teknik Üniversitesi

    Endüstri Mühendisliği Ana Bilim Dalı

    DOÇ. DR. MURAT M. KÖKSALAN