Geri Dön

A novel multivariate discretization algorithm using dynamic programming

Dinamik programlama kullanan özgün bir çok değişkenli ayrıklaştırma algoritması

  1. Tez No: 798668
  2. Yazar: ALİ BURAK ERDOĞAN
  3. Danışmanlar: DOÇ. DR. BURKAY GENÇ
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, İstatistik, Computer Engineering and Computer Science and Control, Statistics
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2023
  8. Dil: İngilizce
  9. Üniversite: Hacettepe Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Ayrıklaştırma, nicel ve sürekli sayısal verileri, kesişmeyen aralıklara atayarak, nitel ve sınıflan-dırılabilir bir veriye dönüştürme işlemine verilen isimdir. Ayrıklaştırma, veri madenciliği ve keşifsel veri analizi çalışmalarında verinin karmaşıklığını azaltmak için uygulanan önemli bir adımdır. Eşit-genişlik, eşit-sıklık ve MDLP (minimum tanım uzunluğu prensibi) gibi sürekli sayısal verileri ayrıklaştırmak için kullanılan birçok yöntem mevcuttur. Bununla beraber, saydığımız yöntemler verinin çok değişkenli doğasını göz önüne almayıp, sadece bir değişkene odaklanmaktadır. Bu da verinin öz nitelikleri arasındaki mevcut korelasyon bilgisinin kaybolmasına sebep olmaktadır. Ayrıca, sınıflandırılmamış veriler, MDLP gibi sınıf bilgisine dayalı denetimli yöntemler ile ayrıklaştırılamamaktadır. Bu çalışmada, kısıtlanmış en kısa yol algoritması kullanan ve bilgi entropisine dayanan; denetimsiz, çok değişkenli, evrensel ve statik bir ayrıklaştırıcı öneriyoruz. Bu ayrıklaştırıcı tekniğimizi manuel olarak hazırlanmış rastgele sentetik veri kümeleri üzerinde test ederek, yaklaşımımızın ilişkili öz-nitelikler üzerinden hesaplanan entropiye göre çoğu test durumunda daha başarılı bir ayrıklaştırma sağladığını gösteriyoruz. Bu yöntem, keşifsel veri analizi gibi görevler için veri içerisinde gizli olan anlamlı aralıkların keşfedilmesinde yardımcı bir rol üstlenebilir. Buna ek olarak, yöntemimizi gerçek veri kümeleri üzerinde test ettiğimizde sınıflandırma doğruluğunun genel olarak --tek değişkenli yöntemlerin aksine -- iyileştiğini gözlemledik. Dolayısıyla, ayrıklaştırma yöntemimiz sınıflandırma görevlerinde daha yüksek bir doğruluk elde edilmesine yardım edebilir.

Özet (Çeviri)

Discretization is the task of converting quantitative (continuous) numerical data into qualitative (categorical) by assigning them into non-overlapping intervals. It is an important step in reducing the complexity of data in data mining and exploratory data analysis studies. There are many methods that provide discretization schemes on continuous attributes, such as equal-width, equal-frequency, and minimum description length principle (MDLP). On the other hand, these methods ignore the multivariate nature of the dataset and focus on a single feature space for discretization. This causes a loss of information with respect to the correlations between attributes. Moreover, unlabeled data cannot be discretized with supervised methods (e.g. MDLP) that use class labels. We propose a new technique for unsupervised, multivariate, global, and static discretization; a discretizer based on information entropy which employs a constrained shortest-path algorithm. We test our technique on manually crafted randomized synthetic datasets as well as well-known real datasets. We show that our approach provides a more meaningful discretization in test cases. This may allow the retrieval of meaningful intervals, which are hidden, for data exploratory tasks. Also, classification accuracy on real datasets generally improves with our method unlike other univariate benchmark methods. Hence, our method may serve to achieve better accuracy on classification tasks.

Benzer Tezler

  1. A novel multivariate stochastic volatility model and estimation with GPU computing

    Yeni bir çok değişkenli stokastik oynaklık modeli ve GPU tabanlı hesaplama ile kestirimi

    HALİL ERTÜRK ESEN

    Doktora

    İngilizce

    İngilizce

    2016

    İstatistikİstanbul Teknik Üniversitesi

    Hesaplamalı Bilim ve Mühendislik Ana Bilim Dalı (disiplinlerarası)

    PROF. DR. KEMAL BURÇ ÜLENGİN

    PROF. DR. MUSTAFA SERDAR ÇELEBİ

  2. Çok değişkenli bernoulli dağılımı ile değişken seçimi için özgün bir bayesçi çıkarım yöntemi ve uygulamaları

    A novel bayesian inference method for variable selection using multivariate bernoulli distribution and its applications

    ZEYNEP BAL TÜRKEN

    Doktora

    Türkçe

    Türkçe

    2026

    İstatistikMimar Sinan Güzel Sanatlar Üniversitesi

    İstatistik Ana Bilim Dalı

    PROF. DR. GÜLAY BAŞARIR

    PROF. DR. MEHMET GÖNEN

  3. Sentetik çok değişkenli veri üretimi için oyun teorisi tabanlı çekişmeli öğrenme: özgün bir gan mimarisi (statd²gan)

    Game theory-based adversarial learning for synthetic multivariate data generation: A novel gan architecture (statd²gan)

    MUSTAFA ÖZAYTAÇ

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    İstatistikHacettepe Üniversitesi

    İstatistik Ana Bilim Dalı

    DOÇ. DR. ÖZGE KARADAĞ ATAŞ

  4. Kronik Hepatit B hastalarında yağlı karaciğer hastalığının tanısında kullanılabilecek non-invaziv yeni bir indeks: Hatay indeksi

    A novel non-invasive index for the diagnosis of fatty liver disease in patients with chronic Hepatitis B: The Hatay index

    YUSUF CAN ARIDAŞIR

    Tıpta Uzmanlık

    Türkçe

    Türkçe

    2025

    İç HastalıklarıHatay Mustafa Kemal Üniversitesi

    İç Hastalıkları Ana Bilim Dalı

    PROF. DR. MEHMET DEMİR

  5. Pulmoner yassı hücreli karsinomlarda sağ kalım ile ilişkili yeni bir derecelendirme yönteminin oluşturulması

    Proposal of a novel grading system associated with survival in pulmonary squamous cell carcinomas

    EKİN SAYIN MERCADİER

    Tıpta Uzmanlık

    Türkçe

    Türkçe

    2026

    PatolojiAnkara Üniversitesi

    Tıbbi Patoloji Ana Bilim Dalı

    PROF. DR. SERPİL SAK