Geri Dön

A similarity based oversampling method for multi-label imbalanced text data

Çok etiketli dengesiz metin veri kümeleri için benzerliğe dayalı bir aşkın örnekleme yöntemi

  1. Tez No: 763558
  2. Yazar: İSMAİL HAKKI KARAMAN
  3. Danışmanlar: PROF. DR. GÜLSER KÖKSAL, DOÇ. DR. LEVENT ERİŞKİN
  4. Tez Türü: Yüksek Lisans
  5. Konular: Endüstri ve Endüstri Mühendisliği, Industrial and Industrial Engineering
  6. Anahtar Kelimeler: Aşırı örnekleme, Doğal dil işleme, Metin sınıflandırma, Örnekleme, Over sampling, Natural language processing, Text categorization, Sampling
  7. Yıl: 2022
  8. Dil: İngilizce
  9. Üniversite: Orta Doğu Teknik Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Endüstri Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Endüstri Mühendisliği Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Dünyamızda veri miktarı artmasına rağmen veri etiketlemenin maliyeti ve zorluğu nedeniyle etiketlenmiş veri bulmak kolay değildir. Ayrıca makine öğrenmesi projelerinde, özellikle çok etiketli sınıflandırma problemlerinde, veri dengesizliği nedeniyle başarım sorunlarıyla karşılaşılmaktadır. Çok etiketli sınıflandırma problemlerinde bazı sınıflar için bir sınıflandırıcı eğitmek için bile yeterli veri olmayabilir. Bu çalışmada çok etiketli sınıflandırma problemlerindeki başarım problemlerini çözmek için bir aşkın örnekleme yöntemi geliştirilmiştir. Önerilen yöntem etiketsiz veri kümesinden benzerlik yardımıyla yeni örnekler bulur ve bu örnekler, başarımı iyileştirmesi halinde etiketli sınıfa dahil edilir. Etiketsiz küme tekrarlı olarak taranır ve başarımı iyileştiren örnekler etiketli kümeye eklenerek bu sınıf genişletilir. Yapılan denemelerde algoritma başarımının iyileştiği gözlemlenmiştir. Önerilen yöntem ile insan çabası gerekmeden veri etiketlemenin mümkün olacağı düşünülmektedir.

Özet (Çeviri)

In the real world, while the amount of data increases, it is not easy to find labeled data for Machine Learning projects, because of the compelling cost and effort requirements for labeling data. Also, most Machine Learning projects, especially multi-label classification problems, struggle with the data imbalance problem. In these problems, some classes, even, do not have enough data to train a classifier. In this study, an oversampling method for multi-label text classification problems is developed and studied to solve performance problems arising from the data imbalance. The proposed method finds new samples from unlabeled data by utilizing similarities between instances. It finds similar instances for a class from the unlabeled set and checks for improvement to see the effect on the performance of these instances. The unlabeled set is searched iteratively and the instances that assist the performance improvement are added to the labeled set. The experiments show that our method works well and the performance of the classifier is improved after oversampling.

Benzer Tezler

  1. Giyilebilir sensör verileri ile hayvan davranışı sınıflandırmada transfer öğrenme ve alan uyarlaması

    Transfer learning and domain adaptation for animal behavior classification using wearable sensor data

    FURKAN SAY

    Yüksek Lisans

    Türkçe

    Türkçe

    2026

    Veteriner HekimliğiMersin Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. ÇİĞDEM ACI

  2. 8 haftalık multi-model egzersiz programının Serebral palsi'li çocukların fonksiyonları üzerine etkileri

    The effects of eight weeks- period multi-model exercise program over function of the children with Cerebral palsy

    SEMA ÖZANDAÇ

    Yüksek Lisans

    Türkçe

    Türkçe

    2011

    SporÇukurova Üniversitesi

    Beden Eğitimi ve Spor Ana Bilim Dalı

    YRD. DOÇ. DR. GONCA İNCE

  3. An agent-based framework for systematic generative feature engineering in financial markets

    Finansal piyasalarda sistematik üretici değişken mühendisliği için yapay zekâ ajanları temelli bir yaklaşım

    MUSTAFA ENES KARAMAN

    Yüksek Lisans

    İngilizce

    İngilizce

    2026

    Bilim ve Teknolojiİstanbul Teknik Üniversitesi

    Büyük Veri ve İş Analitiği Ana Bilim Dalı (disiplinlerarası)

    PROF. DR. ALP ÜSTÜNDAĞ

  4. Stochastic bitstream-based vision and learning machines

    Stokastik bit akışı tabanlı görü ve öğrenme makineleri

    SERCAN AYGÜN

    Doktora

    İngilizce

    İngilizce

    2022

    Elektrik ve Elektronik Mühendisliğiİstanbul Teknik Üniversitesi

    Elektronik ve Haberleşme Mühendisliği Ana Bilim Dalı

    PROF. DR. ECE OLCAY GÜNEŞ

  5. Mali yapı analizlerinde çok boyutlu modeller

    Multi-dimensional models in financial structural analyses

    SERKAN ANIL

    Yüksek Lisans

    Türkçe

    Türkçe

    1997

    Mühendislik Bilimleriİstanbul Teknik Üniversitesi

    İşletme Mühendisliği Ana Bilim Dalı

    DOÇ. DR. MEHMET BOLAK