Geri Dön

Haber sınıflandırma sistemlerinde naive bayes ve makine öğrenmesi algoritmaları arasında performans karşılaştırması

Performance analysis of naive bayes algorithms on news classification and comparison with other machine learning methods

  1. Tez No: 970384
  2. Yazar: MERVE VEZİROĞLU
  3. Danışmanlar: PROF. DR. İHSAN ÖMÜR BUCAK
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2025
  8. Dil: Türkçe
  9. Üniversite: Iğdır Üniversitesi
  10. Enstitü: Lisansüstü Eğitim Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Dijital içerikteki artış, özellikle Doğal Dil İşleme (DDİ) (Natural Language Processing (NLP)) kullanarak haber sınıflandırmasında otomatik metin sınıflandırma yöntemlerine olan ihtiyacı artırmıştır. Bu çalışma, haber başlıklarını önceden tanımlanmış kategorilere ayırmak için Naive Bayes (NB) algoritmalarına odaklanan Python tabanlı bir haber sınıflandırma sisteminin tanıtılmasını içermektedir. Naive Bayes, metin sınıflandırmasındaki basitliği ve etkinliği nedeniyle tercih edilmektedir. Amacımız, bir haber sınıflandırma sistemini oluşturma aşamalarını keşfetmeyi ve çeşitli Naive Bayes algoritma değerlendirmelerini içermektedir. Bu çalışmada veri kümesi, teknoloji, iş dünyası, spor, eğlence ve siyaset alanlarını kapsayan BBC News başlıklarından oluşmaktadır. Kategori dağılımının ve başlık uzunluğunun analiz edilmesi bize veri kümesi hakkında ihtiyaç duyduğumuz bilgiyi sağlamıştır. Veri ön işleme; metin temizleme, durdurma kelimesi kaldırma ve metni makine tarafından okunabilir sayısal verilere dönüştürme eylemleri için Sayım Vektörleştirme (Count Vectorization) ile özellik çıkarım işlemlerini içermektedir. Bu çalışmada beş adet Naive Bayes varyantı incelenmiştir: Gaussian, Multinomial, Complement, Bernoulli ve TAN (Tree-Augmented Naive Bayes). Bunlar arasında Multinomial Naive Bayes varyasyonları ise en yüksek doğruluk oranlarına ulaşmışlardır. Özellikle Multinomial Naïve Bayes (epsilon = 0.01) %98.53 doğruluk oranı ile öne çıkmıştır. Complement Naive Bayes %98.31, TAN algoritması, %98.20, Bernoulli Naive Bayes ise %96.74 doğruluk oranları ile yüksek performans göstermişlerdir. Gaussian Naive Bayes ve varyasyonları, ortalama doğruluk oranlarında %91.79 ile %92.92 arasında değişiklik göstererek Naive Bayes varyantlarına göre biraz daha düşük performans sergilemişlerdir. Ayrıca Naive Bayes algoritmaları, Lojistik Regresyon (Logistic Regression), Rastgele Orman (Random Forest), Doğrusal Destek Vektör Sınıflandırıcısı (DVS) (Linear Support Vector Classifier (SVC)), Çok Katmanlı Algılayıcı (ÇKA) Sınıflandırıcısı (Multilayer Perceptron (MLP) Classifier), Karar Ağacı (Decision Tree) ve K-En Yakın Komşuluk (K-EYK) (KNearest Neighbors (KNN)) gibi diğer sınıflandırıcılarla karşılaştırılmıştır. ÇKA Sınıflandırıcısı, %98.31 doğruluk oranı ile en yüksek performansı göstermiştir. Lojistik Regresyon, Rastgele Orman ve Doğrusal DVS algoritmaları da sırasıyla %97.52, %97.86 ve %97.97 gibi yüksek doğruluk oranlarına ulaşmışlardır. Buna karşılık, Doğrusal Ayırtaç Analizi (Linear Discriminant Analysis) ve K-EYK algoritmaları düşük performans göstermişlerdir; özellikle Doğrusal Ayırtaç Analizi %38.20 doğruluk oranı ile en düşük performansı sergilemiştir. Bu sonuçlar, Naive Bayes algoritmalarının haber sınıflandırma problemlerinde güçlü ve etkili bir çözüm sunduğuna işaret etmektedir. Özellikle Multinomial ve Complement Naive Bayes algoritmaları, yüksek doğruluk oranları ile öne çıkmışlardır. Bu arada etkili veri ön işleme adımlarının, doğru sınıflandırmada önemli bir rol oynadığı açık bir şekilde gözlemlenmiştir. Bu çalışma, haber sınıflandırmasında Naive Bayes algoritması performansının içyüzünü anlama çabalarına katkıda bulunarak DDİ ve Haber Sınıflandırma sistemlerine fayda sağlamaktadır. Naive Bayes algoritmalarının yüksek performansı bize, metin sınıflandırma problemlerinde basit ama güçlü bir çözüm olarak öne çıktığını göstermektedir. Gelecekteki çalışmalarımız, daha geniş veri kümeleri ve farklı özellik mühendisliği yöntemleri ile bu algoritmaların performanslarını daha da artırmaya yönelik olacaktır.

Özet (Çeviri)

The increase in digital content has increased the need for automated text classification methods, especially for news classification using Natural Language Processing (NLP). This paper introduces a Python-based news classification system that focuses on Naive Bayes (NB) algorithms to classify news headlines into predefined categories. Naive Bayes is favored for its simplicity and efficiency in text classification. Our goal includes exploring the steps involved in building a news classification system and evaluating various Naive Bayes algorithms. In this study, the dataset consists of BBC News headlines covering technology, business, sports, entertainment and politics. Analyzing the category distribution and title length provided us with the information we needed about the dataset. Data preprocessing includes Count Vectorization and feature extraction for text cleaning, stop word removal, and conversion of text into machine-readable numeric data. In this study, five Naive Bayes variants are examined: Gaussian, Multinomial, Complement, Bernoulli and TAN (Tree-Augmented Naive Bayes). Among these, the Multinomial Naive Bayes variations achieved the highest accuracy rates. In particular, Multinomial Naïve Bayes (epsilon = 0.01) stood out with 98.53% accuracy. Complement Naive Bayes (98.31%), TAN algorithm (98.20%) and Bernoulli Naive Bayes (96.74%) showed high performance. Gaussian Naive Bayes and its variations performed slightly lower than the Naive Bayes variants with average accuracy rates ranging from 91.79% to 92.92%. Naive Bayes algorithms were also compared with other classifiers such as Logistic Regression, Random Forest, Linear Support Vector Classifier (Linear SVC), Multilayer Perceptron (MLP) Classifier, Decision Tree and K-Nearest Neighbors (KNN). The MLP Classifier showed the highest performance with an accuracy rate of 98.31%. Logistic Regression, Random Forest and Linear SVC algorithms also achieved high accuracy rates of 97.52%, 97.86% and 97.97% respectively. However, Linear Discriminant Analysis and K-NN algorithms performed poorly; in particular, Linear Discriminant Analysis showed the lowest performance with an accuracy of 38.20%. These results indicate that Naive Bayes algorithms provide a powerful and effective solution to news classification problems. Especially Multinomial and Complement Naive Bayes algorithms stood out with their high accuracy rates. Meanwhile, it is clearly observed that effective data preprocessing steps play an important role in accurate classification. This paper contributes to the efforts to gain insight into the performance of Naive Bayes algorithms in news classification, which is of benefit to NLP and News Classification systems. The high performance of Naive Bayes algorithms shows that they offer a simple yet powerful solution to text classification problems. Future work aims to further improve the performance of these algorithms with larger datasets and different feature engineering methods.

Benzer Tezler

  1. Data mining anwendungen in entscheidungsunterstützungssystemen und ein anwendungsbeispiel bei der personalauswahl

    Karar destek sistemlerinde veri madenciliği uygulamaları ve personel seçiminde uygulama örneği

    FATİH DEM

    Yüksek Lisans

    Almanca

    Almanca

    2019

    İşletmeMarmara Üniversitesi

    Enformatik Ana Bilim Dalı

    PROF. DR. YÜCEL YILMAZ

  2. An investigation of the performance of text mining-based text representation and classification methods on different datasets

    Farklı veri kümeleri üzerinde metin madenciliği tabanlı metin temsili ve sınıflandırma yöntemlerinin performansının incelenmesi

    ABDULKERİM BEKAR

    Yüksek Lisans

    İngilizce

    İngilizce

    2026

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Veri Mühendisliği ve İş Analitiği Ana Bilim Dalı (disiplinlerarası)

    DR. ÖĞR. ÜYESİ MEHMET ALİ ERGÜN

  3. Study of word embedding rules and machine learning based text classification

    Kelime gömme kuralları ve metin sınıflandırması tabanlı makine öğrenme üzerine bir çalışma

    ASMAA AL-GARTANEE

    Doktora

    İngilizce

    İngilizce

    2019

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolAtılım Üniversitesi

    Mühendislik Sistemlerinin Modellenmesi ve Tasarımı Ana Bilim Dalı

    PROF. DR. ALOK MISHRA

    YRD. DOÇ. DR. ABDÜL KADİR GÖRÜR

  4. Text categorization and ensemble pruning in turkish news portals

    Türkçe haber portallarında metin sınıflandırma ve topluluk budama

    ÇAĞRI TORAMAN

    Yüksek Lisans

    İngilizce

    İngilizce

    2011

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİhsan Doğramacı Bilkent Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. FAZLI CAN

  5. Analyzing the generalizability of deep contextualized language representations for text classification

    Doğal dil işlemede bağlam odaklı derin öğrenme yöntemlerinin transfer kapasitesinin metin sınıflandırması problemi üzerinden incelenmesi

    BERFU BÜYÜKÖZ

    Yüksek Lisans

    İngilizce

    İngilizce

    2020

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolBoğaziçi Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. ARZUCAN ÖZGÜR TÜRKMEN