Haber sınıflandırma sistemlerinde naive bayes ve makine öğrenmesi algoritmaları arasında performans karşılaştırması
Performance analysis of naive bayes algorithms on news classification and comparison with other machine learning methods
- Tez No: 970384
- Danışmanlar: PROF. DR. İHSAN ÖMÜR BUCAK
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: Türkçe
- Üniversite: Iğdır Üniversitesi
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Dijital içerikteki artış, özellikle Doğal Dil İşleme (DDİ) (Natural Language Processing (NLP)) kullanarak haber sınıflandırmasında otomatik metin sınıflandırma yöntemlerine olan ihtiyacı artırmıştır. Bu çalışma, haber başlıklarını önceden tanımlanmış kategorilere ayırmak için Naive Bayes (NB) algoritmalarına odaklanan Python tabanlı bir haber sınıflandırma sisteminin tanıtılmasını içermektedir. Naive Bayes, metin sınıflandırmasındaki basitliği ve etkinliği nedeniyle tercih edilmektedir. Amacımız, bir haber sınıflandırma sistemini oluşturma aşamalarını keşfetmeyi ve çeşitli Naive Bayes algoritma değerlendirmelerini içermektedir. Bu çalışmada veri kümesi, teknoloji, iş dünyası, spor, eğlence ve siyaset alanlarını kapsayan BBC News başlıklarından oluşmaktadır. Kategori dağılımının ve başlık uzunluğunun analiz edilmesi bize veri kümesi hakkında ihtiyaç duyduğumuz bilgiyi sağlamıştır. Veri ön işleme; metin temizleme, durdurma kelimesi kaldırma ve metni makine tarafından okunabilir sayısal verilere dönüştürme eylemleri için Sayım Vektörleştirme (Count Vectorization) ile özellik çıkarım işlemlerini içermektedir. Bu çalışmada beş adet Naive Bayes varyantı incelenmiştir: Gaussian, Multinomial, Complement, Bernoulli ve TAN (Tree-Augmented Naive Bayes). Bunlar arasında Multinomial Naive Bayes varyasyonları ise en yüksek doğruluk oranlarına ulaşmışlardır. Özellikle Multinomial Naïve Bayes (epsilon = 0.01) %98.53 doğruluk oranı ile öne çıkmıştır. Complement Naive Bayes %98.31, TAN algoritması, %98.20, Bernoulli Naive Bayes ise %96.74 doğruluk oranları ile yüksek performans göstermişlerdir. Gaussian Naive Bayes ve varyasyonları, ortalama doğruluk oranlarında %91.79 ile %92.92 arasında değişiklik göstererek Naive Bayes varyantlarına göre biraz daha düşük performans sergilemişlerdir. Ayrıca Naive Bayes algoritmaları, Lojistik Regresyon (Logistic Regression), Rastgele Orman (Random Forest), Doğrusal Destek Vektör Sınıflandırıcısı (DVS) (Linear Support Vector Classifier (SVC)), Çok Katmanlı Algılayıcı (ÇKA) Sınıflandırıcısı (Multilayer Perceptron (MLP) Classifier), Karar Ağacı (Decision Tree) ve K-En Yakın Komşuluk (K-EYK) (KNearest Neighbors (KNN)) gibi diğer sınıflandırıcılarla karşılaştırılmıştır. ÇKA Sınıflandırıcısı, %98.31 doğruluk oranı ile en yüksek performansı göstermiştir. Lojistik Regresyon, Rastgele Orman ve Doğrusal DVS algoritmaları da sırasıyla %97.52, %97.86 ve %97.97 gibi yüksek doğruluk oranlarına ulaşmışlardır. Buna karşılık, Doğrusal Ayırtaç Analizi (Linear Discriminant Analysis) ve K-EYK algoritmaları düşük performans göstermişlerdir; özellikle Doğrusal Ayırtaç Analizi %38.20 doğruluk oranı ile en düşük performansı sergilemiştir. Bu sonuçlar, Naive Bayes algoritmalarının haber sınıflandırma problemlerinde güçlü ve etkili bir çözüm sunduğuna işaret etmektedir. Özellikle Multinomial ve Complement Naive Bayes algoritmaları, yüksek doğruluk oranları ile öne çıkmışlardır. Bu arada etkili veri ön işleme adımlarının, doğru sınıflandırmada önemli bir rol oynadığı açık bir şekilde gözlemlenmiştir. Bu çalışma, haber sınıflandırmasında Naive Bayes algoritması performansının içyüzünü anlama çabalarına katkıda bulunarak DDİ ve Haber Sınıflandırma sistemlerine fayda sağlamaktadır. Naive Bayes algoritmalarının yüksek performansı bize, metin sınıflandırma problemlerinde basit ama güçlü bir çözüm olarak öne çıktığını göstermektedir. Gelecekteki çalışmalarımız, daha geniş veri kümeleri ve farklı özellik mühendisliği yöntemleri ile bu algoritmaların performanslarını daha da artırmaya yönelik olacaktır.
Özet (Çeviri)
The increase in digital content has increased the need for automated text classification methods, especially for news classification using Natural Language Processing (NLP). This paper introduces a Python-based news classification system that focuses on Naive Bayes (NB) algorithms to classify news headlines into predefined categories. Naive Bayes is favored for its simplicity and efficiency in text classification. Our goal includes exploring the steps involved in building a news classification system and evaluating various Naive Bayes algorithms. In this study, the dataset consists of BBC News headlines covering technology, business, sports, entertainment and politics. Analyzing the category distribution and title length provided us with the information we needed about the dataset. Data preprocessing includes Count Vectorization and feature extraction for text cleaning, stop word removal, and conversion of text into machine-readable numeric data. In this study, five Naive Bayes variants are examined: Gaussian, Multinomial, Complement, Bernoulli and TAN (Tree-Augmented Naive Bayes). Among these, the Multinomial Naive Bayes variations achieved the highest accuracy rates. In particular, Multinomial Naïve Bayes (epsilon = 0.01) stood out with 98.53% accuracy. Complement Naive Bayes (98.31%), TAN algorithm (98.20%) and Bernoulli Naive Bayes (96.74%) showed high performance. Gaussian Naive Bayes and its variations performed slightly lower than the Naive Bayes variants with average accuracy rates ranging from 91.79% to 92.92%. Naive Bayes algorithms were also compared with other classifiers such as Logistic Regression, Random Forest, Linear Support Vector Classifier (Linear SVC), Multilayer Perceptron (MLP) Classifier, Decision Tree and K-Nearest Neighbors (KNN). The MLP Classifier showed the highest performance with an accuracy rate of 98.31%. Logistic Regression, Random Forest and Linear SVC algorithms also achieved high accuracy rates of 97.52%, 97.86% and 97.97% respectively. However, Linear Discriminant Analysis and K-NN algorithms performed poorly; in particular, Linear Discriminant Analysis showed the lowest performance with an accuracy of 38.20%. These results indicate that Naive Bayes algorithms provide a powerful and effective solution to news classification problems. Especially Multinomial and Complement Naive Bayes algorithms stood out with their high accuracy rates. Meanwhile, it is clearly observed that effective data preprocessing steps play an important role in accurate classification. This paper contributes to the efforts to gain insight into the performance of Naive Bayes algorithms in news classification, which is of benefit to NLP and News Classification systems. The high performance of Naive Bayes algorithms shows that they offer a simple yet powerful solution to text classification problems. Future work aims to further improve the performance of these algorithms with larger datasets and different feature engineering methods.
Benzer Tezler
- Data mining anwendungen in entscheidungsunterstützungssystemen und ein anwendungsbeispiel bei der personalauswahl
Karar destek sistemlerinde veri madenciliği uygulamaları ve personel seçiminde uygulama örneği
FATİH DEM
- An investigation of the performance of text mining-based text representation and classification methods on different datasets
Farklı veri kümeleri üzerinde metin madenciliği tabanlı metin temsili ve sınıflandırma yöntemlerinin performansının incelenmesi
ABDULKERİM BEKAR
Yüksek Lisans
İngilizce
2026
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiVeri Mühendisliği ve İş Analitiği Ana Bilim Dalı (disiplinlerarası)
DR. ÖĞR. ÜYESİ MEHMET ALİ ERGÜN
- Study of word embedding rules and machine learning based text classification
Kelime gömme kuralları ve metin sınıflandırması tabanlı makine öğrenme üzerine bir çalışma
ASMAA AL-GARTANEE
Doktora
İngilizce
2019
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolAtılım ÜniversitesiMühendislik Sistemlerinin Modellenmesi ve Tasarımı Ana Bilim Dalı
PROF. DR. ALOK MISHRA
YRD. DOÇ. DR. ABDÜL KADİR GÖRÜR
- Text categorization and ensemble pruning in turkish news portals
Türkçe haber portallarında metin sınıflandırma ve topluluk budama
ÇAĞRI TORAMAN
Yüksek Lisans
İngilizce
2011
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİhsan Doğramacı Bilkent ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. FAZLI CAN
- Analyzing the generalizability of deep contextualized language representations for text classification
Doğal dil işlemede bağlam odaklı derin öğrenme yöntemlerinin transfer kapasitesinin metin sınıflandırması problemi üzerinden incelenmesi
BERFU BÜYÜKÖZ
Yüksek Lisans
İngilizce
2020
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolBoğaziçi ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. ARZUCAN ÖZGÜR TÜRKMEN