An investigation of the performance of text mining-based text representation and classification methods on different datasets
Farklı veri kümeleri üzerinde metin madenciliği tabanlı metin temsili ve sınıflandırma yöntemlerinin performansının incelenmesi
- Tez No: 1002727
- Danışmanlar: DR. ÖĞR. ÜYESİ MEHMET ALİ ERGÜN
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: İngilizce
- Üniversite: İstanbul Teknik Üniversitesi
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Veri Mühendisliği ve İş Analitiği Ana Bilim Dalı (disiplinlerarası)
- Bilim Dalı: Büyük Veri ve İş Analitiği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
MRO yazılım sistemine girilen arıza açıklamalarının doğal dilde ve standart bir yapıdan yoksun olması, bu verilerin manuel olarak incelenmesini ve anlamlandırılmasını zorlaştırmakta, aynı zamanda zaman ve iş gücü kaybına yol açmaktadır. Bu nedenle, arıza açıklamalarından otomatik olarak bilgi çıkarımı yapılması ve bu açıklamaların belirli etiketler altında sınıflandırılması, günümüzde önemli bir araştırma konusu haline gelmiştir. Bu tez çalışmasının temel amacı, MRO yazılım sistemlerinde yer alan arıza açıklamalarından otomatik olarak bilgi çıkarmak ve metin madenciliği ile makine öğrenimi yöntemlerini kullanarak bu açıklamalara Arıza Tipi, Arıza Kritikliği, Arıza Kaynağı ve İşlem Tipi gibi etiketlerin otomatik olarak atanmasını sağlamaktır. Büyük hacimli ve serbest metin yapısına sahip arıza kayıtlarının manuel olarak etiketlenmesi oldukça zahmetli ve zaman alıcı bir süreç olduğundan, bu çalışmada otomatik sınıflandırma yöntemlerinin etkinliği araştırılmıştır. Böylece, bakım süreçlerinde zaman tasarrufu sağlanması ve karar destek mekanizmalarının iyileştirilmesi hedeflenmiştir. Çalışma kapsamında iki farklı veri kümesi kullanılmıştır. Birinci veri kümesi, MRO yazılım sisteminden elde edilen arıza açıklamaları ve çeşitli etiketlerini içeren arıza verilerinden oluşmaktadır. İkinci veri kümesi ise, yöntemin farklı bir alandaki uygulanabilirliğini ve genellenebilirliğini test edebilmek amacıyla kullanılan, haber metinleri ve bu metinlere ait kategori etiketlerini içeren bir haber veri kümesidir. Böylece, geliştirilen yaklaşımın yalnızca arıza verilerine özgü olup olmadığı değil, aynı zamanda farklı metin türlerinde de başarılı bir şekilde çalışıp çalışmadığı analiz edilmiştir. Her iki veri kümesi için de sınıflandırma aşamasından önce kapsamlı bir ön işleme süreci uygulanmıştır. Bu süreçte, metinlerde yer alan noktalama işaretleri ve özel karakterler temizlenmiş, tüm harfler küçük harfe dönüştürülmüş, anlamsal katkısı düşük olan durak kelimeler metinlerden çıkarılmıştır. Ayrıca, kelimelerin kök veya gövde formlarına indirgenmesi amacıyla Zeyrek kütüphanesi ile kök bulma işlemleri uygulanmıştır. Bu ön işleme adımları sayesinde, metin verilerinin daha tutarlı ve makine öğrenimi algoritmaları için daha uygun bir yapıya kavuşması sağlanmıştır. Ön işleme aşamasının ardından, metinlerin sayısal forma dönüştürülmesi için çeşitli metin temsili ve özellik çıkarım yöntemleri kullanılmıştır. Bu yöntemler arasında klasik istatistiksel yaklaşımlar ile modern derin öğrenme tabanlı yöntemler birlikte değerlendirilmiştir. Çalışmada Bag of Words (BoW), TF-IDF (Term Frequency – Inverse Document Frequency), Word2Vec, Doc2Vec, FastText, BERT (Bidirectional Encoder Representations from Transformers) ve LDA (Latent Dirichlet Allocation) metin temsili yöntemleri kullanılmıştır. Bag of Words ve TF-IDF yöntemleri, metinlerdeki kelime sıklıklarına dayalı olarak basit ancak etkili bir temsil sunarken; Word2Vec, Doc2Vec ve FastText gibi yöntemler kelimeler arasındaki anlamsal ilişkileri vektör uzayında temsil etmeyi amaçlamaktadır. BERT modeli ise bağlamsal kelime temsilleri üreterek, kelimelerin metin içerisindeki kullanım bağlamını dikkate alan daha gelişmiş bir yaklaşım sunmaktadır. LDA yöntemi ise metinlerden gizli konuları (topic) ortaya çıkarmayı amaçlayan olasılıksal bir konu modelleme tekniği olarak kullanılmıştır. Elde edilen metin temsilleri, farklı makine öğrenimi tabanlı sınıflandırma algoritmaları ile eğitilerek etiketleme işlemleri gerçekleştirilmiştir. Çalışmada Naive Bayes, Decision Trees (Karar Ağaçları), Random Forest, Support Vector Machines (SVM), K-Nearest Neighbor (KNN), XGBoost ve Voting Classifier sınıflandırma algoritmaları kullanılmıştır. Bu algoritmalar, farklı metin temsilleri ile birlikte kullanılarak çok sayıda deneysel çalışma gerçekleştirilmiştir. Böylece, hangi metin temsili yönteminin hangi sınıflandırıcı ile daha iyi performans gösterdiği ayrıntılı bir şekilde analiz edilmiştir. Modellerin başarımı, doğruluk başta olmak üzere çeşitli performans ölçütleri kullanılarak değerlendirilmiş ve karşılaştırılmıştır. Modellerin güvenilirliği ve kararlılığını daha da değerlendirmek amacıyla, 5 katlı çapraz doğrulama uygulanmıştır. Bu yaklaşım, veri setini beş eşit alt kümeye bölmeyi, modelin her iterasyonda dört kat üzerinde eğitilmesini ve kalan kat üzerinde test edilmesini içermektedir. Her kat test seti olarak bir kez kullanıldığında, performans metrikleri katlar arasında ortalanarak değerlendirilmektedir. Bu yöntem, veri bölünmelerindeki varyasyonu hesaba katarak modelin genellenebilirliğini daha sağlam ve güvenilir bir şekilde ortaya koymaktadır. Deneysel sonuçlar genel olarak değerlendirildiğinde, klasik metin temsili yöntemlerinden Bag of Words (BoW) ve TF-IDF yaklaşımlarının, özellikle Support Vector Machines (SVM) algoritması ile birlikte kullanıldığında, hem arıza veri kümesinde hem de haber veri kümesinde yüksek ve tutarlı performans sergilediği görülmüştür. Arıza verileri üzerinde gerçekleştirilen deneylerde TF-IDF ve BoW tabanlı SVM modelleri ile Arıza Kritikliği, Arıza Kaynağı ve İşlem Tipi etiketlerinde doğruluk oranlarının yaklaşık %93 seviyelerine ulaştığı, Arıza Tipi etiketinde ise doğruluğun %91 civarında gerçekleştiği belirlenmiştir. Benzer şekilde Random Forest ve XGBoost algoritmaları da bu iki metin temsili yöntemiyle birlikte %91–%92 aralığında doğruluk değerleri üretmiş ve güçlü bir performans sergilemiştir. Haber veri kümesi üzerinde elde edilen sonuçlar da bu bulguları destekler niteliktedir. TF-IDF temsili kullanılarak eğitilen SVM modeli ile haber sınıflandırma probleminde yaklaşık %92 doğruluk elde edilirken, Voting Classifier ve XGBoost algoritmaları da %91 ve %89 doğruluk oranları ile dikkat çekmiştir. BoW temsili kullanıldığında ise Naive Bayes ve Voting Classifier algoritmalarının %91 doğruluk seviyesine ulaştığı, SVM modelinin ise %87 doğruluk ile TF-IDF'e kıyasla bir miktar daha düşük performans sergilediği gözlemlenmiştir. Bu durum, haber metinlerinde kelime sıklıklarının ve kelimelerin ayırt edicilik düzeylerinin TF-IDF yöntemi ile daha etkin bir şekilde temsil edilebildiğini göstermektedir. Dağıtımsal kelime temsilleri sunan Word2Vec ve FastText yöntemleri her iki veri kümesinde de orta seviyede performans göstermiştir. Arıza verisi üzerinde bu yöntemlerle elde edilen doğruluk oranları genel olarak %70–%86 aralığında kalırken, haber veri kümesinde Word2Vec ve FastText tabanlı modellerin doğruluk değerlerinin %83–%88 aralığında gerçekleştiği görülmüştür. Bu sonuçlar, kelime gömme tabanlı yöntemlerin klasik yaklaşımlara kıyasla bazı durumlarda rekabetçi olabildiğini, ancak genel olarak en yüksek performansı sağlayamadığını ortaya koymaktadır. Doc2Vec yöntemi ise her iki veri kümesinde de en düşük performansı sergileyen metin temsili yaklaşımı olmuştur. Arıza verisi üzerinde Doc2Vec tabanlı modellerde doğruluk oranlarının %32–%69 aralığında kaldığı, haber veri kümesinde ise en iyi senaryoda dahi doğruluğun %84 seviyesini aşamadığı belirlenmiştir. Bu durum, Doc2Vec yönteminin kullanılan veri setlerinin yapısı ve sınıf dağılımları için yeterli ayırt edici özellikler üretemediğini göstermektedir. Bağlamsal kelime temsilleri sunan BERT modeli, her iki veri kümesinde de klasik BoW ve TF-IDF yöntemlerine kıyasla daha düşük ancak tutarlı bir performans sergilemiştir. Arıza verisi üzerinde BERT tabanlı SVM modellerinde doğruluk oranları yaklaşık %73–%79 aralığında gerçekleşirken, haber veri kümesinde bu oranların %85–%87 seviyelerine ulaştığı gözlemlenmiştir. BERT'in haber verisinde görece daha iyi sonuçlar üretmesi, bu veri kümesinin daha genel dil yapısına sahip olmasıyla ilişkilendirilmektedir. Konu modelleme tabanlı LDA yaklaşımı ise her iki veri kümesinde de orta düzeyde performans sergilemiş; arıza verisinde doğruluk oranları genel olarak %63–%83, haber verisinde ise %80–%85 aralığında gerçekleşmiştir. LDA'nın metinlerin genel tematik yapısını yakalayabildiği, ancak doğrudan sınıflandırma problemi için kelime frekansına dayalı yöntemler kadar güçlü ayırt edici özellikler sunamadığı değerlendirilmiştir. Sonuç olarak, bu tez çalışması kapsamında gerçekleştirilen çalışmalar, büyük hacimli ve serbest metin yapısına sahip arıza kayıtlarının yanı sıra haber metinleri gibi farklı alanlardaki veri kümelerinin de otomatik olarak sınıflandırılabileceğini ortaya koymuştur. Elde edilen bulgular, iyi bir ön işleme süreciyle desteklenen TF-IDF ve Bag of Words temsilleri ile SVM algoritmasının, her iki veri kümesinde de %90'ın üzerinde doğruluk oranları, yüksek F1 skorları ve istikrarlı performans sunduğunu göstermektedir. Bu sonuçlar, MRO sistemlerinde manuel etiketleme süreçlerinin otomatikleştirilmesi ve karar destek mekanizmalarının güçlendirilmesi açısından önemli bir katkı sağlamaktadır.
Özet (Çeviri)
The main objective of this thesis is to automatically extract information from fault descriptions recorded in Maintenance, Repair and Overhaul (MRO) software systems and to assign labels such as Fault Type, Fault Criticality, Fault Source and Task Code using text mining and machine learning techniques. Since the manual labeling of large-scale and unstructured fault records is a time-consuming and labor-intensive process, this study investigates the effectiveness of automated classification approaches in order to improve efficiency and support decision-making mechanisms in maintenance processes. Within the scope of this study, two different datasets were utilized. The first dataset consists of fault descriptions obtained from an MRO software system. The second dataset contains news articles and their corresponding category labels and was used to evaluate the generalizability and applicability of the proposed approach in a different domain. By using these two datasets, it was possible to analyze whether the developed methodology is domain-specific or can be successfully applied to different types of textual data. Before the classification stage, a preprocessing was applied to both datasets. This process included the removal of punctuation marks and special characters; conversion of all text to lowercase, elimination of stop words with low semantic contribution; and the application of lemmatization techniques with Zeyrek library to reduce words to their root or base forms. These preprocessing steps helped to improve text consistency and ensured that the data were more suitable for machine learning algorithms. Following preprocessing, various text representation and feature extraction methods were employed to convert textual data into numerical form. Both traditional statistical approaches and modern representation techniques were evaluated in this study. The text representation methods used include Bag of Words (BoW), TF-IDF (Term Frequency–Inverse Document Frequency), Word2Vec, Doc2Vec, FastText, BERT (Bidirectional Encoder Representations from Transformers), and Latent Dirichlet Allocation (LDA). While BoW and TF-IDF provide simple yet effective representations based on word frequencies, Word2Vec, Doc2Vec, and FastText aim to capture semantic relationships between words in a vector space. BERT offers contextualized word representations by considering the usage context of words within sentences, whereas LDA is a probabilistic topic modeling technique designed to identify latent topics in text corpora. The extracted feature representations were then used to train various machine learning–based classification algorithms. The classifiers evaluated in this study include Naive Bayes, Decision Trees, Random Forest, Support Vector Machines (SVM), K-Nearest Neighbor (KNN), XGBoost, and Voting Classifier. These algorithms were combined with different text representation methods, resulting in a large number of experimental configurations. Model performance was evaluated and compared using standard metrics such as accuracy, precision, recall, and F1 score. To further validate the reliability and stability of the classifiers, 5-fold cross-validation was applied for each experimental configuration. This approach involved partitioning the dataset into five equal subsets, training the model on four folds and testing on the remaining fold in each iteration. The process was repeated so that each fold served as a test set once, allowing performance metrics to be averaged across folds. This methodology ensured that the evaluation accounted for variability in data splits and provided a more robust estimate of model generalizability across different text representations and classification algorithms. Overall experimental results indicate that traditional text representation methods, particularly Bag of Words and TF-IDF, achieved the highest and most consistent performance when combined with Support Vector Machines (SVM) for both datasets. In the fault dataset, TF-IDF and BoW–based SVM models achieved accuracy levels of approximately 93% for Fault Criticality, Fault Source, and Operation Type, while the accuracy for Fault Type classification was around 91%. Random Forest and XGBoost algorithms also demonstrated strong performance with these representations, yielding accuracy values in the range of 91–92%. The results obtained from the news dataset further support these findings. Using TF-IDF features, the SVM classifier achieved approximately 92% accuracy in the news classification task, while Voting Classifier and XGBoost models reached accuracy levels of 91% and 89%, respectively. When BoW representations were used, Naive Bayes and Voting Classifier achieved accuracies of approximately 91%, whereas SVM showed slightly lower performance compared to TF-IDF, with an accuracy of 87%. These results suggest that TF-IDF is more effective in capturing discriminative word importance in news texts. Distributed word embedding methods such as Word2Vec and FastText exhibited moderate performance across both datasets. In the fault dataset, accuracy values obtained with these methods generally ranged between 70% and 86%, while in the news dataset, accuracy values varied between 83% and 88%. Although these approaches were competitive in certain scenarios, they did not outperform traditional frequency-based representations. Doc2Vec yielded the lowest performance among all representation methods, with accuracy values ranging from 32% to 69% in the fault dataset and not exceeding 84% in the news dataset, indicating limited discriminative capability for the given classification tasks. The contextual language model BERT demonstrated stable but comparatively lower performance than BoW and TF-IDF. In the fault dataset, BERT-based SVM models achieved accuracy values between 73% and 79%, whereas in the news dataset, accuracy increased to approximately 85–87%. The relatively better performance on the news dataset can be attributed to the more general linguistic structure of news texts. However, limited data size and the absence of extensive fine-tuning restricted the full potential of BERT in this study. Topic modeling–based LDA produced moderate results for both datasets, with accuracy values ranging between 63% and 83% for the fault dataset and 80% to 85% for the news dataset. While LDA was able to capture general thematic structures, it did not provide sufficiently discriminative features for direct classification when compared to frequency-based approaches. In conclusion, the experimental results demonstrate that large-scale and unstructured fault records, as well as text data from different domains such as news articles, can be effectively classified using automated text mining and machine learning techniques. The findings show that TF-IDF and Bag of Words representations combined with Support Vector Machines deliver over 90% accuracy, high F1 scores, and stable performance across different datasets.
Benzer Tezler
- Bilgi merkezi hizmetlerinin kullanıcılar tarafından kullanım tepki durumlarının veri madenciliği yaklaşımı ile incelenmesi
Examination of user response states to information center services using a data mining approach
ENGİN DAYAN
Doktora
Türkçe
2025
İstatistikVan Yüzüncü Yıl Üniversitesiİstatistik Ana Bilim Dalı
PROF. DR. MAHMUT KARA
- Türkçe e-ticaret yorumlarında transformer tabanlı duygu analizi
Transformer-based sentiment analysis on Turkish e-commerce reviews
MUHAMMET ŞAMİL İKİZOĞLU
Yüksek Lisans
Türkçe
2026
Endüstri ve Endüstri Mühendisliğiİstanbul Teknik Üniversitesiİşletme Mühendisliği Ana Bilim Dalı
DOÇ. DR. TUNCAY ÖZCAN
- Mimarlıkta yapay zekâ araştırma eğilimlerinin veritabanları üzerinden haritalanması
Mapping research trends in artificial intelligence in architecture across databases
LIMA NAJJAR
Yüksek Lisans
Türkçe
2026
Bilim ve TeknolojiMimar Sinan Güzel Sanatlar ÜniversitesiEnformatik Ana Bilim Dalı
PROF. DR. BÜLENT ONUR TURAN
- Püskürtmeli kurutucuda trona çözeltisi ile yapılan desülfürizasyon çalışmaları ve CFD simülasyonu
Başlık çevirisi yok
S.CELAL KARAKAŞ
Yüksek Lisans
Türkçe
1998
Kimya Mühendisliğiİstanbul Teknik ÜniversitesiKimya Mühendisliği Ana Bilim Dalı
DOÇ. DR. GÜLHAYAT NASÜN (SAYGILI)
- Devrelerin büyük işaret cevaplarının bilgisayar yardımıyla bulunması
Başlık çevirisi yok
NÜKHET GÜNEYİ
Yüksek Lisans
Türkçe
1985
Elektrik ve Elektronik MühendisliğiUludağ ÜniversitesiElektrik-Elektronik Mühendisliği Ana Bilim Dalı
PROF. DR. ERGÜR TÜTÜNCÜOĞLU