Yapay zekâ ile üretilmiş metinlerin tespitine yönelik bert tabanlı bir sınıflandırma modeli geliştirilmesi
A bert-based classification model for the detection of ai-generated texts
- Tez No: 1018532
- Danışmanlar: DR. AHMET ANIL MÜNGEN
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Metin sınıflandırma, yapay zekâ, BERTurk, büyük dil modelleri, makine öğrenmesi, Derin öğrenme, Doğal dil işleme, Text classification, artificial intelligence, BERTurk, large language models, machine learning, Deep learning, Natural language processing, Text categorization
- Yıl: 2026
- Dil: Türkçe
- Üniversite: Ostim Teknik Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Yazılımı Ana Bilim Dalı
- Bilim Dalı: Bilgisayar Yazılımı Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
YAPAY ZEKÂ İLE ÜRETİLMİŞ METİNLERİN TESPİTİNE YÖNELİK BERT TABANLI BİR SINIFLANDIRMA MODELİ GELİŞTİRİLMESİ Bu tez çalışmasında, Türkçe metinlerde insan tarafından yazılmış içerikler ile büyük dil modelleri (LLM) tarafından üretilmiş metinlerin tespitine yönelik BERT tabanlı bir metin sınıflandırma modeli geliştirilmiştir. Çalışmanın önemi, yapay zekâ destekli metin üretim araçlarının yaygınlaşmasıyla birlikte özellikle akademik çalışmalarda ortaya çıkan özgünlük, güvenilirlik ve etik sorunlarına çözüm sunma gereksiniminden kaynaklanmaktadır. Araştırma kapsamında yaklaşık 9,5 milyon cümle düzeyinde örnekten oluşan geniş ölçekli bir veri havuzu oluşturulmuş; veri temizleme ve ön işleme adımlarının ardından farklı veri temsilleri, model yapılandırmaları ve eğitim stratejileri değerlendirilmiştir. Ayrıca BERTurk Cased, BERTurk Uncased, ELECTRA ve XLM-RoBERTa tabanlı modeller karşılaştırılmış; cümle bazlı temsilin daha kararlı bir öğrenme süreci sağladığı ve BERTurk Uncased modelinin en başarılı sonuçları verdiği belirlenmiştir. Bağımsız test kümesi üzerinde gerçekleştirilen değerlendirmelerde model %98,98 doğruluk ve 0,9897 Macro F1 skoru elde etmiştir. Hatalı sınıflandırmaların analizi, akademik ve bilgi aktarıcı insan metinleri ile doğal anlatım özellikleri taşıyan bazı yapay zekâ metinlerinin model açısından ayırt edilmesi güç örnekleri oluşturduğunu göstermiştir. Sonuçlar, Türkçe yapay zekâ metni tespitinde yalnızca model mimarisinin değil, veri temsili, veri temizliği ve veri havuzu tasarımının da başarı üzerinde belirleyici olduğunu ortaya koymaktadır.
Özet (Çeviri)
In this thesis, a BERT-based text classification model was developed to distinguish between human-written Turkish texts and texts generated by large language models (LLMs). The significance of this study stems from the growing need to address issues of originality, reliability, and ethics—particularly in academic writing—as AI-powered text generation tools become increasingly widespread. Within the scope of the research, a large-scale dataset consisting of approximately 9.5 million sentence-level samples was constructed. Following data cleaning and preprocessing, different data representations, model configurations, and training strategies were evaluated. In addition, models based on BERTurk Cased, BERTurk Uncased, ELECTRA, and XLM-RoBERTa were compared. The findings revealed that sentence-level representation provided a more stable learning process, while the BERTurk Uncased model achieved the best overall performance. Evaluations conducted on an independent test set demonstrated that the proposed model achieved an accuracy of 98.98% and a Macro F1 score of 0.9897. Analysis of misclassified instances indicated that academic and informational human-written texts, as well as certain AI-generated texts exhibiting natural writing characteristics, were challenging cases to distinguish. The results demonstrate that, in addition to model architecture, data representation, data cleaning, and dataset design play a decisive role in the success of Turkish AI-generated text detection.
Benzer Tezler
- Türkçe metinlerde aldatıcı beyan tespitine yönelik doğal dil işleme tabanlı hibrit model geliştirilmesi ve sektörel bir uygulama
Development of a natural language processing based hybrid model for detection of deceptive statements in Turkish texts and a sectoral application
EKİN AKKOL
Doktora
Türkçe
2025
Yönetim Bilişim SistemleriDokuz Eylül ÜniversitesiYönetim Bilişim Sistemleri Ana Bilim Dalı
PROF. DR. YILMAZ GÖKŞEN
- Derin öğrenme yöntemleriyle otomatik olarak üretilmiş sahte metin özetlerinin tespiti
Detection of automatically generated fake text summaries using deep learning methods
İSMAİL ÖNER
Yüksek Lisans
Türkçe
2026
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolFırat ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. ERDAL ÖZBAY
- Buğdayda farklı melezleme teknikleri kullanarak tohum tutma oranının saptanılması
Başlık çevirisi yok
İSMAİL TÜZÜN
Yüksek Lisans
Türkçe
1986
ZiraatUludağ ÜniversitesiTarla Bitkileri Ana Bilim Dalı
PROF. DR. HALİS RUHİ EKİNGEN
- Sivas yöresinde akraba evliliği yapan ve yapmayan çiftlerde dermatoglifik benzerlikler
Similarities of dermataoglyphies among individval of married relatives and married couples not related to each other in Sivas region
Y. SELMA SÜNGÜ
Yüksek Lisans
Türkçe
1984
Tıbbi BiyolojiCumhuriyet ÜniversitesiTıbbi Biyoloji ve Genetik Ana Bilim Dalı
YRD. DOÇ. DR. İLHAN SEZGİN
- Akaryakıtla çalışan endüstriyel tav fırınlarında yanma, sıcaklık ve basıncın optimum kontrolu
Optimum control of combustion temperature and pressure in industrial tempering furnaces working with fuel-oil
MEHMET EROĞLU
Yüksek Lisans
Türkçe
1987
Makine MühendisliğiGazi ÜniversitesiMakine Mühendisliği Ana Bilim Dalı
PROF. DR. YÜCEL ERCAN