Financial manipulation detection on social media using natural language processing techniques
Doğal dil işleme teknikleri kullanılarak sosyal medyada finansal manipülasyon tespiti
- Tez No: 981309
- Danışmanlar: DOÇ. DR. CEMAL OKAN ŞAKAR
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: İngilizce
- Üniversite: Bahçeşehir Üniversitesi
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Büyük Veri Analitiği ve Yönetimi Ana Bilim Dalı
- Bilim Dalı: Büyük Veri Analitiği ve Yönetimi Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Son yıllarda sosyal medya platformları, kamuoyunun düşüncelerini, siyasi eğilimlerini ve finansal piyasa trendlerini anlamak amacıyla önemli veri kaynaklarına evrilmiştir. Twitter ise, anlık paylaşımlar ve yüksek etkileşim kapasitesi sayesinde, finansal bilgilerin hem doğru hem de manipülatif olanlarının, hızla yayılmasında önemli bir rol oynamaktadır. Bu çalışmada Türkçe tweet'ler üzerinde finansal manipülasyon içeren içeriklerin otomatik olarak tespit edilmesi amaçlanmıştır. Bu sayede daha güvenilir bir finans ortamı sağlama hedefine katkı sağlanılması hedeflenmektedir. Çalışma kapsamında, Ekim, Kasım, Aralık 2023 döneminde Twitter'dan toplanan 136,794 adet Türkçe tweet kullanılmıştır. Tweet'ler, içerik özelliklerine göre üç farklı sınıfa Manipülatif (Manipulative), Junk (Gereksiz), Talk (Sohbet) ayrılarak etiketlenmiştir. Farklı adette etiketli veri örnekleriyle LLM ile veri zenginleştirilmesi de uygulanarak çeşitli deneyler yapılmış her bir sınıf için farklı tahmin başarı oranları hesaplanmıştır. Tweet'ler Türkçe'ye özel bir eğitime tabii tutulmuş arka planda transformer mimarisine sahip bir BERT modeli ile eğitim gerçekleştirilmiştir. Modellerin başarısı doğruluk, F1 skoru, kesinlik (precision) ve duyarlılık (recall) ölçütleriyle değerlendirilmiştir. Elde edilen sonuçlar, alanında uzmanlaşmış kişiler tarafından dikkatli şekilde etiketlenmiş verilerle eğitilen derin öğrenme modellerinin, finansal manipülasyon içeren paylaşımları etkili bir şekilde tespit edebildiğini göstermektedir. Bu çalışma yeterli düzeyde etiketlenmiş veri ve doğru modelleme teknikleri kullanıldığında sosyal medya içeriklerini kullanarak anlamlı finansal analizler yapılabileceğini göstermektedir. Ayrıca çalışma LLM'lerin de bu analizleri kolaylaştırıcı etkisini gözler önüne sermektedir. Bu tez çalışması, sosyal medyada yer alan manipülatif finansal içeriklerin erken tespitine yönelik bir yaklaşım sunmakta ve hem Türkçe dilindeki doğal dil işleme uygulamalarına hem de sermaye piyasalarına yönelik gözetim faaliyetlerine katkı sunmayı hedeflemektedir.
Özet (Çeviri)
In recent years, social media platforms have become important data sources for understanding public opinion, political trends, and financial market movements. Among them, Twitter plays a key role in the rapid spread of financial information—both accurate and misleading—thanks to its real-time sharing and high engagement potential. This study aims to automatically detect financially manipulative content in Turkish tweets. The goal is to contribute to a more financial environment. For this purpose, a dataset of 136,794 Turkish-language tweets collected from Twitter during October, November, and December 2023 was used. Tweets were manually labeled into three categories based on their content: Manipulative, Junk, and Talk. Various experiments were conducted, including data enrichment with Large Language Models (LLMs), using different sample sizes. A BERT-based deep learning model, pre-trained specifically for Turkish and built on transformer architecture, was used for classification. The model's performance was evaluated using standard metrics: accuracy, F1-score, precision, and recall. The results show that deep learning models trained on carefully labeled data by domain experts can effectively detect financially manipulative tweets. The findings also demonstrate that, with well-prepared data and proper modeling techniques, social media content can be a valuable resource for financial analysis. Additionally, the study highlights how LLMs can enhance classification performance through data augmentation. Overall, this thesis offers a method for the early detection of manipulative financial content on social media. It aims to contribute both to Turkish natural language processing research and to the development of smarter monitoring systems for capital markets.
Benzer Tezler
- A new framework for decentralized social networks: Harnessing blockchain, deep learning, and natural language processing
Merkezsiz sosyal ağlar için yeni bir çerçeve: Blok zinciri, derin öğrenme ve doğal dil işlemeyi kullanmak
AMIR AL KADAH
Yüksek Lisans
İngilizce
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSakarya ÜniversitesiYazılım Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ DENİZ BALTA
- Menkul kıymet yatırımları açısından sermaye piyasası kanununa göre yayınlanan finansal tablo ve raporların yeterliliği
Başlık çevirisi yok
HAMDİ AYDIN