Multilingual, multimodal and explainable approaches for automated fact-checking problem
Otomatik doğrulama problemi için çok dilli, çok modlu ve açıklanabilir yaklaşımlar
- Tez No: 921223
- Danışmanlar: PROF. DR. PINAR KARAGÖZ
- Tez Türü: Doktora
- Konular: Dilbilim, Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Linguistics, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: İngilizce
- Üniversite: Orta Doğu Teknik Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Otomatik doğruluk kontrolü yöntemleri, ağırlıklı olarak içerik tabanlı yaklaşımlara dayanmakta ve tahmin için metinden sofistike özellikler çıkarmak üzere derin sinir ağlarını kullanmaktadır. Ancak, bu modellerin doğası gereği kara kutu oluşu, karar verme süreçlerinin anlaşılmasını zorlaştırmaktadır. Otomatik doğruluk kontrolü modelleri için bir diğer zorluk, dil spesifik verilere olan bağımlılıklarıdır ve eğitim için mevcut çok dilli veri kümeleri sınırlıdır. Ayrıca, sahte gönderilerin metin, görseller ve konuşma gibi çok modlu yapısı ek bir zorluk teşkil etmektedir. Bu tez, otomatik doğruluk kontrolü araştırmalarını ele alarak iddiaların doğruluklarını tahmin etmeyi hedeflemekte ve doğruluk kontrolü ile alaycılık tespiti için açıklanabilir çözümler geliştirmeye katkı sağlamaktadır. Çok görevli öğrenme ve nedensel çıkarım yoluyla açıklanabilir modeller önermekte, düşük kaynaklı diller için çapraz dilli aktarım yoluyla öğrenimini değerlendirmekte ve son dönemdeki Görsel-Dil Modellerining (GDM) doğruluk kontrolü için metin ve görsel bilgiyi nasıl kullandığını incelemekteyiz. Çok görevli öğrenme yaklaşımımız, metin özetleme ve doğruluk tahmini için eğitilmiş T5 tabanlı bir kodlayıcı-çözücü modelini içermektedir; oluşturulan özetler, tahmin edilen doğruluk etiketleri için açıklamalar olarak kullanılmaktadır. Ayrıca, Türkçe bir doğruluk kontrolü veri kümesi yayımlanmış ve veri yetersizliğini ele almak için transfer öğrenimi ve makine çevirisi kullanılarak deneyler gerçekleştirilmiştir. Çok modluluk bağlamında, GDM'nin metin ve görsel bilgiyi temsil etme etkinliğini araştırmakta ve çok modlu gömme yöntemlerinin genelde performansı artırmasına rağmen, yalnızca metin veya yalnızca görsel tabanlı modellerin sıklıkla daha iyi sonuç verdiğini bulmaktayız. Son olarak, metin analizinde nedensel çıkarımı uygulayarak alaycı dilsel özelliklerin ve noktalamanın metin popülerliği üzerindeki etkisini incelemekte ve ironi ve popülerlik hakkında örtük bilgileri ortaya çıkarmak için kümeleme ve konu modellemeyi kullanmaktayız.
Özet (Çeviri)
Automated fact-checking methods primarily rely on content-based approaches, utilizing deep neural networks to extract sophisticated features from text for prediction. However, the inherently black-box nature of these models makes their decision-making processes challenging to interpret. Another challenge for automated fact-checking models is their dependence on language-specific data, with limited multilingual datasets available for training. Moreover, the multimodal nature of fake posts—including text, images, and speech—presents an additional challenge. This thesis addresses automated fact-checking research, aiming to predict the veracity of claims while extending contributions to explainable solutions for fact-checking and sarcasm detection. We propose explainable models through multi-task learning and causal inference, evaluate cross-lingual transfer learning for low-resource languages, and examine how recent VLMs utilize text and image information for fact-checking. Our multi-task learning approach involves a T5-based encoder-decoder model trained for text summarization and veracity prediction, with generated summaries serving as explanations for predicted veracity labels. Moreover, a Turkish fact-checking dataset is released and experiments are conducted using transfer learning and machine translation to address data scarcity. In multimodality, we investigate VLMs' effectiveness in representing text and image information, finding that while multimodal embeddings generally enhance performance, discrete text-only and image-only models often outperform them. Lastly, we apply causal inference to text analysis, examining how sarcastic linguistic features and punctuation impact text popularity and leveraging clustering and topic modeling to uncover latent information on irony and popularity.
Benzer Tezler
- Üretim kaynakları planlaması
Manufacturing resources planning
SUAT ÇELEBİ
Yüksek Lisans
Türkçe
1997
Endüstri ve Endüstri Mühendisliğiİstanbul Teknik ÜniversitesiEndüstri Mühendisliği Ana Bilim Dalı
DOÇ. DR. MEHMET TANYAŞ
- Ziya Gökalp`in bilim ve siyaset anlayışı
Ziya Gökalp`s science and politic approach
BİLAL DUMAN
Yüksek Lisans
Türkçe
1998
SosyolojiSüleyman Demirel ÜniversitesiSosyoloji Ana Bilim Dalı
YRD. DOÇ. DR. KAMİL KAYA
- Ottoman legacy and Turkish foreign policy: Turkey`s identity and the Balkan policy
Osmanlı mirası ve Türk dış politikası: Türkiye`nin kimliği ve Balkan politikası
H. İBRAHİM ERBİR
Yüksek Lisans
İngilizce
2002
Uluslararası İlişkilerOrta Doğu Teknik ÜniversitesiUluslararası İlişkiler Ana Bilim Dalı
DOÇ. DR. A. NURİ YURDUSEV
- Contrastive analysis monolingual and multilingual vontexts: A study of error samples in the written production of Turkish and Kosovan learners of English
Tekdili ve çokdili çevresel şartlarda karşılaştırmalı inceleme: Türk ve Kosovalı İngilizce öğrenenlerin yazılı ürünlerinde hata örneklerinin incelenmesi
MİRANDA KARJAGDİU
Yüksek Lisans
İngilizce
2003
İngiliz Dili ve Edebiyatıİstanbul Üniversitesiİngiliz Dili Eğitimi Ana Bilim Dalı
YRD. DOÇ. DR. ALEV BULUT