Hybrideyenet: Çoklu akışlı özellik füzyonu ile göz tabanlı zamansal-uzamsal deepfake tespiti
Hybrideyenet: Eye-based spatio-temporal deepfake detection with multi-stream feature fusion
- Tez No: 1010001
- Danışmanlar: DR. ÖĞR. ÜYESİ RAMİN ABBASZADİ
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: Türkçe
- Üniversite: Ostim Teknik Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Fen Bilimleri Ana Bilim Dalı
- Bilim Dalı: Yazılım Mühendisliği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Derin öğrenme ve video üretim araçlarındaki hızlı ilerleme, deepfake olarak bilinen son derece gerçekçi biçimde manipüle edilmiş videoların üretilmesini mümkün kılmıştır. Yaratıcı kullanım alanları bulunsa da bu içerikler yanlış bilgilendirme, dolandırıcılık ve kimlik suistimali gibi zararlı amaçlarla da kullanılabilmektedir. Üretimin ucuz ve erişilebilir hale gelmesiyle birlikte, yalnızca insan gözüne dayanarak bir videonun gerçekliğini değerlendirmek giderek zorlaşmış ve otomatik tespit sistemlerine yönelik pratik bir ihtiyaç doğmuştur. Bu tez, tam yüz bağlamını korurken göz bölgesine odaklanan HybridEyeNet adlı bir deepfake video tespit sistemi sunmaktadır. Sistem iki aşamadan oluşur: ön işleme ve tespit. Ön işleme aşamasında her video sabit örnekleme hızında çözülür ve dört senkronize akışa dönüştürülür: hizalanmış yüz kırpımı, sol göz kırpımı, sağ göz kırpımı ve işaret nokta tabanlı yüz maskesinden türetilen yüz sınır halkası temsili. Tespit aşamasında hafif CNN kodlayıcılar kare düzeyinde özellikler çıkarır; öğrenilmiş kapılama mekanizması akışları uyarlanabilir ağırlıklarla birleştirir ve zamansal modül video için tek bir tahmin üretir. Deneyler FaceForensics++ üzerinde (orijinal vs. Deepfakes) ikili ayarda yapılmış; en iyi model doğrulamada 0.9507 AUC ve testte 0.9376 AUC elde etmiştir. JPEG yeniden sıkıştırma, bulanıklaştırma ve yeniden boyutlandırma altında da performans korunmuş (AUC ≈0.92–0.93) ve ablation sonuçları ayırt edici sinyalin büyük ölçüde göz akışlarından geldiğini göstermiştir.
Özet (Çeviri)
Rapid progress in deep learning and video generation tools has made it possible to create highly realistic manipulated videos, commonly known as deepfakes. These videos can be used for creative purposes in media production and advertising, but they can also be abused for misinformation, fraud, and identity misuse. As deepfake generation becomes cheaper and easier to access, it is increasingly difficult to judge whether a video is authentic using only the human eye, creating a need for detection systems that can verify whether a given video is real or manipulated. In this thesis, we present HybridEyeNet, a deepfake video detection system that focuses on the eye region while keeping full-face context. HybridEyeNet has two stages: preprocessing and detection. In preprocessing, each input video is decoded at a fixed sampling rate into four synchronized streams: an aligned face crop, left-eye crop, right-eye crop, and a facial boundary ring representation derived from a landmark-based face mask. In detection, lightweight CNN encoders learn frame-level features, a learned gating mechanism fuses the streams with adaptive importance weights, and a temporal module aggregates information across time to produce a single prediction for the whole video. Experiments are conducted on FaceForensics++ in a binary setting (original vs. Deepfakes). The best model achieves a validation AUC of 0.9507 and a test AUC of 0.9376. Under common video degradations (JPEG recompression, blur, and resize), AUC stays around 0.92–0.93, and ablation results show that the discriminative signal comes largely from the eye streams.