Multi-cue skeleton-based sign language recognition
Çoklu ipucu iskelet tabanlı işaret dili tanıma
- Tez No: 972019
- Danışmanlar: PROF. DR. LALE AKARUN, DR. ÖĞR. ÜYESİ İNCİ MELİHA BAYTAŞ
- Tez Türü: Doktora
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Derin öğrenme, El tanıma, Grafik sinir ağları, Görüntü tanıma, Örüntü tanıma, İnsan hareketi, Deep learning, Hand recognition, Graph neural networks, Image recognition, Pattern recognition, Human motion
- Yıl: 2025
- Dil: İngilizce
- Üniversite: Boğaziçi Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
İşaret dilleri, dilsel anlamı iletmek için birden fazla görsel artikülatöre dayanan kapsamlı ve doğal diller olarak gelişmiştir. Bu diller, küresel ölçüde işitme engelli topluluklarının iletişim aracı olarak hizmet ederek işaret dilini bilmeyen kişilerle zengin ve karmaşık etkileşimleri sağlamaktadırlar. İşaret dillerinde bir işaret, manuel (el şekilleri ve işmarları) ve manuel olmayan (yüz ifadeleri) görsel ipuçları ile ifade edilir. Ancak, işaret dillerinin eş zamanlı olmayan ve çoklu ipucu özellikleri Otomatik İşaret Dili Tanıma sistemleri için zorluklar yaratmaktadır. Bu tezde, yalıtılmış işaret dili tanıma problemini çoklu görsel ipuçları ile modellemek için Uzamsal-Zamansal Çizge Evrişimsel Ağları ve Uzun Kısa-Vadeli Hafıza Ağları tabanlı birleştirme yöntemi önerilmiştir. Önerilen yöntem her zaman adımında manuel ve manuel olmayan görsel işaret dili ipuçlarını birleştirerek BosphorusSign22k ve AUTSL veri kümelerinde tanıma başarımını iyileştirmektedir. Sonrasında, bölgeye özgü el topolojileri incelenmiş ve el iskelet eklemleri arasındaki farklı bağlantıların işaret detaylarını daha etkili bir şekilde yakalayarak tüm vucüt topolojilerine kıyasla başarılı olduğu görülmüştür. Ek olarak, tekli ve çoklu görsel işaret dili ipucu senaryolarında yorumlanabilirliği artırmak amacıyla öz-dikkat ve çapraz-dikkat katmanları kullanılmıştır. Öz-dikkat katmanı görsel işaret dili ipuçları içerisindeki önemli zamansal parçaları belirlediği, Çapraz-dikkat katmanının ise birden fazla ipucu arasındaki dinamik etkileşimleri öğrendiği gözlemlenmiştir. Dikkat katmanınlarını analizi ile artikülatörlerin tek başlarına doğru tanımaya tamamlayıcı bir katkısı olduğu görülmüştür. Bu çalışma, çoklu ipucu birleştirme, bölgeye özgü el iskeleti yapılandırması ve dikkat tabanlı yorumlanabilirliğin yalıtılmış işaret dili tanıma sistemlerinin ilerlemesine sağladığı katkıları vurgulamıştır.
Özet (Çeviri)
Sign languages (SL) have developed into comprehensive and natural languages that rely on multiple visual articulators to convey linguistic meaning. Their role serves as the communication medium for Deaf communities globally, facilitating rich and complex interactions among signers. Automatic Sign Language Recognition (ASLR) is crucial to lower the communication barrier between signers and non-signers. Sign languages combine manual (e.g., hand shapes and gestures) and non-manual (e.g., facial expressions) visual SL cues to express meaning. However, the asynchronous and multi-cue characteristics present unique challenges for ASLR. This dissertation addresses Isolated Sign Language Recognition (SLR) by leveraging Spatio-Temporal Graph Convolutional Networks (ST-GCNs) and LSTM-based fusion to model visual cues. Our Multi-Cue LSTM framework merges manual and non-manual visual SL cues at each time step, improving recognition on the BosphorusSign22k and AUTSL datasets. We further explore domain-driven hand graph topologies within ST-GCNs, and demonstrate that domain-guided connections among hand skeleton joints effectively capture subtle sign details, outperforming larger full-body graph topologies. Moreover, we utilize self-attention and cross-attention mechanisms to improve interpretability in single- and multi-cue scenarios. While self-attention identifies essential temporal segments within a visual SL cue, cross-attention learns the dynamic interactions between manual and non-manual cues. We analyze attention scores to show how individual articulators complementarily influence accurate predictions. Our contributions highlight the benefits of multi-cue integration, domain-driven hand skeleton configurations, and attention-based interpretability in advancing isolated SLR and improving the robustness of SLR systems.
Benzer Tezler
- Addressing class imbalance, label uncertainty, and crispness in edge detection
Kenar tespitinde sınıf dengesizliği, etiket belirsizliği ve kenar keskinliğinin ele alınması
BEDRETTİN ÇETİNKAYA
Doktora
İngilizce
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolOrta Doğu Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. EMRE AKBAŞ
PROF. DR. SİNAN KALKAN
- Eymir-Mogan gölleri arasında yeraltı suyu akım ve kütle taşınım modeli
Groundwater flow and solute transport model between Eymir and Mogan lakes (Ankara)
ERKAN DİŞLİ
Doktora
Türkçe
2007
Jeoloji MühendisliğiHacettepe ÜniversitesiJeoloji (hidrejeoloji) Mühendisliği Ana Bilim Dalı
Y.DOÇ.DR. LEVENT TEZCAN
- Şalkon içeren yeni karbazol türevlerinin sentezi ve karakterizasyonları
Synthesis and characterization of new carbazole derivatives with chalcone
RÜMEYSA CAN
- Score level multi cue fusion for sign language recognition
İşaret dili tanıma için sonuç seviyesinde çoklu ipucu kaynaşımı
ÇAĞRI GÖKÇE
Yüksek Lisans
İngilizce
2020
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolBoğaziçi ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. LALE AKARUN ERSOY
- Individual differences in performance on perceptual multiple cue probability learning tasks
Çoklu işaret olasılıksal öğrenme görevlerinin performansında kişisel farklılıklar
MUSTAFA BAYINDIR
Doktora
İngilizce
2013
Savunma ve Savunma TeknolojileriOrta Doğu Teknik ÜniversitesiBilişsel Bilim Ana Bilim Dalı (disiplinlerarası)
PROF. DR. KÜRŞAT ÇAĞILTAY
DR. FERGUS BOLGER