Geri Dön

Multi-cue skeleton-based sign language recognition

Çoklu ipucu iskelet tabanlı işaret dili tanıma

  1. Tez No: 972019
  2. Yazar: OĞULCAN ÖZDEMİR
  3. Danışmanlar: PROF. DR. LALE AKARUN, DR. ÖĞR. ÜYESİ İNCİ MELİHA BAYTAŞ
  4. Tez Türü: Doktora
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Derin öğrenme, El tanıma, Grafik sinir ağları, Görüntü tanıma, Örüntü tanıma, İnsan hareketi, Deep learning, Hand recognition, Graph neural networks, Image recognition, Pattern recognition, Human motion
  7. Yıl: 2025
  8. Dil: İngilizce
  9. Üniversite: Boğaziçi Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

İşaret dilleri, dilsel anlamı iletmek için birden fazla görsel artikülatöre dayanan kapsamlı ve doğal diller olarak gelişmiştir. Bu diller, küresel ölçüde işitme engelli topluluklarının iletişim aracı olarak hizmet ederek işaret dilini bilmeyen kişilerle zengin ve karmaşık etkileşimleri sağlamaktadırlar. İşaret dillerinde bir işaret, manuel (el şekilleri ve işmarları) ve manuel olmayan (yüz ifadeleri) görsel ipuçları ile ifade edilir. Ancak, işaret dillerinin eş zamanlı olmayan ve çoklu ipucu özellikleri Otomatik İşaret Dili Tanıma sistemleri için zorluklar yaratmaktadır. Bu tezde, yalıtılmış işaret dili tanıma problemini çoklu görsel ipuçları ile modellemek için Uzamsal-Zamansal Çizge Evrişimsel Ağları ve Uzun Kısa-Vadeli Hafıza Ağları tabanlı birleştirme yöntemi önerilmiştir. Önerilen yöntem her zaman adımında manuel ve manuel olmayan görsel işaret dili ipuçlarını birleştirerek BosphorusSign22k ve AUTSL veri kümelerinde tanıma başarımını iyileştirmektedir. Sonrasında, bölgeye özgü el topolojileri incelenmiş ve el iskelet eklemleri arasındaki farklı bağlantıların işaret detaylarını daha etkili bir şekilde yakalayarak tüm vucüt topolojilerine kıyasla başarılı olduğu görülmüştür. Ek olarak, tekli ve çoklu görsel işaret dili ipucu senaryolarında yorumlanabilirliği artırmak amacıyla öz-dikkat ve çapraz-dikkat katmanları kullanılmıştır. Öz-dikkat katmanı görsel işaret dili ipuçları içerisindeki önemli zamansal parçaları belirlediği, Çapraz-dikkat katmanının ise birden fazla ipucu arasındaki dinamik etkileşimleri öğrendiği gözlemlenmiştir. Dikkat katmanınlarını analizi ile artikülatörlerin tek başlarına doğru tanımaya tamamlayıcı bir katkısı olduğu görülmüştür. Bu çalışma, çoklu ipucu birleştirme, bölgeye özgü el iskeleti yapılandırması ve dikkat tabanlı yorumlanabilirliğin yalıtılmış işaret dili tanıma sistemlerinin ilerlemesine sağladığı katkıları vurgulamıştır.

Özet (Çeviri)

Sign languages (SL) have developed into comprehensive and natural languages that rely on multiple visual articulators to convey linguistic meaning. Their role serves as the communication medium for Deaf communities globally, facilitating rich and complex interactions among signers. Automatic Sign Language Recognition (ASLR) is crucial to lower the communication barrier between signers and non-signers. Sign languages combine manual (e.g., hand shapes and gestures) and non-manual (e.g., facial expressions) visual SL cues to express meaning. However, the asynchronous and multi-cue characteristics present unique challenges for ASLR. This dissertation addresses Isolated Sign Language Recognition (SLR) by leveraging Spatio-Temporal Graph Convolutional Networks (ST-GCNs) and LSTM-based fusion to model visual cues. Our Multi-Cue LSTM framework merges manual and non-manual visual SL cues at each time step, improving recognition on the BosphorusSign22k and AUTSL datasets. We further explore domain-driven hand graph topologies within ST-GCNs, and demonstrate that domain-guided connections among hand skeleton joints effectively capture subtle sign details, outperforming larger full-body graph topologies. Moreover, we utilize self-attention and cross-attention mechanisms to improve interpretability in single- and multi-cue scenarios. While self-attention identifies essential temporal segments within a visual SL cue, cross-attention learns the dynamic interactions between manual and non-manual cues. We analyze attention scores to show how individual articulators complementarily influence accurate predictions. Our contributions highlight the benefits of multi-cue integration, domain-driven hand skeleton configurations, and attention-based interpretability in advancing isolated SLR and improving the robustness of SLR systems.

Benzer Tezler

  1. Addressing class imbalance, label uncertainty, and crispness in edge detection

    Kenar tespitinde sınıf dengesizliği, etiket belirsizliği ve kenar keskinliğinin ele alınması

    BEDRETTİN ÇETİNKAYA

    Doktora

    İngilizce

    İngilizce

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolOrta Doğu Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. EMRE AKBAŞ

    PROF. DR. SİNAN KALKAN

  2. Eymir-Mogan gölleri arasında yeraltı suyu akım ve kütle taşınım modeli

    Groundwater flow and solute transport model between Eymir and Mogan lakes (Ankara)

    ERKAN DİŞLİ

    Doktora

    Türkçe

    Türkçe

    2007

    Jeoloji MühendisliğiHacettepe Üniversitesi

    Jeoloji (hidrejeoloji) Mühendisliği Ana Bilim Dalı

    Y.DOÇ.DR. LEVENT TEZCAN

  3. Şalkon içeren yeni karbazol türevlerinin sentezi ve karakterizasyonları

    Synthesis and characterization of new carbazole derivatives with chalcone

    RÜMEYSA CAN

    Yüksek Lisans

    Türkçe

    Türkçe

    2022

    KimyaSakarya Üniversitesi

    Kimya Ana Bilim Dalı

    PROF. DR. ARİF BARAN

  4. Score level multi cue fusion for sign language recognition

    İşaret dili tanıma için sonuç seviyesinde çoklu ipucu kaynaşımı

    ÇAĞRI GÖKÇE

    Yüksek Lisans

    İngilizce

    İngilizce

    2020

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolBoğaziçi Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. LALE AKARUN ERSOY

  5. Individual differences in performance on perceptual multiple cue probability learning tasks

    Çoklu işaret olasılıksal öğrenme görevlerinin performansında kişisel farklılıklar

    MUSTAFA BAYINDIR

    Doktora

    İngilizce

    İngilizce

    2013

    Savunma ve Savunma TeknolojileriOrta Doğu Teknik Üniversitesi

    Bilişsel Bilim Ana Bilim Dalı (disiplinlerarası)

    PROF. DR. KÜRŞAT ÇAĞILTAY

    DR. FERGUS BOLGER