Geri Dön

Multimodal representation learning for synchronized speech and videos

Eşzamanlı konuşma ve video için çok kipli gösterim öğrenimi

  1. Tez No: 652185
  2. Yazar: ÖYKÜ DENİZ KÖSE
  3. Danışmanlar: PROF. DR. MURAT SARAÇLAR
  4. Tez Türü: Yüksek Lisans
  5. Konular: Elektrik ve Elektronik Mühendisliği, Electrical and Electronics Engineering
  6. Anahtar Kelimeler: Derin öğrenme, Ses işleme, Çoklu modsal betimlemeler, Deep learning, Speech processing, Multimodal representation
  7. Yıl: 2020
  8. Dil: İngilizce
  9. Üniversite: Boğaziçi Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Elektrik-Elektronik Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Son yıllarda gelişen teknoloji ile birlikte çoğulortam veri miktarı hızlı bir şekilde artmaktadır. Bu artış çoklu veri kipleri için sinir ağları ile yapılan çalışmaları olanaklı kılsa da, verimli bir şekilde veri saklanımını ve geri getirimini önemli bir ihtiyaç haline getirmektedir. Bu tezde, çoklu veri kiplerinden faydalanmanın sağladığı yararları araştırmak için çeşitli veri kaynaştırma yöntemleri sunulmaktadır. Sunulan veri kaynaştırma yöntemleri sistemde kaynaşımın yapıldığı aşamaya göre farklılık göstermektedir. Ayrıca, veri saklanımı ve geri getirimi amacıyla veri altbirimleri için gösterim öğrenim sistemleri incelenmiştir. Bu gösterimler temsil ettikleri veri altbirimleri arasındaki belirlenmiş bir uzaklık metriğine göre hesaplanan uzaklığı yansıtacak şekilde oluşturulmuştur. Olası bir başarım artışı için bileşik gösterim ve uzaklık metriği öğrenimi problemi de irdelenmiştir. Gösterim öğrenimi ve veri kaynaştırma amacıyla derin sinir ağlarından faydalanılmıştır ve bu problemlerin başarım ölçümleri sırasıyla aynı-farklı kelime ayrımsaması ve sesbirim sınıflandırılmasıyla yapılmıştır. Deneylerde iki farklı veri kümesinden faydalanışmıştır: USC-TIMIT rtMRI ve Türk işaret dili haber bültenleri. Elde edilen deney sonuçları veri kaynaştırmanın faydalarını ortaya koyarken, aynı zamanda bu kaynaşımın erken safhalarda yapılmasının daha da iyi sonuçlar getirdiğini göstermektedir. Aynı zamanda, gösterim öğrenimi için sunulan yöntemler, aynı problem için daha önce kullanılmış temel sistemlerden fark edilebilir derecede daha iyi başarımlar sağlamıştır. Bu nedenle, video ve konuşma işaretlerinin altbirimleri için öğrenilmiş bu gösterimler çapraz kipli verilerin geri getirimi için önemli bir adım olarak kabul edilebilir.

Özet (Çeviri)

The amount of multimedia data has been increased rapidly in recent years. While this data growth enables multimodal neural network based studies, it has also resulted in a need for efficient storage and retrieval systems for multimodal data. In this thesis, different data fusion schemes are examined to see the benefits of the use of different data sources. Proposed fusion schemes differ in their stages in which the data fusion is performed. Additionally, several representation learning methods are investigated for efficient data storage and retrieval systems. Representations are generated in such a way that they reflect the distance between the represented data segments according to a certain distance metric. A joint representation and distance metric learning scheme is also considered for a performance gain. Several deep neural network models are designed for representation learning and data fusion, and their performances are evaluated with the same-different word-discrimination and phone classification tasks, respectively. Experiments are performed on two different multimodal data sets; USC-TIMIT rtMRI and Signed Turkish broadcast news. Outcomes of the experiments show that the data fusion indeed brings a performance improvement over unimodal approaches, and performing fusion in earlier stages yields better results than fusing the data in later stages. Additionally, the proposed methods for the representation learning outperform the corresponding baseline systems in the same-different word-discrimination task. Therefore, generated representations of video and audio segments can be considered as an important step towards a fast cross-modal query-by-sign search system.

Benzer Tezler

  1. Social behavior learning for an assistive companion robot

    Yardımcı robotlar için sosyal davranış öğrenimi

    PINAR ULUER

    Doktora

    İngilizce

    İngilizce

    2023

    Mühendislik Bilimleriİstanbul Teknik Üniversitesi

    Mekatronik Mühendisliği Ana Bilim Dalı

    PROF. DR. HATİCE KÖSE

  2. Automatic deceit detection through multimodal analysis of speech videos

    Konuşma videolarının çok-kipli analiziyle otomatik aldatma tespiti

    BERAT BİÇER

    Yüksek Lisans

    İngilizce

    İngilizce

    2022

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİhsan Doğramacı Bilkent Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ HAMDİ DİBEKLİOĞLU

  3. Discovering discriminative and class-specific sequence and structural motifs in proteins

    Proteinler içinde sınıflandırıcı dizisel ve yapısal motiflerin keşfedilmesi

    CEM MEYDAN

    Doktora

    İngilizce

    İngilizce

    2013

    BiyomühendislikSabancı Üniversitesi

    PROF. DR. OSMAN UĞUR SEZERMAN

  4. Perspectives on identity representation in intermediate level English language teaching coursebooks used in Turkey

    Türkiyede kullanılan orta düzey İngilizce ders kitaplarında kimlik gösterimlerinin incelenmesi

    DEVRİM GÜNAY

    Doktora

    İngilizce

    İngilizce

    2012

    Dilbilimİstanbul Üniversitesi

    Yabancı Diller Eğitimi Ana Bilim Dalı

    PROF. DR. TÜLİN POLAT

  5. Land cover and land use classification of multi-modal high-resolution satellite images using multi-task deep learning approach

    Çok görevli derin öğrenme tekniği ile çok kipli yüksek çözünürlüklü uydu görüntülerinin arazi örtüsü ve arazi kullanımı sınıflandırılması

    BURAK EKİM

    Yüksek Lisans

    İngilizce

    İngilizce

    2021

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    İletişim Sistemleri Ana Bilim Dalı

    PROF. DR. ELİF SERTEL