Geri Dön

Domain generalized remote sensing scene captioning via country-level geographic information

Ülke düzeyinde coğrafi bilgilerle alan genelleştirilmiş uzaktan algılama sahne altyazılama

  1. Tez No: 972485
  2. Yazar: KEREM AYDIN
  3. Danışmanlar: PROF. DR. ERCHAN APTOULA
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2025
  8. Dil: İngilizce
  9. Üniversite: Sabancı Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Veri Bilimi Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu tez, optik uzaktan algılama görüntülerinin altyazılanması (captioning) amacıyla ince ayar yapılan büyük ölçekli bir görsel-dil modeline ülke düzeyinde metin tabanlı coğrafi bilginin dahil edilmesinin etkisini araştırmaktadır. Görsel girdilerin karşılık gelen coğrafi bağlamla zenginleştirilmesinin, özellikle daha önce görülmemiş ülke veya kıtalardan gelen görüntülere genelleme yapma konusunda model performansını artırabileceği hipotezini öne sürüyoruz. Bu amacı test etmek için, Large Language and Vision Assistant (LLaVA) modeli Avrupa ülkelerine ait optik uydu görüntüleri ve bunlara ait metinsel coğrafi açıklamalarla birlikte ince ayarlandı ve farklı kıtalardan gelen görüntüler üzerinde değerlendirildi. 175 ülkeyi kapsayan ve yeni yayımlanan SkyScript veri kümesi üzerinde yürütülen deneyler, Wikipedia gibi kaynaklardan elde edilen basit coğrafi bağlamın bile ülkeler arası alan farklılıklarını azaltarak altyazılama doğruluğunda kayda değer iyileşmelere yol açtığını ortaya koymaktadır. Bu bulgular, görsel verilerle metinsel coğrafi bağlamın birleştirildiği çok modlu yaklaşımların, görsel-dil modellerinin farklı ve daha önce görülmemiş coğrafi bölgelerdeki genelleme yeteneklerini artırmada önemli bir potansiyele sahip olduğunu göstermektedir.

Özet (Çeviri)

This thesis investigates the impact of incorporating country-level, text-based geographical information into a large-scale vision-language model fine-tuned for captioning optical remote sensing imagery. We hypothesize that enriching visual inputs with corresponding geographical context can enhance model performance, particularly in generalizing to images from previously unseen countries or continents. To test this, we fine-tune the Large Language and Vision Assistant (LLaVA) on optical satellite images from European countries, augmenting them with textual geographical descriptions, and evaluate its performance on images from other global regions. Experiments conducted across 175 countries using the newly released SkyScript dataset reveal that even lightweight geographical context—extracted from Wikipedia—can mitigate cross-country domain shifts, leading to notable improvements in captioning accuracy. These findings highlight the potential of multimodal approaches in enhancing the geographic generalization capabilities of vision-language models.

Benzer Tezler

  1. Generalized texture models for detecting high-level structures in remotely sensed images

    Uzaktan algılanan resimlerde üst düzey yapıları bulmak için genel doku modelleri

    EMEL DOĞRUSÖZ

    Yüksek Lisans

    İngilizce

    İngilizce

    2007

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİhsan Doğramacı Bilkent Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    Y.DOÇ.DR. SELİM AKSOY

  2. Domain generalized object detection and instance segmentation for remote sensing images

    Uzaktan algılama görüntüleri için alan genelleştirilmiş nesne tanıma ve örnek bölütleme

    EFKAN DURAKLI

    Yüksek Lisans

    İngilizce

    İngilizce

    2024

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolGebze Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ YAKUP GENÇ

    DOÇ. DR. ERCHAN APTOULA

  3. Fusion of remote sensing and machine learning for high-resolution bathymetric modeling in shallow coastal zone

    Kıyı bölgeleri sığ sularının yüksek çözünürlüklü batimetrik modellemesi için uzaktan algılama ve makine öğrenmesinin füzyonu

    EMRE GÜLHER

    Doktora

    İngilizce

    İngilizce

    2025

    Jeodezi ve Fotogrametriİstanbul Teknik Üniversitesi

    Geomatik Mühendisliği Ana Bilim Dalı

    DOÇ. DR. UĞUR ALGANCI

  4. Landsat-TM görüntülerine minnaert düzeltmesinin uygulanması: Köyceğiz örneği

    Application of minnaert correction to Landsat-TM images : Köyceğiz case

    SAMURAY ELİTAŞ

    Yüksek Lisans

    Türkçe

    Türkçe

    1997

    Jeodezi ve Fotogrametriİstanbul Teknik Üniversitesi

    Jeodezi ve Coğrafi Bilgi Sistemleri Ana Bilim Dalı

    PROF. DR. CANKURT ÖMERCİ

  5. New deep learning based approaches for land cover classificationin satellite images

    Uydu görüntülerinde arazi örtüsü sınıflandırması için yeni derin öğrenme tabanlı yaklaşımlar

    BAHAA AWAD

    Doktora

    İngilizce

    İngilizce

    2025

    Elektrik ve Elektronik Mühendisliğiİstanbul Teknik Üniversitesi

    Elektronik ve Haberleşme Mühendisliği Ana Bilim Dalı

    PROF. DR. IŞIN ERER