Domain generalized remote sensing scene captioning via country-level geographic information
Ülke düzeyinde coğrafi bilgilerle alan genelleştirilmiş uzaktan algılama sahne altyazılama
- Tez No: 972485
- Danışmanlar: PROF. DR. ERCHAN APTOULA
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: İngilizce
- Üniversite: Sabancı Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Veri Bilimi Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu tez, optik uzaktan algılama görüntülerinin altyazılanması (captioning) amacıyla ince ayar yapılan büyük ölçekli bir görsel-dil modeline ülke düzeyinde metin tabanlı coğrafi bilginin dahil edilmesinin etkisini araştırmaktadır. Görsel girdilerin karşılık gelen coğrafi bağlamla zenginleştirilmesinin, özellikle daha önce görülmemiş ülke veya kıtalardan gelen görüntülere genelleme yapma konusunda model performansını artırabileceği hipotezini öne sürüyoruz. Bu amacı test etmek için, Large Language and Vision Assistant (LLaVA) modeli Avrupa ülkelerine ait optik uydu görüntüleri ve bunlara ait metinsel coğrafi açıklamalarla birlikte ince ayarlandı ve farklı kıtalardan gelen görüntüler üzerinde değerlendirildi. 175 ülkeyi kapsayan ve yeni yayımlanan SkyScript veri kümesi üzerinde yürütülen deneyler, Wikipedia gibi kaynaklardan elde edilen basit coğrafi bağlamın bile ülkeler arası alan farklılıklarını azaltarak altyazılama doğruluğunda kayda değer iyileşmelere yol açtığını ortaya koymaktadır. Bu bulgular, görsel verilerle metinsel coğrafi bağlamın birleştirildiği çok modlu yaklaşımların, görsel-dil modellerinin farklı ve daha önce görülmemiş coğrafi bölgelerdeki genelleme yeteneklerini artırmada önemli bir potansiyele sahip olduğunu göstermektedir.
Özet (Çeviri)
This thesis investigates the impact of incorporating country-level, text-based geographical information into a large-scale vision-language model fine-tuned for captioning optical remote sensing imagery. We hypothesize that enriching visual inputs with corresponding geographical context can enhance model performance, particularly in generalizing to images from previously unseen countries or continents. To test this, we fine-tune the Large Language and Vision Assistant (LLaVA) on optical satellite images from European countries, augmenting them with textual geographical descriptions, and evaluate its performance on images from other global regions. Experiments conducted across 175 countries using the newly released SkyScript dataset reveal that even lightweight geographical context—extracted from Wikipedia—can mitigate cross-country domain shifts, leading to notable improvements in captioning accuracy. These findings highlight the potential of multimodal approaches in enhancing the geographic generalization capabilities of vision-language models.
Benzer Tezler
- Generalized texture models for detecting high-level structures in remotely sensed images
Uzaktan algılanan resimlerde üst düzey yapıları bulmak için genel doku modelleri
EMEL DOĞRUSÖZ
Yüksek Lisans
İngilizce
2007
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİhsan Doğramacı Bilkent ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
Y.DOÇ.DR. SELİM AKSOY
- Domain generalized object detection and instance segmentation for remote sensing images
Uzaktan algılama görüntüleri için alan genelleştirilmiş nesne tanıma ve örnek bölütleme
EFKAN DURAKLI
Yüksek Lisans
İngilizce
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolGebze Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ YAKUP GENÇ
DOÇ. DR. ERCHAN APTOULA
- Fusion of remote sensing and machine learning for high-resolution bathymetric modeling in shallow coastal zone
Kıyı bölgeleri sığ sularının yüksek çözünürlüklü batimetrik modellemesi için uzaktan algılama ve makine öğrenmesinin füzyonu
EMRE GÜLHER
Doktora
İngilizce
2025
Jeodezi ve Fotogrametriİstanbul Teknik ÜniversitesiGeomatik Mühendisliği Ana Bilim Dalı
DOÇ. DR. UĞUR ALGANCI
- Landsat-TM görüntülerine minnaert düzeltmesinin uygulanması: Köyceğiz örneği
Application of minnaert correction to Landsat-TM images : Köyceğiz case
SAMURAY ELİTAŞ
Yüksek Lisans
Türkçe
1997
Jeodezi ve Fotogrametriİstanbul Teknik ÜniversitesiJeodezi ve Coğrafi Bilgi Sistemleri Ana Bilim Dalı
PROF. DR. CANKURT ÖMERCİ
- New deep learning based approaches for land cover classificationin satellite images
Uydu görüntülerinde arazi örtüsü sınıflandırması için yeni derin öğrenme tabanlı yaklaşımlar
BAHAA AWAD
Doktora
İngilizce
2025
Elektrik ve Elektronik Mühendisliğiİstanbul Teknik ÜniversitesiElektronik ve Haberleşme Mühendisliği Ana Bilim Dalı
PROF. DR. IŞIN ERER