Vcompact vision–language models for low-resource Turkish image captioning: Projection-based fusion strategies
Düşük kaynaklı Türkçe görüntü açıklama için kompakt görsel–dil modellerinde projeksiyon tabanlı füzyon stratejileri
- Tez No: 1020911
- Danışmanlar: DR. ÖĞR. ÜYESİ UZAY ÇETİN
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Görsel veri tabanı, Görüntü işleme-bilgisayarlı, Visual database, Image processing-computer assisted
- Yıl: 2026
- Dil: İngilizce
- Üniversite: Galatasaray Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu tez, düşük kaynaklı ve sınırlı hesaplama koşulları altında Türkçe görüntü açıklama görevi için kompakt görsel–dil uyarlama stratejilerini incelemektedir. Görüntü açık- lama, hem doğru görsel anlama hem de akıcı doğal dil üretimi gerektiren çok modlu bir görevdir. Ancak mevcut görsel–dil modellerinin büyük bölümü özellikle İngilizce gibi yüksek kaynaklı diller için geliştirilmiş ve değerlendirilmiştir. Türkçe ise zengin biçimbilimsel yapısı, esnek sözcük dizimi ve büyük ölçekli görüntü–açıklama veri kü- melerinin sınırlı olması nedeniyle ek zorluklar içermektedir. Bu çalışmada büyük ölçekli bir çok modlu modeli sıfırdan eğitmek yerine, dondurulmuş önceden eğitilmiş bir Sig- LIP2 görsel kodlayıcı ile Türkçe odaklı bir GPT-2 dil modeli birleştirilmiş ve hafif projeksiyon tabanlı füzyon stratejileri sistematik olarak değerlendirilmiştir. Türkçe görüntü açıklama veri kümesi, Flickr30k açıklamalarının birden fazla talimatla eğitilmiş büyük dil modeli kullanılarak çevrilmesiyle oluşturulmuştur. Çeviri kalitesi, GPT-4o-mini tabanlı bir LLM-as-a-Judge yöntemiyle değerlendirilmiş ve en güvenilir çeviri modeli ikili karşılaştırmalar ile Elo sıralaması kullanılarak seçilmiştir. Daha sonra beş kompakt SigLIP2–Türkçe GPT-2 mimarisi eğitilmiş ve karşılaştırılmıştır: doğrusal projeksiyon, son iki GPT-2 bloğunun ince ayarlandığı doğrusal projeksiyon, MLP pro- jeksiyon, son iki GPT-2 bloğunun ince ayarlandığı MLP projeksiyon ve artık bağlantılı MLP projeksiyon. Modeller BLEU, ROUGE, METEOR, CIDEr ve cümle düzeyinde semantik benzerlik gibi geleneksel otomatik metriklerin yanı sıra akıcılık, dilbilgisel doğruluk, semantik benzerlik, ayrıntı zenginliği ve iç tutarlılık gibi LLM tabanlı insan-yargısına yakın de- ğerlendirme boyutlarıyla analiz edilmiştir. Bulgular, projeksiyon tabanlı kompakt mi- marilerin düşük sayıda eğitilebilir parametreyle rekabetçi Türkçe görüntü açıklamaları üretebildiğini göstermektedir. Ayrıca sonuçlar, referans tabanlı otomatik metrikler ile LLM tabanlı nitel değerlendirme arasında anlamlı farklar olduğunu ortaya koymakta ve düşük kaynaklı çok modlu üretim görevlerinde çok boyutlu değerlendirmenin önemini vurgulamaktadır.
Özet (Çeviri)
This thesis investigates compact vision–language adaptation strategies for Turkish im- age captioning under low-resource and limited-compute conditions. Image captioning requires both accurate visual understanding and fluent natural language generation, yet most existing vision–language models are primarily developed for high-resource lan- guages, especially English. Turkish introduces additional challenges due to its rich mor- phology, flexible word order, and the limited availability of large-scale image–caption datasets. Instead of training a large multimodal model from scratch, this study com- bines a frozen pretrained SigLIP2 vision encoder with a Turkish-native GPT-2 language model and evaluates lightweight projection-based fusion strategies. A Turkish image captioning dataset is constructed by translating Flickr30k captions using multiple instruction-tuned large language models. Translation quality is assessed through a GPT-4o-mini based LLM-as-a-Judge procedure, and the best-performing translation source is selected using pairwise comparisons and Elo ranking. Five com- pact SigLIP2–Turkish GPT-2 architectures are then trained and evaluated: linear projection, linear projection with partial GPT-2 fine-tuning, MLP projection, MLP projection with partial GPT-2 fine-tuning, and residual MLP projection. The models are compared using both traditional automatic metrics, including BLEU, ROUGE, METEOR, CIDEr, and sentence-level semantic similarity, and LLM-based human-aligned evaluation dimensions such as fluency, grammatical correctness, seman- tic similarity, detail richness, and internal coherence. The results show that projection- based compact architectures can achieve competitive Turkish caption generation while keeping the number of trainable parameters low. The findings also reveal a meaningful distinction between reference-based automatic metrics and LLM-based qualitative eval- uation, highlighting the importance of multi-dimensional assessment in low-resource multimodal generation.