Unified approaches to efficient and robust image retrieval through fusion restoration, and compression
Füzyon, sıkıştırma ve restorasyon yoluyla verimli ve dayanıklı görsel getirim için birleşik yaklaşımlar
- Tez No: 985695
- Danışmanlar: DR. ÖĞR. ÜYESİ YUSUF HÜSEYİN ŞAHİN
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: İngilizce
- Üniversite: İstanbul Teknik Üniversitesi
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu tez, görsel getirimin ölçeklenebilirlik, dayanıklılık ve uyarlanabilirlik konularında karşılaşılan temel sınırlamaları aşmak amacıyla geliştirilen dört özgün ve birbirini tamamlayan araştırmayı bütünleştirmektedir. Çalışmalar, çağdaş görsel arama sistemlerinin üç temel ekseninde yenilikçi çözümler sunmaktadır: çoklu görünüm ve model çıktılarının anlamlı biçimde birleştirilmesi, yüksek boyutlu özniteliklerin getirim odaklı olarak sıkıştırılması ve görsel örtülmeler altında kimlik bütünlüğünün korunması. Böylece tez, füzyon, sıkıştırma ve restorasyon süreçlerini aynı teorik çatı altında toplayarak, gerçek dünyadaki ölçeklenebilir ve dayanıklı görsel getirim sistemleri için bütüncül bir yaklaşım ortaya koymaktadır. Bu kapsamda, tezin ilk bölümünde, alanın kuramsal arka planı ayrıntılı biçimde ele alınmaktadır. İlk olarak, içerik tabanlı görsel getirim kavramı tarihsel gelişimi ve modern uygulama biçimleriyle açıklanmakta; düşük seviyeli öznitelik tabanlı yöntemlerden derin öğrenme temelli temsil öğrenimine geçiş süreci tartışılmaktadır. Ardından, derin gömme modelleri bölümünde ResNet, EfficientNet, CLIP, SwAV ve DINO gibi güncel modellerin mimari farklılıkları, öğrenme yaklaşımları ve görsel temsiller üzerindeki etkileri incelenmektedir. Yaklaşık en yakın komşu arama bölümünde, büyük ölçekli veri tabanlarında benzerlik aramasını hızlandırmak için kullanılan HNSW, IVF ve PQ gibi yapıların çalışma ilkeleri, bellek-zaman doğruluk dengesi açısından karşılaştırılmaktadır. Son olarak, Değerlendirme ölçütleri bölümünde, Hit@K, Recall@K, mAP, SSIM, LPIPS ve FID gibi getirim ve algısal benzerlik metriklerinin hem görsel arama hem de kimlik koruma senaryolarındaki kullanımları açıklanmaktadır. Bu teorik çerçeve, sonraki bölümlerde sunulan yöntemlerin hem nicel değerlendirmesi hem de kavramsal konumlandırılması açısından temel bir referans noktası oluşturmaktadır. İlk çalışma, yüksek boyutlu özniteliklerin neden olduğu hesaplama maliyetini azaltmak amacıyla, getirim farkındalıklı bir boyut indirgeme yöntemi sunmaktadır. Bu amaçla geliştirilen AE-MCDO mimarisi, çok ölçütlü bir kayıp fonksiyonu tanımlayarak yeniden yapılandırma doğruluğu, açısal benzerlik korunumu, öznitelik dekorrelasyonu ve ortogonallik düzenlemesini aynı çerçevede optimize etmektedir. Böylece hem bilgi kaybı en aza indirilmekte hem de gömülü uzayın geometrik yapısı korunmaktadır. CLIP ve SwinV2 gibi yüksek boyutlu modellerden elde edilen gömülmeler AE-MCDO ile sıkıştırıldığında, klasik PCA ve sıradan otomatik kodlayıcılara göre hem Hit@K doğruluğunda hem de getirim hızında belirgin bir artış elde edilmiştir. Örneğin, 512 boyutlu CLIP vektörlerinin 32 boyuta indirgenmesi durumunda bile doğrulukta anlamlı bir kayıp gözlenmemiş, bellekte ve hesaplama süresinde ciddi kazanımlar sağlanmıştır. Bu bulgu, büyük ölçekli e-ticaret katalogları ve multimodal arama sistemleri için boyut indirgeme sürecinde yalnızca yeniden yapılandırma hatasının değil, benzerlik uzayının korunmasının da kritik olduğunu göstermektedir. İkinci çalışma, dil tabanlı açık kelime dağarcıklı algılama ve iki görünümden beslenen getirim yaklaşımıyla, yeniden eğitim gerektirmeyen bir görsel alışveriş sistemi tasarlamaktadır. YOLO-World mimarisi kullanılarak geliştirilen bu sistem, ürünleri doğal dil istemleriyle tespit etmekte ve sahne ile ürün kırpıntılarını dondurulmuş ağırlıklı karşılıklı sıralama birleştirmesiyle bir araya getirmektedir. Sistem, ürün odaklı temsillerin doğruluğunu korurken, sahne bağlamından gelen bilgiyi de getirime dahil ederek daha tutarlı sonuçlar üretmektedir. Gerçek yaşamdan oluşturulan oturma odası veri kümesinde yapılan deneylerde 0.851 mAP@0.5 tespit başarımı ve 0.580 Recall@3 getirim başarımı elde edilmiştir. Bu sonuçlar, sınırlı denetimli verilerle bile açık kelime dağarcıklı bir sistemin yüksek esneklikle çalışabileceğini ve dinamik ürün kataloglarına kendiliğinden uyum sağlayabileceğini göstermiştir. Böylece çalışma, e-ticaret sektöründe çoklu ürün keşfi senaryoları için ölçeklenebilir bir altyapı ortaya koymaktadır. Üçüncü çalışma, çoklu görünüm getirimde farklı gömleme modellerinin güven düzeylerini dinamik biçimde hesaba katan denetimsiz bir füzyon yöntemi önermektedir. SkewFuse olarak adlandırılan bu yaklaşım, her sorgu için model çıktılarının benzerlik dağılımlarındaki istatistiksel çarpıklığı hesaplayarak modele özgü bir güven katsayısı üretmektedir. Bu katsayılar, Dowdall oylama temelli bir sıralama birleştirmesine ağırlık olarak entegre edilmekte ve böylece yüksek güvene sahip modellerin sıralamadaki etkisi artırılmaktadır. Moda ürünlerinin hem katalog hem sahne görsellerinden oluştuğu zorlu veri kümelerinde yapılan deneyler, SkewFuse yönteminin erken sıralama başarımında %4,7 oranında iyileşme sağladığını göstermiştir. Denetimsiz, hafif ve parametresiz yapısı sayesinde yöntem, gerçek zamanlı getirim sistemlerinde doğrudan uygulanabilir hale gelmiş ve görsel çeşitliliğin yüksek olduğu ortamlarda güçlü bir performans sergilemiştir. Bu çalışma, çoklu model füzyonunda güven kavramını istatistiksel olarak temellendirerek literatürde yeni bir perspektif kazandırmıştır. Dördüncü çalışma, yüz tanıma görevlerinde örtülmelerin neden olduğu kimlik bozulmalarını gideren üretici onarım temelli bir kimlik restorasyonu yaklaşımı sunmaktadır. Labeled Faces in the Wild veri kümesinde Stable Diffusion kullanılarak gerçekçi maskeleme senaryoları oluşturulmuş ve bu maskeler AOT-GAN, DeepFillv2 ve Stable Diffusion modelleriyle tamamlanmıştır. SSIM, LPIPS, FID ve FSIM gibi algısal ölçütler yanında Hit@K tabanlı getirim değerlendirmeleri de gerçekleştirilmiştir. Deneyler, DeepFillv2'nin yapısal doğrulukta, Stable Diffusion'ın ise kimlik bütünlüğünde en güçlü performansı sağladığını göstermiştir. CLIP gömülmeleriyle yapılan deneylerde, örtülme altında Hit@1 değeri, onarım sonrası yükselmiştir. Bu sonuç, klasik görsel benzerlik ölçütlerinin kimlik tutarlılığını her zaman yansıtamadığını ve getirim tabanlı değerlendirme ölçütlerinin kimlik korunumunu daha doğru temsil ettiğini ortaya koymuştur. Çalışma, üretici modellerin kimlik temsillerini restore etme potansiyelini göstererek, örtülme farkındalıklı yüz getirimi için yeni bir referans noktası oluşturmuştur. Sonuç olarak, bu tezdeki dört çalışma, füzyon, sıkıştırma ve restorasyon süreçlerini bir araya getirerek, görsel getirimin geleceği için modüler, ölçeklenebilir ve dayanıklı bir mimari önermektedir. Açık kelime dağarcıklı sistem, yeni kavramların dilsel istemlerle doğrudan algılanmasına olanak tanırken; SkewFuse, çoklu görünüm getiriminde güvene dayalı birleştirme ile erken sıralama doğruluğunu artırmaktadır. AE-MCDO, yüksek boyutlu gömülmeleri bilgi kaybı olmadan sıkıştırarak bellek ve zaman açısından verimlilik sağlamakta, örtülme farkındalıklı yüz getirimi ise kimlik bütünlüğünü yeniden tesis etmektedir. Birlikte değerlendirildiğinde bu yaklaşımlar, e-ticaret, yüz tanıma, moda analitiği, çoklu modal arama ve içerik tabanlı öneri sistemleri gibi geniş bir uygulama yelpazesinde kullanılabilecek, sürdürülebilir ve güçlü bir görsel getirim ekosistemi inşa etmektedir. Bu bütüncül çerçeve, hem kuramsal temelleri hem de dört özgün katkıyı ortak bir doğrultuda buluşturarak, gelecekte geliştirilecek ölçeklenebilir ve esnek görsel arama sistemleri için sağlam bir temel oluşturmakta ve alanın ilerleyen çalışmalarına yön verecek bir araştırma hattı sunmaktadır.
Özet (Çeviri)
This thesis integrates four distinct yet complementary studies that advance the state of image retrieval by addressing challenges in scalability, robustness, and adaptability. Collectively, these works propose novel strategies across three fundamental retrieval dimensions: fusion-based retrieval, retrieval-oriented dimensionality reduction, and identity restoration under occlusion. The first study, tackles the computational inefficiency of large-scale image retrieval by proposing a retrieval-aware dimensionality reduction framework. High-dimensional embeddings from models like CLIP and SwinV2 deliver fine-grained detail but are computationally costly for Approximate Nearest Neighbor (ANN) search. The study introduces AE-MCDO, an autoencoder trained with a multi-criteria loss combining Mean Squared Error, Cosine similarity preservation, Decorrelation, and Orthogonality regularization. Experiments show that AE-MCDO consistently outperforms PCA and standard autoencoders, achieving higher Hit@K across multiple backbones while reducing memory and latency. CLIP embeddings compressed via AE-MCDO achieve higher Hit@1, improving retrieval speed without significant accuracy loss. The findings demonstrate that retrieval performance depends not only on reconstruction fidelity but also on neighborhood structure preservation, achieved through angular alignment and orthogonal latent projections. This work provides a retrieval-optimized compression strategy critical for scalable deployment in large e-commerce catalogs. The second work introduces a prompt-driven visual shopping pipeline for dynamic e-commerce environments. Traditional visual search systems rely on supervised detectors and retrained embeddings for every new product category, creating scalability issues. To address these limitations, the study proposes an open-vocabulary detection and retrieval framework built on YOLO-World and a Freeze-Weighted Reciprocal Rank Fusion (FWRRF) strategy. YOLO-World enables zero-shot detection using natural-language prompts, eliminating the need for retraining as new categories emerge. The retrieval module fuses embeddings from two visual perspectives, product crops and full scenes, via FWRRF, preserving the precision of object-centric representations while integrating contextual cues from the surrounding image. Evaluations on a curated living-room dataset demonstrate that this approach surpasses single-view and conventional fusion methods. Overall, it establishes a scalable, training-free, and context-aware framework that bridges semantic adaptability and retrieval precision, forming a foundation for autonomous“shop-the-look”systems in e-commerce. The third study, builds upon the concept of multi-view retrieval and presents an unsupervised confidence-weighted fusion framework that dynamically adapts to query-specific variability. Instead of treating all embedding models equally, SkewFuse computes statistical skewness over similarity score distributions to estimate each model's confidence per query. A confidence-weighted Dowdall voting scheme then aggregates the rankings, emphasizing high-confidence retrievals. Experiments on the In-Shop Clothes Retrieval dataset demonstrate that SkewFuse surpasses both unsupervised and supervised fusion baselines, achieving a 4.7% relative improvement in Recall@1 over the best comparator. It excels in early precision, which is vital for top-k recommendation scenarios. The framework's lightweight, parameter-free nature enables deployment in production systems where real-time retrieval precision and robustness to noise are crucial. By introducing skewness-based reliability estimation, SkewFuse advances the understanding of how statistical confidence modeling can guide rank fusion without supervision. The fourth work, explores robust retrieval under visual corruption, specifically facial occlusions that degrade identity embeddings. Using the Labeled Faces in the Wild (LFW) dataset, the paper simulates realistic occlusions through Stable Diffusion-based mask generation and compares several inpainting models, including AOT-GAN, DeepFillv2, and Stable Diffusion, for identity restoration. Evaluation across perceptual (SSIM, LPIPS, FID, FSIM) and retrieval (Hit@K) metrics reveals that while DeepFillv2 achieves the best structural scores, Stable Diffusion produces visually superior, identity-consistent restorations, improving CLIP's Hit@1 score. The study highlights a critical insight: traditional visual similarity metrics fail to capture identity preservation, advocating for retrieval-based evaluation as a more reliable measure of perceptual consistency. This work contributes to robust identity retrieval under occlusion and bridges the gap between generative restoration and embedding-based recognition. Together, these four works represent a unified pursuit of efficient, adaptable, and robust visual retrieval. The open-vocabulary retrieval pipeline broadens category scalability through language-conditioned detection. SkewFuse enhances multi-view precision via unsupervised, confidence-guided fusion. The retrieval-oriented dimensionality reduction framework compresses embeddings for speed and memory efficiency without loss of discriminability. The occlusion-aware retrieval study restores identity integrity through generative reconstruction. Collectively, they contribute to a holistic retrieval framework that integrates fusion, compression, and restoration, addressing the key bottlenecks of real-world image retrieval systems, scalability, efficiency, and robustness. By unifying fusion, compression, and restoration under one conceptual framework, this thesis lays the groundwork for future retrieval systems that learn continually, generalize across modalities, and maintain reliability under the complex and evolving conditions of real-world visual data.
Benzer Tezler
- Automatic, integrated and structured reporting for radiology image examinations
Radyoloji görüntü incelemeleri için otomatik, entegre ve yapılandırılmış raporlama
NURBANU AKSOY
Doktora
İngilizce
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolUnıversıty Of LeedsMühendislik Bilimleri Ana Bilim Dalı
DR. ÖĞR. ÜYESİ NISHANT RAVIKUMAR
PROF. DR. SERGE SHAROFF
- Geri dönüştürülebilir atıkların derin öğrenme modelleri ile sınıflandırılması: Veri seti boyutunun etkisi üzerine bir karşılaştırma
Classification of recyclable wastes with deep learning models: A comparison on the effect of dataset size
GAMZE AĞIRTAŞ
Yüksek Lisans
Türkçe
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSakarya ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ SERAP ÇAKAR KAMAN
- İkili zemin karışımları için özgün bir görüntü veri seti oluşturulması ve destek vektör makineleri ile sınıflandırılması analizi
Construction of an original image dataset for binary soil mixtures and classification analysis using support vector machines
MİRA BAĞMAN
Yüksek Lisans
Türkçe
2026
İnşaat Mühendisliğiİstanbul Teknik ÜniversitesiMatematik Mühendisliği Ana Bilim Dalı
DOÇ. DR. BURCU TUNGA
DOÇ. DR. MÜGE BALKAYA
- An affective framework for brain computer interfaces using transfer learning in virtual environments
Sanal ortamlarda transfer öğrenme kullanılarak beyin bilgisayar arayüzleri için duyuşsal çerçeve oluşturulması
MEHMET ALİ SARIKAYA
Doktora
İngilizce
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. GÖKHAN İNCE
- Dik kafes süzgeçleri kullanarak 2-boyutlu spektrum kestirimi
Başlık çevirisi yok
M. DOĞAN GÜVEN
Yüksek Lisans
Türkçe
1997
Elektrik ve Elektronik Mühendisliğiİstanbul Teknik ÜniversitesiElektronik ve Haberleşme Mühendisliği Ana Bilim Dalı
PROF. DR. AHMET HAMDİ KAYRAN