Geri Dön

A new monocular depth estimation model using hybrid architecture

Hibrit mimari kullanarak yeni bir monoküler derinlik tahmini modeli

  1. Tez No: 998192
  2. Yazar: HAMİDULLAH TÜRKMEN
  3. Danışmanlar: PROF. DR. DEVRİM AKGÜN
  4. Tez Türü: Doktora
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: İngilizce
  9. Üniversite: Sakarya Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Otonom sistemlerin çevrelerini güvenli ve etkin bir şekilde algılayabilmesi, 3 boyutlu (3D) sahne yapısını doğru bir şekilde anlamalarına bağlıdır. Bu algılama sürecinin temel taşlarından biri, tek bir RGB görüntüden (monoküler) derinlik tahmini yapmaktır. Tek kameraya dayalı kurulum, çoklu kamera (Stero görüntü) ya da LiDAR donanımına göre daha ekonomik ve daha yalındır. Otonom araçlarda bu tür sistemlerin kullanılması güç tüketimi de belirgin biçimde azalmaktadır. Bu nedenle, bütçe ve enerji kısıtının öne çıktığı otonom sürüş platformlarında sıkça tercih edilmektedir. Bu görev, sistemin her bir piksel için kameraya olan mesafeyi belirlemesini sağlar. Ancak bu süreç, 2 boyutlu (2D) bir görüntüden 3D uzamsal bilginin yeniden yapılandırılmasını gerektirdiğinden, doğası gereği zorlu bir problemdir. Başarılı bir tahmin, iki temel zorluğun üstesinden gelmeyi gerektirmektedir. Birincisi, 2D projeksiyon sırasında kaybolan 3D geometri bilgisinin eksikliğidir. İkincisi ise, sahnedeki farklı nesneler ve yüzeyler arasındaki geniş ölçekli uzamsal ilişkilerin (uzun menzilli bağımlılıkların) doğru bir şekilde modellenmesi gerekliliğidir. Son zamanlarda derin öğrenme tabanlı yaklaşımlar bu alanda önemli ilerlemeler kaydetmiştir. Ancak, mevcut mimarilerin çoğu bahsi edilen bu iki zorluğu aynı anda ve verimli bir şekilde çözmekte sınırlamalarla karşılaşmaktadır. Geleneksel evrişimli sinir ağları (CNN) yerel özellikleri yakalamada başarılıyken, küresel bağlamı modellemede yetersiz kalabiliyor. Transformatör (Transformer) tabanlı modeller küresel bağımlılıkları yakalayabilse de bu genellikle yüksek hesaplama maliyeti ile gelmektedir. Bu eksiklikler ışığında, bu tez çalışması, bu zorluğun üstesinden gelmek amacıyla hem mimari hem de optimizasyon düzeyinde yenilikçi yaklaşımlar sunmaktadır. Önerilen DINOv2MambaUNet modeli ve Geliştirilen Gelişmiş Derinlik Kaybı (ADL) fonksiyonu, bütüncül bir yaklaşım sunarak mevcut literatüre katkı sağlamayı amaçlamaktadır. Bu çerçeve, yalnızca sayısal doğruluğu değil, aynı zamanda görsel tutarlılığı, geometrik geçerliliği ve yapısal bütünlüğü de hedef almıştır. Modelin temel fikri, sahnenin hem“ne içerdiğini”hem de“nasıl yapılandırıldığını”anlayabilen bir sistem geliştirmektir. Bu amaca ulaşmak için öncelikle DINOv2 adlı güçlü bir görsel kodlayıcı kullanılmıştır. DINOv2, etiketlenmemiş veriler üzerinde kendi denetimli öğrenmeyle eğitilmiştir. Hem yerel dokuları hem de küresel sahne bağlamını aynı anda yakalayabilme yeteneğine sahiptir. Kodlayıcı, girdi görüntüsünü dört farklı çözünürlükte işleyerek hem düşük seviyeli (kenar, doku) hem de yüksek seviyeli (nesne, sahne yapısı) bilgileri çıkarır. Bu hiyerarşik temsil, derinlik tahmini için zengin bağlamsal veri sağlar. Özniteliklerin U-Net'e uyum sağlaması, kanal boyutlarında yapılan hafif dönüşümlerle sağlanır. Modelin önemli yeniliklerinden biri de darboğaz bölgesine yerleştirilen Mamba bloğudur. Geleneksel pasif geçiş katmanlarının aksine, burası modelin“bilişsel çekirdeği”olarak çalışır. Mamba, en kaba öznitelik haritası üzerinde uzun mesafeli mekânsal bağımlılıkları verimli şekilde modeller. Bu, geniş yüzeylerin derinlik tutarlılığı için hayati öneme sahiptir. Blok, kanal genişletme, doğrusal olmayan aktivasyon ve derinlik bazlı evrişimle hem mekânsal hem kanal boyutunda zenginleştirme yapmaktadır. Önerilen bu hibrit mimarinin en ayırt edici özelliklerinden biri, DINOv2'nin güçlü anlamsal temsil yeteneği ile Mamba'nın“Seçici Tarama”(Selective Scan) mekanizmasının yarattığı sinerjidir. Standart Transformatör modelleri, görüntü boyutu arttıkça karesel olarak artan bir işlem yükü oluştururken, Mamba bloğu bu süreci doğrusal karmaşıklıkla yöneterek bellek darboğazını ortadan kaldırır. Bu sayede, model yüksek çözünürlüklü girdilerde dahi sahnenin bir ucundan diğer ucuna olan bağlamsal ilişkiyi koparmadan işleyebilmektedir. Böylece, gökyüzü veya geniş yol yüzeyleri gibi doku bilgisinin zayıf olduğu alanlarda dahi derinlik haritasında oluşabilecek yapay dalgalanmaların önüne geçilerek, piksel düzeyinde tutarlılık ve işlem verimliliği aynı anda garanti altına alınmış olur. Darboğaz, bağlamsal sentezin yanı sıra bilginin kod çözücüye aktarılmadan önceki son işlem merkezidir. Bu zenginlik, atlamalı bağlantıların üç seviyesine de yayılır: nesne içi tutarlılık, sınır netliği ve doku korunması sağlanır. Her atlamalı bağlantı, tahmin için kritik bölgeleri vurgulayan bir dikkat mekanizmasıyla donatılmıştır. Boyutsal uyumsuzluklar ise interpolasyonla otomatik giderilir. Kod çözücü, transpoz evrişimler ve zenginleştirilmiş atlamalı bağlantılarla çözünürlüğü artırır. Nihai derinlik haritası, sayısal doğrulukla birlikte görsel ve yapısal tutarlılığı da sağlamaktadır. Mimari kadar önemli bir diğer nokta Gelişmiş Derinlik Kaybı (ADL) fonksiyonudur. Geleneksel yaklaşımlar genellikle ortalama mutlak hata gibi temel metriklere dayanır. Ancak bu metrikler, geometrik bütünlüğü veya nesne sınırlarının keskinliğini garanti edemez. ADL bu eksikliği gidermek için üç temel bileşenden oluşur. Geliştirilen ADL kayıp fonksiyonu, yalnızca piksel hatalarını değil, derinlik haritasının yapısal bütünlüğünü de hedefler. Öncelikle derinlik değerlerini logaritmik uzayda değerlendirerek büyük mesafelerdeki aşırı duyarlılığı giderir. Ardından, görüntüdeki kenar bilgisini kullanarak doku içermeyen bölgelerde yumuşak geçişler sağlarken nesne sınırlarını keskin tutar. Ayrıca, tahmin edilen yüzey normallerini gerçek değerlerle karşılaştırarak sahnenin üç boyutlu geometrisinin tutarlı olmasını teşvik eder. Bu çok bileşenli yaklaşım, RAM'e tam veri yükleme ve CUDA destekli optimizasyonlarla büyük ölçekli eğitimlerde hem hız hem kararlılık sağlamaktadır. Ayrıca, geometrik tutarlılığın sağlanması, otonom sistemlerin karar mekanizmaları için kritik bir güvenlik katmanı oluşturmaktadır. Standart derinlik tahmin modelleri, genellikle nesne sınırlarında“uçan pikseller”(flying pixels) olarak adlandırılan ve nesnenin arka planla karıştığı hatalı derinlik değerleri üretme eğilimindedir. Ancak bu çalışmada uygulanan yapısal bütünlük odaklı yaklaşım, nesne sınırlarını keskin bir şekilde ayrıştırarak bu sorunu minimize eder. Bu durum, özellikle aracın önündeki engellerin kesin konumunun belirlenmesinde ve acil frenleme sistemlerinin tetiklenme hassasiyetinde hayati bir fark yaratır; zira hatalı derinlik bilgisi, olmayan engellerin algılanmasına veya mevcut engellerin yanlış mesafede konumlandırılmasına yol açabilir. Sonuç olarak bu tez çalışması monoküler derinlik tahmini ile nesne algılamayı bütünleştiren özgün bir yaklaşım sunmuştur. Bu amaçla, DINOv2MambaUNet mimarisi ve Gelişmiş Derinlik Kaybı (ADL) fonksiyonu geliştirilmiştir. Önerilen model, KITTI ve NYUv2 ver setinde uygulandı ve literatürdeki yöntemlere kıyasla rekabetçi bir doğruluk ve yapısal tutarlılık sergilemiştir. Başarım SILog, Abs Rel, RMSE ve delta < 1.25 gibi kapsamlı metrikler kullanılarak kanıtlanmıştır. Elde edilen deneysel bulgular, modelin yalnızca eğitim verisine aşırı uyum sağlamadığını, aksine farklı çevresel koşullarda da güçlü bir genelleştirme yeteneği sergilediğini ortaya koymaktadır. Özellikle Mamba bloklarının sağladığı lineer işlem karmaşıklığı, Transformer mimarilerinin neden olduğu karesel bellek yükünü elimine ederek donanım kaynaklarının çok daha verimli kullanılmasını sağlamaktadır. Bu durum, modelin yüksek işlem gücüne sahip sunuculara ihtiyaç duymadan, kısıtlı kaynağa sahip gömülü sistemlerde ve gerçek zamanlı uygulamalarda çalışabilmesinin önünü açmaktadır. Ayrıca, hem iç mekân hem de dış mekân senaryolarındaki tutarlı performans, önerilen yöntemin robotik navigasyon ve artırılmış gerçeklik gibi farklı disiplinlere de kolaylıkla adapte edilebileceğini göstermektedir. Bununla birlikte, üretilen derinlik haritalarındaki yüksek kenar keskinliği ve yüzey tutarlılığı, otonom araçların yol planlama algoritmalarında karşılaşılan belirsizlikleri minimize ederek daha güvenli manevra kabiliyeti sağlamaktadır. Modelin sunduğu bu hibrit mimari stratejisi, bilgisayarlı görü alanında doğruluk ve hız arasındaki ödünleşim sorununu aşmak için güçlü bir referans noktası oluşturmaktadır. Gelecekteki çalışmalarda, bu yapının video tabanlı tahminlere entegre edilmesiyle sürüş güvenliğinin daha da ileri seviyelere taşınması öngörülmektedir. Mamba tabanlı yapı, düşük hesaplama maliyetiyle uzun mesafeli bağlamları etkin bir şekilde modeller. Bu yaklaşım, otonom sistemler için maliyet-etkin ve pratik bir çözüm olarak öne çıkmaktadır.

Özet (Çeviri)

The safe operation of autonomous systems depends on their accurate perception of the three-dimensional (3D) structure of the environment. In this context, depth estimation from a single RGB image (monocular depth estimation) offers a more cost-effective, simpler-to-install, and more energy-efficient alternative compared to equipment such as stereo cameras or LiDAR. However, extracting 3D information from a single image is inherently challenging due to the loss of geometric cues during 2D projection and the need to model long-range spatial relationships across the scene. Traditional CNN-based approaches can strongly capture local details but may be limited in modeling the global context; Transformer-based methods, while effective in context modeling, can incur high computational costs. This thesis proposes an architecture and optimization-focused framework that addresses these two fundamental challenges. The proposed DINOv2MambaUNet utilizes DINOv2, a powerful visual encoder trained with self-supervised learning, for multi-scale feature extraction. The U-Net-based encoder-decoder architecture models long-range dependencies at low cost using Mamba blocks positioned at the bottleneck. Enriched contextual information is transferred to the decoder via jump links enhanced by an attention mechanism; this supports object boundary sharpness, texture preservation, and depth consistency over large surfaces. In addition to the architectural components, Advanced Depth Loss (ADL) has been developed, targeting geometric integrity beyond pixel error. ADL aims to enhance both numerical accuracy and structural continuity with log-space error evaluation, edge-aware continuity, and surface normal consistency components. The proposed approach has been evaluated on the KITTI and NYU-Depth V2 datasets with metrics such as SILog, Abs Rel, RMSE, and δ<1.25; it has been shown to produce more consistent depth maps with competitive accuracy compared to current methods. Future work will focus on real-time execution in embedded hardware and inter-domain generalization under adverse conditions (low light, bad weather, motion blur). The safe operation of autonomous systems depends on their accurate perception of the three-dimensional (3D) structure of the environment. In this context, depth estimation from a single RGB image (monocular depth estimation) offers a more cost-effective, simpler-to-install, and more energy-efficient alternative compared to equipment such as stereo cameras or LiDAR. However, extracting 3D information from a single image is inherently challenging due to the loss of geometric cues during 2D projection and the need to model long-range spatial relationships across the scene. Traditional CNN-based approaches can strongly capture local details but may be limited in modeling the global context; Transformer-based methods, while effective in context modeling, can incur high computational costs. This thesis proposes an architecture and optimization-focused framework that addresses these two fundamental challenges. The proposed DINOv2MambaUNet utilizes DINOv2, a powerful visual encoder trained with self-supervised learning, for multi-scale feature extraction. The U-Net-based encoder-decoder architecture models long-range dependencies at low cost using Mamba blocks positioned at the bottleneck. Enriched contextual information is transferred to the decoder via jump links enhanced by an attention mechanism; this supports object boundary sharpness, texture preservation, and depth consistency over large surfaces. In addition to the architectural components, Advanced Depth Loss (ADL) has been developed, targeting geometric integrity beyond pixel error. ADL aims to enhance both numerical accuracy and structural continuity with log-space error evaluation, edge-aware continuity, and surface normal consistency components. The proposed approach has been evaluated on the KITTI and NYU-Depth V2 datasets with metrics such as SILog, Abs Rel, RMSE, and δ<1.25; it has been shown to produce more consistent depth maps with competitive accuracy compared to current methods. Future work will focus on real-time execution in embedded hardware and inter-domain generalization under adverse conditions (low light, bad weather, motion blur). The proposed hybrid architecture exhibits performance comparable to state-of-the-art monocular depth estimation methods on standard benchmarks

Benzer Tezler

  1. Mikro hava araçlarının bilinmeyen ortamlarda görüntü temelli kontrolü

    Vision based control of micro air vehicles in unknown environments

    CİHAT BORA YİĞİT

    Yüksek Lisans

    Türkçe

    Türkçe

    2012

    Mekatronik Mühendisliğiİstanbul Teknik Üniversitesi

    Mekatronik Mühendisliği Ana Bilim Dalı

    YRD. DOÇ. DR. ERDİNÇ ALTUĞ

  2. Monocular depth estimation from thermal images via edge-guided RGB synthesis

    Kenar yönlendirmeli RGB sentezi ile termal görüntülerden moleküler derinlik tahmini

    MUHAMMED SELMAN ARTIRAN

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolAnkara Yıldırım Beyazıt Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ OSMAN SERDAR GEDİK

  3. A review and evaluation of development in exploration, production, reserves estimation, and research efforts for shale gas and oil

    Şeyl gazı ve petrolü için arama, üretim, rezerv kestirimive araştırma çalışmalarının incelenmesi ve değerlendirilmesi

    OSMAN MOHAMMED

    Yüksek Lisans

    İngilizce

    İngilizce

    2015

    Petrol ve Doğal Gaz Mühendisliğiİstanbul Teknik Üniversitesi

    Petrol ve Doğal Gaz Mühendisliği Ana Bilim Dalı

    YRD. DOÇ. DR. İBRAHİM METİN MIHÇAKAN

  4. Kişiselleştirilmiş sağkalım tahmini için geniş çaplı kanser verisinin yapay öğrenme ve çoklu-omik bazlı analizi

    Artificial learning and multi-omics based analysis of large-scale cancer data for personalized survival predictions

    AYŞE NUR ÇORUH

    Yüksek Lisans

    Türkçe

    Türkçe

    2022

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolHacettepe Üniversitesi

    Biyoenformatik Bilim Dalı

    DOÇ. DR. TUNCA DOĞAN