Geri Dön

Efficient autonomous driving with foundation models

Temel modeller ile verimli otonom sürüş

  1. Tez No: 975110
  2. Yazar: SHADI SAMEH MOHAMMED HAMDAN
  3. Danışmanlar: Assist. Prof. Dr. FATMA GÜNEY
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Yapay zeka, Yapay zeka ve makine öğrenmesi dersi, Artificial intelligence, Artificial intelligence and machine learning course
  7. Yıl: 2025
  8. Dil: İngilizce
  9. Üniversite: Koç Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Bilimleri ve Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Bilgisayar Bilimi ve Mühendisliği Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Kentsel ortamlarda güvenli sürüş, karmaşık ve dinamik çevrelerin derinlemesine anlaşılmasını ve beklenmedik durumlara hızlı ve etkin biçimde yanıt verebilme yetkinliğini gerektirir. Son dönemdeki büyük temel yapay zekâ modelleri (foundation models) üzerine gelişmeler, akıl yürütme ve genelleme konusunda dikkate değer yetenekler ortaya koymaktadır. Bu tezde, temel modellerin sürüş bağlamındaki potansiyelini ve uygulanabilirliğini inceliyoruz. İlk olarak, pekiştirmeli öğrenme problemini oto-regresif transformer modelleri aracılığıyla bir dil modelleme problemi olarak formüle ederek, robotik görevlerinde umut verici performans sergileyen önceki çalışmalara dayandırıyoruz. Bununla birlikte, bu yaklaşımlar genellikle durumun görece basit olduğunu ve tek bir vektör ile temsil edilebileceğini varsayar. Sürüşte durum daha karmaşıktır; birbirleriyle etkileşim hâlinde çok sayıda ajan içerir. Bu nedenle, daha kompakt ve etkili bir durum temsili geliştirmemiz gerekir. Bu doğrultuda, Carformer modeli kapsamında slot attention mekanizmasına dayalı, öz-denetimli olarak öğrenilmiş, nesne-merkezli bir temsil ile çalışan bir dil modeli öneriyoruz. Ayrıcalıklı (privileged) bir senaryoda farklı durum temsillerini karşılaştırmalı olarak analiz ediyor, önerdiğimiz temsilin hem sahne düzeyinde hem de elle tasarlanmış nesne-merkezli temsillerden üstün olduğunu ve Longest6 kıyaslama testinde en iyi (state-of-the-art) performansı elde ettiğini gösteriyoruz. Ayrıcalıklı senaryoda dil modelleme yaklaşımıyla güçlü sonuçlar elde ettikten sonra, daha gerçekçi uçtan uca bir senaryoya odaklanıyoruz. Temel modeller ölçek büyüdükçe daha gelişmiş sonuçlar üretse de, bu durum ek çıkarım gecikmesine yol açar. Gecikme, büyük ölçekli temel modellerin sürüş gibi gerçek zamanlı uygulamalarda kullanılmasının önündeki temel engellerden biridir. Bu sorunu aşmak için, büyük bir temel modeli daha küçük ve hafif bir modelle birlikte kullandığımız ikili yaklaşıma dayalı bir uygulama, ETA, öneriyoruz. Gecikmeyi en aza indirmek amacıyla, büyük temel modelin hesaplamalarını daha erken bir zaman adımında gerçekleştiriyor ve elde edilen özellikleri, bir tahmin modülü aracılığıyla güncel zamana uyarlıyoruz. Mevcut ikili yaklaşımlardan farklı olarak, büyük model çıkarımlarını toplu biçimde işleyerek her bir zaman adımında kararların büyük model özelliklerinden yararlanmasını sağlıyoruz. Böylelikle, çok daha düşük gecikme ile tüm önceki yaklaşımları geride bırakıyor ve otonom sürüşte büyük temel modellerin uygulanabilirliğini vurguluyoruz.

Özet (Çeviri)

Driving safely in urban environments is a task that requires a deep understanding of complex, dynamic environments and the ability to react swiftly and effectively to unexpected events. Recent advances in large foundation models have shown impressive capabilities to reason and generalize. In this thesis, we explore the potential and feasibility of foundation models for driving. First, we start by building on top of previous work showing promising performance in robotics tasks by formulating reinforcement learning as a language modeling problem using auto-regressive transformers. These approaches, however, assume the state is relatively simple, often representable as a single vector. In driving, the state is more complex, involving multiple agents that interact with each other, raising the need to find a compact, effective state representation. In Carformer, we propose a language model using learned, self-supervised, object-centric representation based on slot attention. We analyze different possible state representations in a privileged setting and find that our proposed representation outperforms both scene-level and hand-crafted object-centric representations, achieving the state-of-the-art on the Longest6 benchmark. After showing strong results with a language modeling approach in a privileged setting, we then focus on a more realistic, end-to-end setting. While foundation models further improve with scale, this results in additional inference latency. Latency is one of the main hurdles facing the deployment of large foundation models for real-time applications like driving. To address this, we propose a dual approach pipeline, ETA, that utilizes a large foundation model in tandem with a smaller, lightweight model. To minimize latency, we shift the computation of the large foundation model to an earlier time-step following it with a forecasting module to adapt the features to the present. Unlike previous work on dual approaches, we batch the large model inference to enable the decisions to benefit from the large model features at every time-step. Outperforming all previous approaches at a fraction of the latency, we highlight the feasibility of large foundation models in self-driving.

Benzer Tezler

  1. Otonom araçların şerit algılama sistemlerinde YOLO mimarilerinin (v9, v11, v12, v26) semantik segmentasyon performanslarının karşılaştırmalı değerlendirilmesi

    Comparative evaluation of the semantic segmentation performance of YOLO architectures (v9, v11, v12, v26) in lane detection systems of autonomous vehicles

    ZEYNEP KUBİLAY YUNSO

    Yüksek Lisans

    Türkçe

    Türkçe

    2026

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSakarya Üniversitesi

    Bilişim Sistemleri Mühendisliği Ana Bilim Dalı

    PROF. DR. İSMAİL HAKKI CEDİMOĞLU

  2. Towards improving the robustness and generalizability of camera-based bird's eye view segmentation models

    Kuş bakışı görünüm segmentasyon modellerinin sağlamlığını ve genelleme yeteneğini geliştirme

    MERVE RABİA BAĞCI

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolKoç Üniversitesi

    Bilgisayar Bilimleri ve Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ FATMA GÜNEY

  3. LiDAR based ground plane estimation, hybrid visual-LiDAR odometry and navigation of autonomous trucks

    Otonom maden sahası kamyonları için zemin düzlemi tahmini, hibrit görsel-LiDAR odometri ve navigasyon sistemi

    EREN AYDEMİR

    Doktora

    İngilizce

    İngilizce

    2024

    Mekatronik MühendisliğiSabancı Üniversitesi

    Mekatronik Mühendisliği Ana Bilim Dalı

    PROF. DR. MUSTAFA ÜNEL

  4. Learning general type-2 fuzzy logic systems for uncertainty quantification

    Belirsizlik nicelleştirilmesi için genel tip-2 bulanik mantik sistemlerinin öğrenilmesi

    YUSUF GÜVEN

    Yüksek Lisans

    İngilizce

    İngilizce

    2025

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Kontrol ve Otomasyon Mühendisliği Ana Bilim Dalı

    PROF. DR. TUFAN KUMBASAR

  5. A modeling and control framework for mixed-traffic freeway operations

    Karma trafik akımlarına sahip otoyollar için modelleme ve denetim çerçevesi

    SADULLAH GÖNCÜ

    Doktora

    İngilizce

    İngilizce

    2026

    Ulaşımİstanbul Teknik Üniversitesi

    İnşaat Mühendisliği Ana Bilim Dalı

    PROF. DR. HİLMİ BERK ÇELİKOĞLU

    DR. ÖĞR. ÜYESİ MEHMET ALİ SİLGU