Geri Dön

Deep reınforcement learnıng based hybrıd goalassıgned multı agent path plannıng ın dynamıcenvıronments

Dinamik ortamlarda derin pekiştirmeli öğrenme tabanlıhibrit hedef atamalı çok ajanlı yol planlama

  1. Tez No: 1004807
  2. Yazar: BARIŞ ALMAÇ
  3. Danışmanlar: PROF. DR. MUSTAFA ÜNEL
  4. Tez Türü: Yüksek Lisans
  5. Konular: Mühendislik Bilimleri, Mekatronik Mühendisliği, Engineering Sciences, Mechatronics Engineering
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2025
  8. Dil: İngilizce
  9. Üniversite: Sabancı Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Mekatronik Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Depo, fabrika ve trafik gibi ortamlarda büyük robot filolarını koordine etmek, çok sayıda ajanın aynı alan içinde hızlı ve güvenli şekilde hareket etmesini gerektirir; ancak ortamlar dinamik ve kalabalık hale geldikçe geleneksel planlayıcılar ölçeklen- mekte zorlanır. Bu problem Multi-Agent Path Finding (MAPF) olarak ele alınır: birden fazla ajan, kısmi gözlem altında paylaşılan bir ortamda atanmış hedeflerine çarpışmadan ulaşırken görev süresi (makespan) ve yol maliyetini en aza indirme- lidir. Klasik optimal MAPF çözücüleri tam küresel bilgiyle güçlü garantiler sunsa da ajan sayısı arttığında ve sık yeniden-planlama gerektiğinde çalışma süresi hı- zla büyür; yalnızca öğrenmeye dayalı reaktif politikalar ise daha iyi ölçeklense de güvenlik güvencesi zayıf kalır ve yoğun, zamanla değişen sahnelerde başarısız ola- bilir. Bu tez, bu boşluğu kapatmak için merkezi olmayan bir pekiştirmeli öğrenme çerçevesi önerir: paylaşılan PPO tabanlı politika, iki aşamalı hedef atama önceliği (Öklid açık artırma ve A* maliyet inceltme), eylem başına çarpışma riskini tahmin eden tek-adım öngörülü bir kalkan ve yalnızca risk düşükken A* taklidini etkin- leştiren güvenlik kapılı öğretmen–öğrenci kaybı ile desteklenir. Hareketli engeller içeren dinamik ızgara ortamlarda yöntem, neredeyse kusursuz başarı ve hedef kap- saması sağlarken çarpışmaları ve makespan'i CBS tabanlı bir planlayıcıya ve güçlü DRL temellerine göre belirgin biçimde azaltır ve ortalama ödülü anlamlı şekilde yükseltir; sonuçlar, yapısal bileşenlerle desteklenen ve kalkanlanan RL'in güvenli, ölçeklenebilir ve reaktif MAPF için umut verici bir yol olduğunu gösterir.

Özet (Çeviri)

Coordinating large fleets of robots in warehouses, factories, and traffic systems re- quires moving many agents through the same space quickly and safely, yet traditional planners struggle to keep up as environments become dynamic and crowded. This challenge is formalized as the Multi-Agent Path Finding (MAPF) problem, where multiple agents must navigate a shared environment, reach their assigned goals, and avoid collisions while minimizing mission time and travel cost under partial observ- ability. Classical optimal MAPF solvers offer strong guarantees when full global information is available, but their runtime grows rapidly with agent count and fre- quent replanning, whereas purely learned reactive policies scale better but provide little safety assurance and often fail in dense scenes. This thesis introduces a decen- tralized reinforcement learning framework that aims to bridge this gap by combining a shared PPO-based policy with three structured components: a two-stage goal as- signment prior (Euclidean auction with A*-cost refinement), a one-step predictive shield that estimates per-action collision risk, and a safety-gated teacher–student loss that imitates A* when predicted risk is low. In dynamic grid environments with moving obstacles, the proposed method achieves near-perfect success and goal coverage, reduces collisions and makespan by roughly half compared to a CBS-based planner and strong DRL baselines, and yields substantially higher average rewards. Overall, the work shows that structured and shielded RL can provide a promising route toward safe, scalable, and reactive decentralized MAPF in realistic scenarios.

Benzer Tezler

  1. Reinforcement learning based energy management strategy for fuel cell hybrid vehicles

    Hidrojen yakıt hücreli araçlar için pekiştirmeli öğrenmeli enerji kontrol stratejisi

    ZEKERİYA ENDER EĞER

    Yüksek Lisans

    İngilizce

    İngilizce

    2022

    Mekatronik MühendisliğiSabancı Üniversitesi

    Mekatronik Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ TUĞÇE YÜKSEL BEDİZ

    PROF. DR. SERHAT YEŞİLYURT

  2. İnsansı robot yürüyüşünün derin pekiştirmeli öğrenme tabanlı kontrolü

    Deep reinforcement learning-based control of humanoid robot walking

    MUSTAFA AYYILDIZ

    Doktora

    Türkçe

    Türkçe

    2026

    Elektrik ve Elektronik MühendisliğiAkdeniz Üniversitesi

    Elektrik ve Elektronik Mühendisliği Ana Bilim Dalı

    PROF. DR. ÖVÜNÇ POLAT

  3. Derin pekiştirmeli öğrenme tabanlı mobil robotun otonom davranışlarının geliştirilmesi

    Improving autonomous behavior of deep reinforcement learning based mobile robot

    MEHMET SAFA BİNGÖL

    Doktora

    Türkçe

    Türkçe

    2026

    Mekatronik MühendisliğiErciyes Üniversitesi

    Mekatronik Mühendisliği Ana Bilim Dalı

    PROF. DR. ŞAHİN YILDIRIM

  4. Derin pekiştirmeli öğrenme ile hibrit elektrikli araçlarda enerji yönetimi tasarımı: Ödül fonksiyonu analizi

    Energy management design in hybrid electric vehicles using deep reinforcement learning: Reward function analysis

    TANER YAŞA

    Yüksek Lisans

    Türkçe

    Türkçe

    2026

    Makine MühendisliğiTarsus Üniversitesi

    Makine Mühendisliği Ana Bilim Dalı

    DOÇ. DR. SERDAR COŞKUN

  5. Deep reinforcement learning approach in control of Stewart platform- simulation and control

    Stewart platformunun kontrolünde derin pekistirmeli öğrenme yaklaşımıc- simülasyon ve kontrol

    HADI YADAVARI

    Doktora

    İngilizce

    İngilizce

    2023

    Mekatronik Mühendisliğiİstanbul Teknik Üniversitesi

    Mekatronik Mühendisliği Ana Bilim Dalı

    DOÇ. DR. SERHAT İKİZOĞLU

    DR. ÖĞR. ÜYESİ VAHİT BARIŞ TAVAKOL