Deep reınforcement learnıng based hybrıd goalassıgned multı agent path plannıng ın dynamıcenvıronments
Dinamik ortamlarda derin pekiştirmeli öğrenme tabanlıhibrit hedef atamalı çok ajanlı yol planlama
- Tez No: 1004807
- Danışmanlar: PROF. DR. MUSTAFA ÜNEL
- Tez Türü: Yüksek Lisans
- Konular: Mühendislik Bilimleri, Mekatronik Mühendisliği, Engineering Sciences, Mechatronics Engineering
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: İngilizce
- Üniversite: Sabancı Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Mekatronik Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Depo, fabrika ve trafik gibi ortamlarda büyük robot filolarını koordine etmek, çok sayıda ajanın aynı alan içinde hızlı ve güvenli şekilde hareket etmesini gerektirir; ancak ortamlar dinamik ve kalabalık hale geldikçe geleneksel planlayıcılar ölçeklen- mekte zorlanır. Bu problem Multi-Agent Path Finding (MAPF) olarak ele alınır: birden fazla ajan, kısmi gözlem altında paylaşılan bir ortamda atanmış hedeflerine çarpışmadan ulaşırken görev süresi (makespan) ve yol maliyetini en aza indirme- lidir. Klasik optimal MAPF çözücüleri tam küresel bilgiyle güçlü garantiler sunsa da ajan sayısı arttığında ve sık yeniden-planlama gerektiğinde çalışma süresi hı- zla büyür; yalnızca öğrenmeye dayalı reaktif politikalar ise daha iyi ölçeklense de güvenlik güvencesi zayıf kalır ve yoğun, zamanla değişen sahnelerde başarısız ola- bilir. Bu tez, bu boşluğu kapatmak için merkezi olmayan bir pekiştirmeli öğrenme çerçevesi önerir: paylaşılan PPO tabanlı politika, iki aşamalı hedef atama önceliği (Öklid açık artırma ve A* maliyet inceltme), eylem başına çarpışma riskini tahmin eden tek-adım öngörülü bir kalkan ve yalnızca risk düşükken A* taklidini etkin- leştiren güvenlik kapılı öğretmen–öğrenci kaybı ile desteklenir. Hareketli engeller içeren dinamik ızgara ortamlarda yöntem, neredeyse kusursuz başarı ve hedef kap- saması sağlarken çarpışmaları ve makespan'i CBS tabanlı bir planlayıcıya ve güçlü DRL temellerine göre belirgin biçimde azaltır ve ortalama ödülü anlamlı şekilde yükseltir; sonuçlar, yapısal bileşenlerle desteklenen ve kalkanlanan RL'in güvenli, ölçeklenebilir ve reaktif MAPF için umut verici bir yol olduğunu gösterir.
Özet (Çeviri)
Coordinating large fleets of robots in warehouses, factories, and traffic systems re- quires moving many agents through the same space quickly and safely, yet traditional planners struggle to keep up as environments become dynamic and crowded. This challenge is formalized as the Multi-Agent Path Finding (MAPF) problem, where multiple agents must navigate a shared environment, reach their assigned goals, and avoid collisions while minimizing mission time and travel cost under partial observ- ability. Classical optimal MAPF solvers offer strong guarantees when full global information is available, but their runtime grows rapidly with agent count and fre- quent replanning, whereas purely learned reactive policies scale better but provide little safety assurance and often fail in dense scenes. This thesis introduces a decen- tralized reinforcement learning framework that aims to bridge this gap by combining a shared PPO-based policy with three structured components: a two-stage goal as- signment prior (Euclidean auction with A*-cost refinement), a one-step predictive shield that estimates per-action collision risk, and a safety-gated teacher–student loss that imitates A* when predicted risk is low. In dynamic grid environments with moving obstacles, the proposed method achieves near-perfect success and goal coverage, reduces collisions and makespan by roughly half compared to a CBS-based planner and strong DRL baselines, and yields substantially higher average rewards. Overall, the work shows that structured and shielded RL can provide a promising route toward safe, scalable, and reactive decentralized MAPF in realistic scenarios.
Benzer Tezler
- Reinforcement learning based energy management strategy for fuel cell hybrid vehicles
Hidrojen yakıt hücreli araçlar için pekiştirmeli öğrenmeli enerji kontrol stratejisi
ZEKERİYA ENDER EĞER
Yüksek Lisans
İngilizce
2022
Mekatronik MühendisliğiSabancı ÜniversitesiMekatronik Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ TUĞÇE YÜKSEL BEDİZ
PROF. DR. SERHAT YEŞİLYURT
- İnsansı robot yürüyüşünün derin pekiştirmeli öğrenme tabanlı kontrolü
Deep reinforcement learning-based control of humanoid robot walking
MUSTAFA AYYILDIZ
Doktora
Türkçe
2026
Elektrik ve Elektronik MühendisliğiAkdeniz ÜniversitesiElektrik ve Elektronik Mühendisliği Ana Bilim Dalı
PROF. DR. ÖVÜNÇ POLAT
- Derin pekiştirmeli öğrenme tabanlı mobil robotun otonom davranışlarının geliştirilmesi
Improving autonomous behavior of deep reinforcement learning based mobile robot
MEHMET SAFA BİNGÖL
Doktora
Türkçe
2026
Mekatronik MühendisliğiErciyes ÜniversitesiMekatronik Mühendisliği Ana Bilim Dalı
PROF. DR. ŞAHİN YILDIRIM
- Derin pekiştirmeli öğrenme ile hibrit elektrikli araçlarda enerji yönetimi tasarımı: Ödül fonksiyonu analizi
Energy management design in hybrid electric vehicles using deep reinforcement learning: Reward function analysis
TANER YAŞA
Yüksek Lisans
Türkçe
2026
Makine MühendisliğiTarsus ÜniversitesiMakine Mühendisliği Ana Bilim Dalı
DOÇ. DR. SERDAR COŞKUN
- Deep reinforcement learning approach in control of Stewart platform- simulation and control
Stewart platformunun kontrolünde derin pekistirmeli öğrenme yaklaşımıc- simülasyon ve kontrol
HADI YADAVARI
Doktora
İngilizce
2023
Mekatronik Mühendisliğiİstanbul Teknik ÜniversitesiMekatronik Mühendisliği Ana Bilim Dalı
DOÇ. DR. SERHAT İKİZOĞLU
DR. ÖĞR. ÜYESİ VAHİT BARIŞ TAVAKOL