Safety analysis and deep reinforcement learning implementation for an automatic emergency braking system
Otomatik acil fren sistemi için güvenlik analizi ve derin pekiştirmeli öğrenme uygulaması
- Tez No: 990215
- Danışmanlar: PROF. DR. MUSTAFA DOĞAN
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Mekatronik Mühendisliği, Computer Engineering and Computer Science and Control, Mechatronics Engineering
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: İngilizce
- Üniversite: İstanbul Teknik Üniversitesi
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Mekatronik Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Modern otomotiv sektöründe araç güvenliği, teknolojik gelişmelerin en öncelikli hedeflerinden birini oluşturmaktadır. Gelişmiş sürücü destek sistemleri (ADAS), bu hedefe ulaşmada kritik bir rol üstlenmekte olup söz konusu sistemler arasında Otomatik Acil Frenleme Sistemi (AEBS), potansiyel çarpışma durumlarında sürücüden bağımsız müdahale kapasitesi sayesinde öne çıkan bir konuma sahiptir. AEBS, sensör verilerine dayalı olarak yaklaşan tehlikeleri algılamakta ve gerekli görüldüğünde sürücü müdahalesi olmaksızın frenleme eylemini başlatmaktadır. Bu sayede hem çarpışma olasılığının azaltılması hem de kaçınılmaz durumlarda çarpışma şiddetinin minimize edilmesi amaçlanmaktadır. Bununla birlikte, AEBS'in güvenilir ve tutarlı bir performans sergilemesi çeşitli zorluklarla karşı karşıyadır. Algılama sistemlerinden kaynaklanan belirsizlikler, dinamik trafik ortamındaki karmaşık etkileşimler ve çevresel koşulların değişkenliği, sistemin karar verme mekanizmasını doğrudan etkilemektedir. Özellikle yapay zeka tabanlı kontrolcülerin kullanıldığı sistemlerde, öğrenen algoritmaların eğitim sürecinde beklenmeyen ancak istatistiksel açıdan ödüllendirici stratejilere yönelme eğilimi göstermesi, güvenlik gerekçelendirmesini daha da karmaşık bir hale getirmektedir. Bu bağlamda, öğrenme tabanlı kontrolcülerin güvenlik açısından kabul edilebilir davranış sınırları içinde kalmasını sağlayacak sistematik yaklaşımlara ihtiyaç duyulmaktadır. Bu tez çalışması, derin pekiştirmeli öğrenme (DRL) tabanlı bir AEBS geliştirme ve doğrulama yaklaşımı sunmaktadır. Çalışmanın temel amacı, yalnızca yüksek performanslı bir frenleme politikası elde etmekle sınırlı kalmayıp aynı zamanda öğrenen bir kontrolcünün tasarım, eğitim ve test aşamalarında güvenlik gereksinimlerine uyumunu sistematik olarak takip edilebilir kılmaktır. Bu doğrultuda, güvenlik analizi çıktılarının DRL tasarım kararlarıyla nasıl etkileşim içinde olabileceği araştırılmış ve güvenlik analizlerinde öngörülen potansiyel problem türleri ile gerçek sistem davranışları arasında izlenebilir bir bağlantı kurulması hedeflenmiştir. Çalışmada güvenlik analizi, Sistem-Teorik Süreç Analizi (STPA) ve Neden Ağacı Analizi (CTA) yöntemlerinin birlikte kullanılmasıyla gerçekleştirilmiştir. Bu analizler, ISO/PAS 8800 standardının yapay zeka tabanlı otomotiv sistemleri için önerdiği rehberlik ilkeleriyle uyumlu bir çerçevede yürütülmüştür. STPA metodolojisi, geleneksel arıza odaklı güvenlik analizlerinin ötesine geçerek sistem bileşenleri arasındaki kontrol ilişkilerini ve bu ilişkilerdeki aksaklıkların güvensiz durumlara nasıl yol açabileceğini incelemektedir. Analiz sürecinde öncelikle sistemdeki potansiyel tehlikeler tanımlanmış, ardından bu tehlikelere yol açabilecek güvensiz kontrol eylemleri belirlenmiştir. Güvensiz kontrol eylemleri; eylemin hiç gerçekleştirilmemesi, yanlış zamanda gerçekleştirilmesi, yanlış şiddette uygulanması veya gereğinden uzun ya da kısa sürmesi gibi kategoriler altında sınıflandırılmıştır. Son aşamada ise bu güvensiz kontrol eylemlerine neden olabilecek nedensel senaryolar sistematik biçimde türetilmiştir. CTA ile desteklenen bu analiz, öğrenen kontrolcünün potansiyel başarısızlık modlarının önceden öngörülmesine olanak tanımıştır. Güvenlik analizinden elde edilen çıktılar, DRL tabanlı kontrolcünün tasarım kararlarına doğrudan yansıtılmıştır. Ödül fonksiyonunun kurgulanmasında güvenlik gereksinimleri ile sürüş konforu arasındaki denge gözetilmiş; çarpışmadan kaçınma, gereksiz frenleme eylemlerinden sakınma ve kademeli müdahale gibi hedefler ödül bileşenlerine yansıtılmıştır. Bunun yanı sıra, eğitim sürecinde kullanılacak senaryo kapsamı, güvenlik analizinde belirlenen kritik durumları kapsayacak şekilde yapılandırılmıştır. İşletim tasarım alanının sınırları, örneğin müdahale eşiği değerleri ve fren şiddeti geçişleri, güvenlik önlemleri doğrultusunda tanımlanmıştır. Bu yaklaşım sayesinde, güvenlik analizi çıktıları ile öğrenen kontrolcünün davranışları arasında izlenebilir bir bağ kurulmuş ve potansiyel sorunlu davranışların kaynağına yönelik sistematik bir değerlendirme zemini oluşturulmuştur. Önerilen yaklaşım, MATLAB/Simulink ortamında senaryo yönelimli bir simülasyon altyapısı kullanılarak uygulanmıştır. Bu altyapıda, mevcut kural tabanlı acil frenleme mantığı, DRL ajanının ürettiği frenleme komutlarıyla değiştirilmiştir. Önemli bir tasarım kararı olarak, algılama katmanı ve araç dinamiği modelleri her iki yaklaşım için de ortak tutulmuştur. Bu sayede, yalnızca karar verme mekanizmasının değiştirilmesiyle karşılaştırılabilir bir deney ortamı sağlanmış ve farklı kontrolcü yaklaşımlarının performansı objektif kriterlere dayalı olarak değerlendirilebilmiştir. Çalışmada iki farklı DRL algoritması karşılaştırmalı olarak incelenmiştir. İlk algoritma, değer tabanlı ve ayrık eylem uzayına sahip Derin Q-Ağı (DQN) yaklaşımıdır. İkinci algoritma ise sürekli kontrol problemleri için tasarlanmış olan İkiz Gecikmeli Derin Deterministik Politika Gradyanı (TD3) yöntemidir. Her iki algoritma da ortak senaryo seti ve tutarlı değerlendirme kriterleri altında eğitilmiş ve test edilmiştir. Değerlendirme kriterleri arasında çarpışma önleme başarısı, frenleme zamanlamasının uygunluğu, fren şiddetinin kademeliliği ve genel sürüş konforu yer almıştır. Gerçekleştirilen testler, iki algoritma arasında kayda değer davranışsal farklılıklar ortaya koymuştur. DQN tabanlı yaklaşım, eğitim sürecinde yüksek ödül değerlerine ulaşma kapasitesi göstermiştir. Ancak test aşamasında bu yaklaşımın, bağlamdan bağımsız bir strateji geliştirdiği gözlemlenmiştir. Söz konusu strateji, tehlike düzeyi ve mesafe bilgisinden bağımsız olarak erken ve sert frenleme eylemi uygulamayı tercih etmektedir. Bu davranış kalıbı, eğitim ödüllerinin optimize edilmesine rağmen gerçek dünya performansında istenmeyen sonuçlara yol açabilecek bir örüntüyü temsil etmektedir. Bu bulgu, pekiştirmeli öğrenme tabanlı kontrolcülerde sıklıkla karşılaşılan bir probleme işaret etmektedir: Ödül fonksiyonunda hedeflenen güvenlik-konfor dengesi ile gerçek test davranışı arasında sapmalar meydana gelebilmektedir. Ajan, ödül bileşenlerinin beklenen şekilde dengelenmesi yerine, yüksek ödül garantileyen ancak aşırı muhafazakâr bir politikaya yakınsayabilmektedir. Buna karşılık TD3 tabanlı kontrolcü, senaryo dinamiklerine çok daha duyarlı bir davranış profili sergilemiştir. Bu yaklaşım, risk seviyesinin gelişimine bağlı olarak kademeli frenleme müdahaleleri gerçekleştirmiş ve farklı senaryolarda daha tutarlı bir performans göstermiştir. TD3 ajanı, düşük risk durumlarında minimal müdahale uygularken, tehlike seviyesi arttıkça frenleme şiddetini orantılı biçimde artırmıştır. Bu davranış örüntüsü, güvenlik gereksinimleri ile sürüş konforu arasındaki dengenin daha başarılı bir şekilde kurulduğunu göstermektedir. Bu tez çalışması, üç temel katkı sunmaktadır. Birincisi, STPA ve CTA tabanlı güvenlik analizinin öğrenen AEBS kontrolcüsünün tasarım sürecine doğrudan entegre edilebileceğini göstermiştir. Bu entegrasyon, güvenlik gereksinimlerinin tasarım kararlarına sistematik olarak yansıtılmasını mümkün kılmaktadır. İkincisi, izlenebilirlik yaklaşımının öğrenen kontrolcüde ortaya çıkabilecek sorunlu davranışların açıklanmasında ve köken analizinde fayda sağladığını ortaya koymuştur. Güvenlik analizi çıktıları ile gözlemlenen davranışlar arasındaki bağlantı, beklenmeyen stratejilerin nedenlerinin anlaşılmasına katkıda bulunmaktadır. Üçüncüsü, algoritma seçiminin test davranış kalitesini belirgin ölçüde etkilediği gösterilmiştir. Sürekli eylem uzayına sahip TD3 algoritması, ayrık eylem uzaylı DQN yaklaşımına kıyasla daha nuanslı ve bağlama duyarlı kontrol davranışları sergilemiştir. Sonuç olarak bu çalışma, yapay zeka tabanlı güvenlik kritik sistemlerin geliştirilmesinde güvenlik mühendisliği prensiplerinin öğrenen sistemlerin tasarımına nasıl entegre edilebileceğine dair somut bir metodoloji sunmaktadır.
Özet (Çeviri)
In advanced driver assistance systems, the Automatic Emergency Braking System (AEBS) plays a crucial role in reducing the risk of collisions. However, perception uncertainties, dynamic traffic interactions, and the risk that learning controllers adopt unexpected yet statistically rewarding strategies make the safety justification of AEBS more challenging. This thesis presents a DRL-based AEBS development and validation approach where safety analysis outputs are systematically displayed, controller design is performed using a deep reinforcement learning approach, and traceability is established between the problem types predicted in safety analyses and the observed behaviors during the design/training/testing processes. In this context, the study aims not only to achieve a high-performance braking policy but also to make visible the engineering steps that will support a learning controller to remain within safety-acceptable behavior boundaries. First, using System-Theoretical Process Analysis and Cause Tree Analysis, hazards, unsafe control actions, and causal scenarios were systematically identified in accordance with the ISO/PAS 8800 guidance. Subsequently, the safety measures derived from this analysis were evaluated in DRL design decisions, such as defining the action space, designing the reward function, determining the scope of scenarios to be used in training, and configuring operating limits, establishing a traceable link between safety outputs and the learning controller. The proposed approach was implemented in a MATLAB/Simulink-based scenario-oriented simulation infrastructure; rule-based emergency braking logic was replaced with braking commands generated by the DRL agent. Thus, a comparable experimental ground was created by changing only the decision-making mechanism while preserving the same perception and vehicle dynamics layers. DQN, representing the value-based discrete action approach, and TD3 algorithms, suitable for continuous control, were trained and tested comparatively under a common scenario set and consistent evaluation criteria. The results obtained show that, despite being able to achieve high reward values during the training process, the DQN-based approach converged to an undesirable strategy in the tests, such as early and hard braking, independent of the context. This indicates that deviations may occur between the safety-comfort balance targeted through reward components in training and the actual test behavior. In contrast, the TD3-based controller demonstrated a more successful establishment of the safety-comfort balance by exhibiting braking behaviors that were more sensitive to scenario dynamics, gradual according to the development of risk, and more consistent. In conclusion, this thesis demonstrates that STPA/CTA-based safety analysis can be directly integrated into the design of a learning AEBS controller, that the traceability approach is beneficial in explaining problematic behaviors that may arise in the learning controller, and that the choice of algorithm significantly affects the quality of test behavior.
Benzer Tezler
- Balancing mixed adversarial perturbations: Towards robust reinforcement learning
Karma çekişmeli bozulmaları dengeleme: Gürbüz pekiştirmeli öğrenmeye doğru
MUSTAFA ERDEM
Doktora
İngilizce
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiMekatronik Mühendisliği Ana Bilim Dalı
DOÇ. DR. NAZIM KEMAL ÜRE
- A comparative study of nonlinear model predictive control and reinforcement learning for path tracking
Yol izleme için doğrusal olmayan model öngörülü kontrol ve pekiştirmeli öğrenmenin karşılaştırmalı çalışması
GAMZE TÜRKMEN
Yüksek Lisans
İngilizce
2022
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiKontrol ve Otomasyon Mühendisliği Ana Bilim Dalı
PROF. DR. OVSANNA SETA ESTRADA
- Applications of deep reinforcement learning for advanced driving assistance systems
İleri sürüş destek sistemleri için derin pekiştirmeli öğrenme uygulamaları
MUHARREM UĞUR YAVAŞ
Doktora
İngilizce
2023
Otomotiv Mühendisliğiİstanbul Teknik ÜniversitesiMekatronik Ana Bilim Dalı
DOÇ. DR. TUFAN KUMBASAR
- Sepsis management in icu using explainable reinforcement learning
Açıklanabılır pekıştirmeli öğrenme ile yoğun bakımda sepsıs yönetımi
MEHMET GÜLDEN
Yüksek Lisans
İngilizce
2026
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolBahçeşehir ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. RÜŞTÜ MURAT DEMİRER
- Derin sinir ağları için mutasyon tabanlı test kütüphanesi geliştirilmesi
Development of mutation based test library for deep neural networks
GÖKHAN ÇETİNER
Yüksek Lisans
Türkçe
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolEskişehir Osmangazi ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. UĞUR YAYAN
PROF. DR. AHMET YAZICI