Deep reinforcement learning based uplink resource allocation in open ran systems
Open ran sistemlerinde derin pekiştirmeli öğrenme tabanlı yukarı yönlü kaynak ataması
- Tez No: 975314
- Danışmanlar: PROF. DR. HAKAN ALİ ÇIRPAN
- Tez Türü: Yüksek Lisans
- Konular: Elektrik ve Elektronik Mühendisliği, Electrical and Electronics Engineering
- Anahtar Kelimeler: Dinamik çizelgeleme, Elektronik haberleşme, Dynamic scheduling, Electronic communication
- Yıl: 2025
- Dil: İngilizce
- Üniversite: İstanbul Teknik Üniversitesi
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Elektronik ve Haberleşme Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Elektronik Mühendisliği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Yeni nesil mobil iletişim ağlarının karmaşıklığı arttıkça, kaynak tahsisi, baz istasyonu üreticileri arasında rekabet avantajı sağlamak için temel teknolojilerden biri haline gelmektedir. Yapay zeka, özellikle pekiştirmeli öğrenme, bu alanda önemli iyileştirme fırsatları sunmaktadır. Ayrıca, Açık Radyo Erişim Ağı (O-RAN) mimarisi, rApp ve xApp kavramları aracılığıyla yapay zeka yeteneklerinin ağlara sorunsuz bir şekilde entegrasyonunu sağlamaktadır. Bu makale, veri hızı ve/veya adalet ölçütlerini dikkate alan iki derin pekiştirmeli öğrenmeye (DRL) dayalı yukarı yönlü kaynak tahsisi yöntemini sunmaktadır. Birinci yöntem veri hızı ölçütünü en üst düzeye çıkarmaya odaklanırken, ikinci yöntem ise veri hızı ve adalet ölçütleri arasında bir denge sağlamaya odaklanmaktadır. Önerilen yapı ile O-RAN mimarisinde, birden fazla eğitilmiş DRL modeli rApp politikaları tarafından yönetilerek, değişen uygulama gereksinimlerine göre sınırlı radyo kaynaklarını dinamik olarak tahsis edebilmektedir. Simülasyon sonuçları, derin pekiştirmeli öğrenme tabanlı yukarı yönlü kaynak tahsisi yöntemlerinin, üst seviye politikalarca belirlenen farklı performans hedeflerini etkili bir şekilde karşılayabildiğini göstermektedir. Open RAN, operatörlerin farklı tedarikçilerin en iyi bileşenlerini standartlaştırılmış açık arayüzler aracılığıyla entegre edebileceği bir radyo erişim ağı çerçevesine atıfta bulunmaktadır. Bu yaklaşım, telekomünikasyon sektöründe sıkça karşılaşılan ve operatörlerin her bir RAN bileşeni için tek bir tedarikçiye bağımlı hale geldiği bir sorun olan tedarikçi bağımlılığının risklerini ve sınırlamalarını azaltır. Open RAN, operatörlerin ağlarını inşa etmek için mevcut en iyi ürünleri seçip entegre etmelerine olanak tanır. Ayrıca, daha küçük tedarikçilerin pazara girmesini sağlayarak daha rekabetçi ve yenilikçi bir RAN geliştirme ekosisteminin oluşmasına katkıda bulunur. 5G ve gelecekteki ağlar söz konusu olduğunda, açık RAN mimarileri ve metodolojileri hayati önem taşımaktadır. O-RAN'ın getirdiği en temel yeniliklerden biri, RAN Akıllı Denetleyici (RIC) aracılığıyla sağlanan optimizasyon ve veri analitiği yeteneğidir. Near Real-Time (Near-RT) ve Non-Real-Time (Non-RT) kontrol döngüleriyle mobil ağlar, sektör tarafından sağlanan üçüncü parti bileşenler ve algoritmalarla kendilerini daha etkili ve verimli bir şekilde optimize edebilmektedir. RAN Akıllı Denetleyici, O-RAN mimarisi içerisindeki en yenilikçi unsurlardan biri olup, operatörlerin ağlarını kontrol etmelerine ve optimize etmelerine olanak tanır. RIC, O-RAN'ın yazılım tanımlı bir bileşeni olarak ağ kaynaklarının verimli kullanımını artırır. Üçüncü parti yazılım entegrasyonunu destekleyerek, daha geniş bir yazılım geliştirme ekosisteminin RAN bileşenlerinin programlanabilirliğini iyileştirme konusundaki uzmanlığını uygulamasına olanak sağlar. RIC, operatörlere deneyim kalitesi (QoE) odaklı kaynak yönetimi, trafik yönlendirme ve RAN bileşenlerinin enerji verimli yönetimi gibi yetenekler sunar. Kaynak tahsisinde makine öğrenimi tekniklerinin uygulanabilmesi için 5G'deki ve 6G'de beklenen çizelgeleme süreçlerinin anlaşılması gereklidir. Çizelgeleyiciler, hizmet kalitesi (QoS) politikaları, geçmiş veri hızı istatistikleri, arabellek durumu ve benzeri çeşitli girdilerle çalışabilir. Ayrıca, kullanıcı ekipmanları arası kaynak dağıtım adaleti, toplam aktarım hızı, etkili veri iletimi (goodput), gecikme ve güvenilirlik gibi belirli hedefler veya hedeflerin kombinasyonları için optimize edilebilir. 5G'deki downlink ve uplink çizelgeleme süreçleri benzerdir, ancak bazı farklılıklar bulunmaktadır. Uplink çizelgeleme, kullanıcı ekipmanlarının (UE) baz istasyonuna ilettiği arabellek durumu bilgisine dayanırken, downlink zamanlamada bu bilgi halihazırda baz istasyonu tarafından bilinmektedir. Geleneksel çizelgeleme yöntemleri arasında Round Robin, En İyi Kanal Kalite İndeksi (Best-CQI) ve Orantılı Adil (Proportional Fair) yöntemleri bulunmaktadır. Geleneksel yöntemler ve bunların varyasyonlarına ek olarak, kaynak tahsisine yönelik makine öğrenimi tabanlı yaklaşımlar da uygulanmıştır. Bu yaklaşımlar arasında, pekiştirmeli öğrenme, ajanların eylemler gerçekleştirerek, çevreyi gözlemleyerek ve aldıkları ödüllere dayanarak eylemlerini iyileştirdiği bir teknik olarak öne çıkmaktadır. Bu çalışmada, pekiştirmeli öğrenme türleri ve temel ilkeleri açıklandıktan sonra, kaynak tahsisi araştırmalarında kullanılan pekiştirmeli öğrenme algoritmalarına ilişkin ayrıntılı bir tartışma yapılmıştır. Sistem modeli, O-RAN'ın mimari tanımına dayanmaktadır; burada rApp'ler, yüksek düzeydeki ağ politikalarını yönetmektedir. Bu uygulamalar, Near-RT RIC ile arayüzü bulunan Non-RT RIC'te bulunmaktadır. Diğer bir uygulama türü olan xApp'ler ise, Near-RT RIC'te yer alarak gerçek zamana yakın işlevleri optimize etmektedir. Sistem modelinde, birden fazla derin pekiştirmeli öğrenme (DRL) ajanı xApp'ler içinde çalışmaktadır. rApp tarafından belirlenen yüksek düzey politika kararlarına göre, xApp'te belirli bir ajan seçilerek O-DU Ortam Erişim Kontrol (MAC) katmanında yapılan uplink çizelgeleme kararlarına etki edebilmektedir. xApp'lerdeki DRL ajanları için Deep Q-Learning algoritması seçilmiştir. Çalışma kapsamındaki ajanların eğitimi ve simülasyonu, MATLAB'ın 5G Toolbox'ı ve Reinforcement Learning Toolbox'ı kullanılarak entegre bir platformda gerçekleştirilmiştir. MATLAB'ın 5G Toolbox'ı, esnek ve 3GPP standardına uyumlu gerçekçi bir simülasyon ortamı sunar. Bu araç, geniş bir senaryo ve algoritma yelpazesini test etmek ve simüle etmek için özelleştirilebilir. Ancak, 5G Toolbox, Pekiştirmeli Öğrenme Toolbox'ı ile entegre değildir. Bu çalışma, DRL ajanları tarafından alınan kararların uygulanabilmesini sağlamak amacıyla 5G Toolbox içerisindeki kaynak tahsisi prosedürünü özelleştirmektedir. MATLAB'ın Reinforcement Learning Toolbox'ı ise, RL ajanlarını eğitmek ve simüle etmek için bir platform sağlar. Bu araç, DQN, PPO, SAC ve DDPG gibi yerleşik ajanlar içererek kullanıcıların karar verme algoritmaları tasarlamasına olanak tanır. Bu çalışma, RL ajanlarını oluşturmak, tasarlanan girdilere dayalı olarak eğitmek ve ajanları 5G Toolbox tarafından sağlanan 5G ortamında simüle etmek için Reinforcement Learning Toolbox'ı kullanmaktadır. Simülasyonlarda söz konusu RL ajanlarını kullanmadan önce ajanlar eğitilmiştir. Eğitim süreci, DRL ajanının rastgele eylemler gerçekleştirmesiyle başlar. Her eylem, mevcut RB'lerin (Kaynak Blokları) her kullanıcıya atanma yüzdesini içeren bilgileri içerir. Daha sonra, 5G simülasyon ortamı 1 çerçeve boyunca çalışır ve ilgili kaynak tahsisi eylemini uygular. Ortam, bu çalıştırmanın sonuçlarını, örneğin kullanıcı ekipmanlarının arabellek durumları ve veri hızları gibi bilgileri sağlar. DRL ajanı, elde edilen duruma dayanarak ödülleri hesaplar. Algoritma yakınsama kriterlerine ulaşırsa eğitim süreci sona erer. Aksi takdirde bir sonraki adıma devam eder. Bu çalışmada, bir ajan, veri hızını maksimize etmek için eğitilirken (DRL Ajan-1), diğer ajan hem veri hızı hem de adalet ölçütlerini optimize etmiştir (DRL Ajan-2). Simülasyon sonuçları, veri akışına odaklanan ajanın Best-CQI ile benzer performans sergilediğini, veri hızı ve adalet dengesini gözeten ajanın ise orantılı adil yaklaşıma benzer sonuçlar verdiğini göstermiştir. RL tabanlı kaynak tahsisi, geleneksel Best-CQI ve Orantılı Adil kaynak tahsisi algoritmaları ile karşılaştırılmıştır. Analiz edilen sonuçlara göre, xApp içindeki DRL Ajan-1'in, neredeyse Best-CQI algoritmasıyla aynı veri aktarım seviyelerine ulaştığı gözlemlenmiştir. Ancak, DRL ajanının kaynak tahsisi çözünürlüğünün 10 ms olduğu, Best-CQI algoritmasının ise kaynakları slot bazlı olarak planladığı unutulmamalıdır. Hem veri aktarımı hem de adalete odaklanan DRL Ajan-2, Best-CQI ve Orantılı Adil ajanlarla da karşılaştırılmıştır. DRL Ajan-2, adalet açısından Best-CQI ve DRL Ajan-1'i geride bırakmıştır. Bununla birlikte, DRL Ajan-2, adaletten ziyade veri aktarımını önceliklendiren bir politika ile yapılandırıldığından, adalet seviyesi Orantılı Adil ajanına göre daha düşük kalmıştır. Eğitimde yakınsama performansına özel önem verilmiş ve farklı ortam ve ajan parametrelerinin yakınsama üzerindeki etkisi analiz edilmiştir. Ajanın parametrelerinin ve çevresel koşulların değiştirilmesi, DRL ajanlarının yakınsama süresi ve performansı üzerinde önemli bir etki yaratabilir. Bu bölümde, farklı yapılandırmalar altında ajanların eğitim sonuçları sunulmaktadır. Ayrıca, çeşitli simülasyon ortamı parametrelerine sahip senaryolar ele alınmış ve buna karşılık gelen eğitim sonuçları tartışılmıştır. İlk olarak, indirim oranı ve öğrenme oranı gibi hiperparametrelerin eğitim yakınsamasına olan etkisi incelenmiştir. Ardından, çeşitli pekiştirmeli öğrenme ajan türleri, eğitim yakınsama performanslarına göre karşılaştırılmıştır. Son olarak, çevredeki kullanıcı ekipmanlarının sayısı ile eğitim yakınsama arasındaki ilişki analiz edilmiştir. Bu çalışma, uplink çizelgelemede pekiştirmeli öğrenme tabanlı kaynak tahsisine yönelik yeni bir sistem modeli tanıtmaktadır. Alternatif bir kaynak tahsis yöntemi önermekle birlikte, çalışmada DRL ajanlarının eğitim yakınsamaları da incelenmiştir. Gelecekteki araştırmalarda sistemin ölçeklenebilirliğini artırmak ve gecikmeye duyarlı uygulamaları ele almak öncelikli hedef olacaktır.
Özet (Çeviri)
As the complexity of next-generation mobile communication networks increases, resource allocation becomes a critical technology for gaining a competitive edge. Artificial intelligence (AI), particularly reinforcement learning (RL), offers significant opportunities for improvement. The Open Radio Access Network (O-RAN) architecture facilitates the seamless integration of AI capabilities into networks. One of O-RAN's key innovations is the ability to perform interoperable optimization and data analytics via the RAN Intelligent Controller (RIC). With its Near Real-Time (Near-RT) and Non-Real-Time (Non-RT) control loops, mobile networks can optimize their operations more effectively and efficiently, leveraging third-party components and algorithms. A crucial element for implementing machine learning techniques in resource allocation is understanding the scheduling processes in 5G, 6G, and beyond. While scheduling mechanisms are defined by standardization organizations, the specific scheduling methods are left to vendors. Traditional methods, such as Round Robin, Best Channel Quality Indicator (CQI), and Proportional Fair, remain widely used in wireless networks. Additionally, reinforcement learning has emerged as an effective method for resource allocation, which is the primary focus of this study. The system model presented in this study is based on the O-RAN architecture, where rApps manage high-level network policies and reside in the Non-RT RIC, connected to the Near-RT RIC. xApps, which optimize near real-time functions, operate within the Near-RT RIC. In the system model, multiple deep reinforcement learning (DRL) agents function within xApps, with specific agents selected based on high-level policy decisions from the rApp to influence uplink scheduling made by the O-DU MAC layer. The Deep Q-Learning algorithm is used for the DRL agents. All training and simulations are carried out on an integrated platform utilizing MATLAB's 5G Toolbox and Reinforcement Learning Toolbox. One agent is trained to maximize throughput, while another agent jointly optimizes throughput and fairness. Simulation results show that the throughput-focused agent performs similarly to Best-CQI, while the agent balancing throughput and fairness behaves comparably to proportional fair. Particular emphasis is placed on training convergence, with an analysis of how various environmental and agent parameters impact convergence performance. In conclusion, this study introduces a novel system model for DRL-based resource allocation in uplink scheduling, and future research will focus on enhancing system scalability and addressing latency-sensitive applications.
Benzer Tezler
- Dondurularak saklamanın tavuk etinin bazı kalite özellikleri üzerine etkisi
Başlık çevirisi yok
Ö.EVREN ATASOY
Yüksek Lisans
Türkçe
1987
Gıda MühendisliğiEge ÜniversitesiGıda Mühendisliği Ana Bilim Dalı
DR. SUMRU TÖMEK
- Finite element investigation of beams of variable cross section
Başlık çevirisi yok
CAN BALKAYA
Yüksek Lisans
İngilizce
1987
İnşaat MühendisliğiOrta Doğu Teknik ÜniversitesiPROF. DR. ERGİN ÇITIPITIOĞLU
- Uygun sulama yönteminin seçimine ekonomik faktörlerin etkisi
Effect of economical factors on the selection of irrigation methods
YASEMİN ALTINORAK
Yüksek Lisans
Türkçe
1987
ZiraatAnkara ÜniversitesiKültürteknik Ana Bilim Dalı
YRD. DOÇ. DR. OSMAN YILDIRIM
- Nevşehir doyduk sulama alanı drenaj-tuzluluk sorunları ve çözüm yolları
Drainage-salinity problems and solution means in the Nevşehir doyduk irrigation area
CENGİZ KOÇ