Deep reinforcement learning for stackelberg dynamic pricing: from dp benchmarks to multi-agent competition
Stackelberg dinamik fiyatlandırma için derin pekiştirmeli öğrenme: DP referanslarından çok ajanlı rekabete
- Tez No: 1010605
- Danışmanlar: DR. ÖĞR. ÜYESİ MEHMET YASİN ULUKUŞ
- Tez Türü: Yüksek Lisans
- Konular: Endüstri ve Endüstri Mühendisliği, Industrial and Industrial Engineering
- Anahtar Kelimeler: Derin öğrenme, Dinamik programlama, Oyun teorisi, Pekiştirmeli öğrenme, Yapay zeka, Çok ajanlı sistemler, Deep learning, Dynamic programming, Game theory, Reinforcement learning, Artificial intelligence, Multiagent systems
- Yıl: 2026
- Dil: İngilizce
- Üniversite: İstanbul Teknik Üniversitesi
- Enstitü: Lisansüstü Eğitim Enstitüsü
- Ana Bilim Dalı: Veri Mühendisliği ve İş Analitiği Ana Bilim Dalı (disiplinlerarası)
- Bilim Dalı: Büyük Veri ve İş Analitiği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Dinamik fiyatlandırma, rakiplerin değişen piyasa koşullarına aktif olarak uyum sağladığı pazarlarda özellikle veri işleme ve veri saklama teknolojilerinin de gelişmesiyle kritik bir kavram haline gelmiştir. Rakiplerin fiyatlandırma stratejilerine, stok durumlarına ve piyasanın güncel koşullarına uyum sağlamak için rekabetçi pazarlarda kilit bir mekanizma haline gelmiştir. Bu alandaki önceki çalışmalar; e-ticaret, perakende, enerji ve havacılık gibi çeşitli sektörlerde stok/kapasite dengesi ve gerçek zamanlı kontrol gibi sorunları çözmek için zamanla gelişen farklı algoritmalar kullanılmıştır. Gelir Yönetimi (RM) yaklaşımlarının temeli olarak kabul edilen havacılık sektörüne yönelik ilk çalışmalar, kontrollü envanter yönetimi sayesinde farklı müşteri segmentleri için en üst düzey faydayı amaçladığını ortaya koymuştur. İlerleyen dönemlerdeki çalışmalar, gelir maksimizasyonuna ulaşmanın asıl yolunun, yalnızca stokları yönetmek değil, dinamik olarak optimal fiyatı bulmak ve fiyat dinamiklerini kavrayabilmek olduğunu göstermektedir. Daha sonra, optimal fiyatın belirlenmesinin satılan ürüne ve firmaya, ayrıca pazardaki rakiplerin stratejilerine bağlı olduğunu vurgulamıştır. Rekabet dinamiğinde matematiksel olarak optimal sonucu üreten Kesin Dinamik Programlama (DP) algoritmaları için talep modelinin tam bilinmesi önkoşulu, fiyatlama problemindeki durum uzayının (zaman, stok seviyesi, rakip fiyat stratejileri) büyüklüğüyle birleştiğinde“boyutsallığın laneti”sorununa sebep olmuştur. Bu darboğaz, çalışmaların odağını önce istatistiksel tahminlemeye Yaklaşık DP (ADP) algoritmalarına çevirmiştir. Son yıllarda ise teknolojik gelişmeler, durum gözlemlerini herhangi bir talep modeli gerekmeksizin (model-free) deneyimlerden öğrenme ve Derin Sinir Ağları kullanarak büyük ölçekli durum uzaylarında sorunları çözme yetenekleri sayesinde, fiyatlandırma problemlerinde Pekiştirmeli Öğrenme (RL) algoritmalarının kullanılmasını mümkün kılmıştır. Bu tez çalışmasında, envanter kısıtları olan sonsuz ufuklu bir ortamda dinamik fiyatlandırma problemi bir Markov Karar Süreci (MDP) olarak ele alınmaktadır. Kurulan simülasyon ortamında durum uzayı (state space); ajanların kendi fiyatlarından ve rakiplerin gözlemlenen son fiyatlarından oluşacak şekilde tasarlanmıştır. İlk olarak, tekel ve düopol piyasa yapılarında Dinamik Programlama (DP) ve Yaklaşık Dinamik Programlama (ADP) algoritmalarının performansını değerlendirmek üzere tüketicilerin fiyat ve marka tercihlerini olasılıksal olarak yansıtan Poisson tabanlı bir talep modeli formüle edilmiştir. Kesin DP yönteminin, hesaplanabilir tekel ortamlarında teorik optimal fiyat politikasını başarıyla yakaladığı gözlemlenmiştir. Bu durum RL ajanlarının performanslarını ölçmek adına güvenilir bir referans (benchmark) oluşturmuştur. Ayrıca, DP ve ADP yöntemlerinin kural tabanlı deterministik rakiplere (örneğin sabit fiyat veren, sürekli fiyat kıran) karşı rekabet güçlerini test etmek için düopol senaryolarda karşılaştırmalı analizler yapılmıştır. Buna ek olarak, simetrik tekel ve düopol deneyleri ile ayrık eylem uzayına sahip DQN ile sürekli eylem uzayına sahip SAC, DDPG, TD3 ve PPO gibi çeşitli güncel RL algoritmalarının eğitim süresi, örneklem verimliliği ve kümülatif ödül performansları karşılaştırmalı olarak analiz edilmiştir. Elde edilen bulgular, RL algoritmalarının tam piyasa dinamiklerini bilmeseler dahi, sadece deneme-yanılma ve etkileşim yoluyla DP referanslarına kıyasla fiyatlandırma politikalarını etkili bir şekilde öğrenebildiğini göstermektedir. Bu temeller üzerine inşa edilen çalışmanın temel amacı, literatürde çoğunlukla üzerinde durulan eşzamanlı (simultaneous) hamlelerle incelenen çok ajanlı dinamik fiyatlama modellerinin ötesine geçerek hiyerarşik Stackelberg yapısında dinamik fiyatlandırma problemini çözmektir. Çalışmada Stackelberg ortamlarındaki geleneksel lider-takipçi çerçevesi, benzer ürün/hizmetler sunan firmaların göreceli pazar güçleri dikkate alınarak genişletilmiştir. Bu doğrultuda, ajanların birbirlerinin stratejilerine uyum sağlaması ve buna karşın aldıkları aksiyonları yansıtabilmek amacıyla simülasyon ortamında sıralı eğitim (sequential learning) yöntemi uygulanmıştır. Bu bağlamda güncel RL algoritmalarından DQN'in, lider öğrenme algoritması (karşılaştırma için SAC, DDPG, TD3, PPO), takipçi gözlem dezavantajı, fiyat aralığı, lider sayısı, keşif yoğunluğu, pazar hacmi ve fiyat düzenleme maliyetleri gibi parametrik faktörlerle ilişkili performansı ve piyasa dengesine etkileri araştırılmaktadır. Deneysel sonuçlar, maksimum entropi prensibiyle çalışan SAC algoritmasının en yüksek teorik ödüle çok daha hızlı yakınsama gösterdiğini ancak SAC'ın sürekli keşif özelliği nedeniyle sabit fiyat gerektiren ortamlarda bile gelir kayıplarına yol açtığı gözlemlenmiştir. Buna karşın, ayrık fiyat adımları kullanan DQN'nin kümülatif uzun vadeli ödüller açısından daha istikrarlı performans gösterdiğine işaret etmektedir. Ayrıca, RL ajanlarının sıralı öğrenme (sequential learning) altında hem rol tabanlı zımni anlaşma yapabildiklerini hem de pazar payı kapmak yerine rekabet üstü (supra-competitive) fiyatlara, yani premium fiyat politikalarına da yakınsayabildikleri gözlemlenmiştir. Özellikle fiyat aralığının geniş olduğu rekabet ortamlarında, takipçi ajanların satış hacmini düşük tutup, kar marjını maksimize eden premium politikalara olan eğilimi artmıştır. Ancak, bu işbirliğine dayalı istikrarın çeşitli piyasa dinamiklerine karşı oldukça duyarlı olduğu kanıtlanmıştır: Takipçilerin bilgi/gözlem dezavantajı 1 adımdan 4 adıma çıkarıldığında takipçilerin ortam hakkındaki belirsizlikleri artmış, bu durum rekabet üstü fiyatlandırma politikası kararlarının önemli ölçüde azaltmış ve tüm ajanları rekabetçi fiyat kararlarına zorlamıştır. Ayrıca Poisson tabanlı müşteri modeline hem tüketicilerin fiyatlara ve ani fiyat değişikliklerine tepkisini hem de regülasyon risklerini yansıtabilmek adına eklenen fiyat değiştirme cezaları da ajanların premium fiyat politikalarından vazgeçmelerini sağlamış, ajanların rekabetçi bir fiyat dengesine yakınsamasını sağlamıştır. Son olarak, algoritma seçimi ile hesaplama maliyeti-ödül dengesi tartışılmış, elde edilen bulgular ışığında perakende yöneticileri ve regülatörler için RL ile yapılan algoritmik fiyatlandırmanın yaratabileceği riskler ve bu riskleri önlemek adına yönetimsel çıkarımlar aktarılmıştır. Gelecek çalışmalarda ajanların asimetrik bir şekilde ele alındığı, tamamlayıcı ve ikame ürünlerin bilgilerinden de faydalanarak oluşan fiyatlandırma stratejilerinin incelenmesi önerilmiştir.
Özet (Çeviri)
Dynamic pricing has become a key concept in markets where firms continuously adapt to changing market conditions by adjusting prices in response to demand and rival actions. Prior studies in the field of dynamic pricing have spanned across various sectors (e-Commerce, retail, energy, and aviation) aiming to solve problems such as stock/capacity balance, high-frequency data, and real-time control using various algorithms over time. Prior studies conducted for the aviation sector which are regarded as the foundation of Revenue Management (RM) approaches, and identified that these studies aimed to maximize benefits for different customer segments through controlled inventory. Subsequently, studies suggest that the way to achieve revenue maximization is to find the optimal price and capture the price dynamics. Later, some studies emphasized that determining the optimal price depends on the product and the company, and also on market rivals. However, the full demand knowledge requirement for exact DP algorithms is also taken into account since pricing is subject to the“curse of dimensionality”and related studies focus on approximate DP algorithms to address this problem. More recently, technological advances have enabled the deployment of RL algorithms in pricing problems due to their ability to learn from experience via state observations, solve large-scale problems using Deep Neural Networks. In this study, we address the dynamic pricing problem in an infinite-horizon setting with inventory constraints. We formulate a Poisson-based demand model to evaluate the performance of Dynamic Programming (DP) and Approximate Dynamic Programming (ADP) algorithms in solving the dynamic pricing problem in monopoly and duopoly markets. We observe that the exact DP successfully captures the theoretically optimal price policy in tractable monopoly environments. Furthermore, we conduct comparative analysis in duopoly with exact DP and ADP to test their competitiveness against rule-based deterministic competitors. In addition, we conduct symmetric monopoly and duopoly experiments using RL algorithms to evaluate their performance under several state-of-the-art RL algorithms and the duration of training. We demonstrate that RL algorithms can effectively learn the pricing policy problem by comparing them with dynamic programming benchmarks in such experiments. Building on these foundations, the core objective of this work is to solve a dynamic pricing problem in a Stackelberg setting. We extend the conventional leader-follower framework in Stackelberg settings with the relative market powers of companies offering similar products/services. In this context, we investigate the effects of state-of-the-art reinforcement learning algorithm DQN based on its performance in relation to parametric factors such as learning algorithm primarily DQN (SAC, PPO, DDPG, TD3 for comparison), follower timing disadvantage, price range, number of leaders, exploration intensity, market volume and price adjustment costs. Our experimental results indicate that the SAC algorithm exhibits convergence much more rapidly but DQN outperforms it in terms of cumulative long-term rewards. Besides, we observe that RL agents can both engage in role-based tacit collusion and converge towards premium (upper-bound) prices under sequential learning. However, this collusive stability is sensitive to market asymmetry; as the follower disadvantage increases or price adjustment costs are introduced, we indicate premium pricing policy diminishes significantly. Finally, we discuss algorithm selection, the computational cost-reward trade-off and the managerial implications of these findings.
Benzer Tezler
- Deep reinforcement learning for partially observable markov decision processes
Kısmi gözlemlenebilir markov karar süreçleri için derin pekiştirmeli öğrenme
MEHMET HAKLIDIR
Doktora
İngilizce
2022
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiKontrol ve Otomasyon Mühendisliği Ana Bilim Dalı
PROF. DR. HAKAN TEMELTAŞ
- Deep reinforcement learning for autonomous quadcopter guidance
Otonom dört rotorlu insansız hava aracı güdümü için derin pekiştirmeli öğrenme
ŞEVKET UTKU AYDINLI
Yüksek Lisans
İngilizce
2023
Havacılık ve Uzay MühendisliğiOrta Doğu Teknik ÜniversitesiHavacılık ve Uzay Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ ALİ TÜRKER KUTAY
- Deep reinforcement learning for urban modeling: Morphogenesis simulation of self-organized settlements
Derin pekiştirmeli öğrenme ile kentsel modelleme: Kendiliğinden örgütlenen yerleşimlerin morfogenez simülasyonu
HOUSSAME EDDINE HSAIN
Yüksek Lisans
İngilizce
2023
Mimarlıkİhsan Doğramacı Bilkent ÜniversitesiMimarlık, Planlama ve Tasarım Ana Bilim Dalı
Assoc. Prof. Dr. BURCU ŞENYAPILI ÖZCAN
Dr. YİĞİT ACAR
- Deep reinforcement learning for autonomous air combat under noisy observations
Gürültülü gözlem altında otonom hava muharebesi için derin pekiştirmeli ögrenme
AHMET SEMİH TAŞBAŞ
Yüksek Lisans
İngilizce
2023
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. NAZIM KEMAL ÜRE
- Deep reinforcement learning approach for trading automation in the stock market
Hisse senetlerinde işlem otomasyonu için derin güçlendirme öğrenme yaklaşımı
TAYLAN KABBANİ
Yüksek Lisans
İngilizce
2021
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolÖzyeğin ÜniversitesiVeri Bilimi Ana Bilim Dalı
Prof. Dr. EKREM DUMAN