Geri Dön

Deep reinforcement learning for stackelberg dynamic pricing: from dp benchmarks to multi-agent competition

Stackelberg dinamik fiyatlandırma için derin pekiştirmeli öğrenme: DP referanslarından çok ajanlı rekabete

  1. Tez No: 1010605
  2. Yazar: FURKAN ORAL
  3. Danışmanlar: DR. ÖĞR. ÜYESİ MEHMET YASİN ULUKUŞ
  4. Tez Türü: Yüksek Lisans
  5. Konular: Endüstri ve Endüstri Mühendisliği, Industrial and Industrial Engineering
  6. Anahtar Kelimeler: Derin öğrenme, Dinamik programlama, Oyun teorisi, Pekiştirmeli öğrenme, Yapay zeka, Çok ajanlı sistemler, Deep learning, Dynamic programming, Game theory, Reinforcement learning, Artificial intelligence, Multiagent systems
  7. Yıl: 2026
  8. Dil: İngilizce
  9. Üniversite: İstanbul Teknik Üniversitesi
  10. Enstitü: Lisansüstü Eğitim Enstitüsü
  11. Ana Bilim Dalı: Veri Mühendisliği ve İş Analitiği Ana Bilim Dalı (disiplinlerarası)
  12. Bilim Dalı: Büyük Veri ve İş Analitiği Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Dinamik fiyatlandırma, rakiplerin değişen piyasa koşullarına aktif olarak uyum sağladığı pazarlarda özellikle veri işleme ve veri saklama teknolojilerinin de gelişmesiyle kritik bir kavram haline gelmiştir. Rakiplerin fiyatlandırma stratejilerine, stok durumlarına ve piyasanın güncel koşullarına uyum sağlamak için rekabetçi pazarlarda kilit bir mekanizma haline gelmiştir. Bu alandaki önceki çalışmalar; e-ticaret, perakende, enerji ve havacılık gibi çeşitli sektörlerde stok/kapasite dengesi ve gerçek zamanlı kontrol gibi sorunları çözmek için zamanla gelişen farklı algoritmalar kullanılmıştır. Gelir Yönetimi (RM) yaklaşımlarının temeli olarak kabul edilen havacılık sektörüne yönelik ilk çalışmalar, kontrollü envanter yönetimi sayesinde farklı müşteri segmentleri için en üst düzey faydayı amaçladığını ortaya koymuştur. İlerleyen dönemlerdeki çalışmalar, gelir maksimizasyonuna ulaşmanın asıl yolunun, yalnızca stokları yönetmek değil, dinamik olarak optimal fiyatı bulmak ve fiyat dinamiklerini kavrayabilmek olduğunu göstermektedir. Daha sonra, optimal fiyatın belirlenmesinin satılan ürüne ve firmaya, ayrıca pazardaki rakiplerin stratejilerine bağlı olduğunu vurgulamıştır. Rekabet dinamiğinde matematiksel olarak optimal sonucu üreten Kesin Dinamik Programlama (DP) algoritmaları için talep modelinin tam bilinmesi önkoşulu, fiyatlama problemindeki durum uzayının (zaman, stok seviyesi, rakip fiyat stratejileri) büyüklüğüyle birleştiğinde“boyutsallığın laneti”sorununa sebep olmuştur. Bu darboğaz, çalışmaların odağını önce istatistiksel tahminlemeye Yaklaşık DP (ADP) algoritmalarına çevirmiştir. Son yıllarda ise teknolojik gelişmeler, durum gözlemlerini herhangi bir talep modeli gerekmeksizin (model-free) deneyimlerden öğrenme ve Derin Sinir Ağları kullanarak büyük ölçekli durum uzaylarında sorunları çözme yetenekleri sayesinde, fiyatlandırma problemlerinde Pekiştirmeli Öğrenme (RL) algoritmalarının kullanılmasını mümkün kılmıştır. Bu tez çalışmasında, envanter kısıtları olan sonsuz ufuklu bir ortamda dinamik fiyatlandırma problemi bir Markov Karar Süreci (MDP) olarak ele alınmaktadır. Kurulan simülasyon ortamında durum uzayı (state space); ajanların kendi fiyatlarından ve rakiplerin gözlemlenen son fiyatlarından oluşacak şekilde tasarlanmıştır. İlk olarak, tekel ve düopol piyasa yapılarında Dinamik Programlama (DP) ve Yaklaşık Dinamik Programlama (ADP) algoritmalarının performansını değerlendirmek üzere tüketicilerin fiyat ve marka tercihlerini olasılıksal olarak yansıtan Poisson tabanlı bir talep modeli formüle edilmiştir. Kesin DP yönteminin, hesaplanabilir tekel ortamlarında teorik optimal fiyat politikasını başarıyla yakaladığı gözlemlenmiştir. Bu durum RL ajanlarının performanslarını ölçmek adına güvenilir bir referans (benchmark) oluşturmuştur. Ayrıca, DP ve ADP yöntemlerinin kural tabanlı deterministik rakiplere (örneğin sabit fiyat veren, sürekli fiyat kıran) karşı rekabet güçlerini test etmek için düopol senaryolarda karşılaştırmalı analizler yapılmıştır. Buna ek olarak, simetrik tekel ve düopol deneyleri ile ayrık eylem uzayına sahip DQN ile sürekli eylem uzayına sahip SAC, DDPG, TD3 ve PPO gibi çeşitli güncel RL algoritmalarının eğitim süresi, örneklem verimliliği ve kümülatif ödül performansları karşılaştırmalı olarak analiz edilmiştir. Elde edilen bulgular, RL algoritmalarının tam piyasa dinamiklerini bilmeseler dahi, sadece deneme-yanılma ve etkileşim yoluyla DP referanslarına kıyasla fiyatlandırma politikalarını etkili bir şekilde öğrenebildiğini göstermektedir. Bu temeller üzerine inşa edilen çalışmanın temel amacı, literatürde çoğunlukla üzerinde durulan eşzamanlı (simultaneous) hamlelerle incelenen çok ajanlı dinamik fiyatlama modellerinin ötesine geçerek hiyerarşik Stackelberg yapısında dinamik fiyatlandırma problemini çözmektir. Çalışmada Stackelberg ortamlarındaki geleneksel lider-takipçi çerçevesi, benzer ürün/hizmetler sunan firmaların göreceli pazar güçleri dikkate alınarak genişletilmiştir. Bu doğrultuda, ajanların birbirlerinin stratejilerine uyum sağlaması ve buna karşın aldıkları aksiyonları yansıtabilmek amacıyla simülasyon ortamında sıralı eğitim (sequential learning) yöntemi uygulanmıştır. Bu bağlamda güncel RL algoritmalarından DQN'in, lider öğrenme algoritması (karşılaştırma için SAC, DDPG, TD3, PPO), takipçi gözlem dezavantajı, fiyat aralığı, lider sayısı, keşif yoğunluğu, pazar hacmi ve fiyat düzenleme maliyetleri gibi parametrik faktörlerle ilişkili performansı ve piyasa dengesine etkileri araştırılmaktadır. Deneysel sonuçlar, maksimum entropi prensibiyle çalışan SAC algoritmasının en yüksek teorik ödüle çok daha hızlı yakınsama gösterdiğini ancak SAC'ın sürekli keşif özelliği nedeniyle sabit fiyat gerektiren ortamlarda bile gelir kayıplarına yol açtığı gözlemlenmiştir. Buna karşın, ayrık fiyat adımları kullanan DQN'nin kümülatif uzun vadeli ödüller açısından daha istikrarlı performans gösterdiğine işaret etmektedir. Ayrıca, RL ajanlarının sıralı öğrenme (sequential learning) altında hem rol tabanlı zımni anlaşma yapabildiklerini hem de pazar payı kapmak yerine rekabet üstü (supra-competitive) fiyatlara, yani premium fiyat politikalarına da yakınsayabildikleri gözlemlenmiştir. Özellikle fiyat aralığının geniş olduğu rekabet ortamlarında, takipçi ajanların satış hacmini düşük tutup, kar marjını maksimize eden premium politikalara olan eğilimi artmıştır. Ancak, bu işbirliğine dayalı istikrarın çeşitli piyasa dinamiklerine karşı oldukça duyarlı olduğu kanıtlanmıştır: Takipçilerin bilgi/gözlem dezavantajı 1 adımdan 4 adıma çıkarıldığında takipçilerin ortam hakkındaki belirsizlikleri artmış, bu durum rekabet üstü fiyatlandırma politikası kararlarının önemli ölçüde azaltmış ve tüm ajanları rekabetçi fiyat kararlarına zorlamıştır. Ayrıca Poisson tabanlı müşteri modeline hem tüketicilerin fiyatlara ve ani fiyat değişikliklerine tepkisini hem de regülasyon risklerini yansıtabilmek adına eklenen fiyat değiştirme cezaları da ajanların premium fiyat politikalarından vazgeçmelerini sağlamış, ajanların rekabetçi bir fiyat dengesine yakınsamasını sağlamıştır. Son olarak, algoritma seçimi ile hesaplama maliyeti-ödül dengesi tartışılmış, elde edilen bulgular ışığında perakende yöneticileri ve regülatörler için RL ile yapılan algoritmik fiyatlandırmanın yaratabileceği riskler ve bu riskleri önlemek adına yönetimsel çıkarımlar aktarılmıştır. Gelecek çalışmalarda ajanların asimetrik bir şekilde ele alındığı, tamamlayıcı ve ikame ürünlerin bilgilerinden de faydalanarak oluşan fiyatlandırma stratejilerinin incelenmesi önerilmiştir.

Özet (Çeviri)

Dynamic pricing has become a key concept in markets where firms continuously adapt to changing market conditions by adjusting prices in response to demand and rival actions. Prior studies in the field of dynamic pricing have spanned across various sectors (e-Commerce, retail, energy, and aviation) aiming to solve problems such as stock/capacity balance, high-frequency data, and real-time control using various algorithms over time. Prior studies conducted for the aviation sector which are regarded as the foundation of Revenue Management (RM) approaches, and identified that these studies aimed to maximize benefits for different customer segments through controlled inventory. Subsequently, studies suggest that the way to achieve revenue maximization is to find the optimal price and capture the price dynamics. Later, some studies emphasized that determining the optimal price depends on the product and the company, and also on market rivals. However, the full demand knowledge requirement for exact DP algorithms is also taken into account since pricing is subject to the“curse of dimensionality”and related studies focus on approximate DP algorithms to address this problem. More recently, technological advances have enabled the deployment of RL algorithms in pricing problems due to their ability to learn from experience via state observations, solve large-scale problems using Deep Neural Networks. In this study, we address the dynamic pricing problem in an infinite-horizon setting with inventory constraints. We formulate a Poisson-based demand model to evaluate the performance of Dynamic Programming (DP) and Approximate Dynamic Programming (ADP) algorithms in solving the dynamic pricing problem in monopoly and duopoly markets. We observe that the exact DP successfully captures the theoretically optimal price policy in tractable monopoly environments. Furthermore, we conduct comparative analysis in duopoly with exact DP and ADP to test their competitiveness against rule-based deterministic competitors. In addition, we conduct symmetric monopoly and duopoly experiments using RL algorithms to evaluate their performance under several state-of-the-art RL algorithms and the duration of training. We demonstrate that RL algorithms can effectively learn the pricing policy problem by comparing them with dynamic programming benchmarks in such experiments. Building on these foundations, the core objective of this work is to solve a dynamic pricing problem in a Stackelberg setting. We extend the conventional leader-follower framework in Stackelberg settings with the relative market powers of companies offering similar products/services. In this context, we investigate the effects of state-of-the-art reinforcement learning algorithm DQN based on its performance in relation to parametric factors such as learning algorithm primarily DQN (SAC, PPO, DDPG, TD3 for comparison), follower timing disadvantage, price range, number of leaders, exploration intensity, market volume and price adjustment costs. Our experimental results indicate that the SAC algorithm exhibits convergence much more rapidly but DQN outperforms it in terms of cumulative long-term rewards. Besides, we observe that RL agents can both engage in role-based tacit collusion and converge towards premium (upper-bound) prices under sequential learning. However, this collusive stability is sensitive to market asymmetry; as the follower disadvantage increases or price adjustment costs are introduced, we indicate premium pricing policy diminishes significantly. Finally, we discuss algorithm selection, the computational cost-reward trade-off and the managerial implications of these findings.

Benzer Tezler

  1. Deep reinforcement learning for partially observable markov decision processes

    Kısmi gözlemlenebilir markov karar süreçleri için derin pekiştirmeli öğrenme

    MEHMET HAKLIDIR

    Doktora

    İngilizce

    İngilizce

    2022

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Kontrol ve Otomasyon Mühendisliği Ana Bilim Dalı

    PROF. DR. HAKAN TEMELTAŞ

  2. Deep reinforcement learning for autonomous quadcopter guidance

    Otonom dört rotorlu insansız hava aracı güdümü için derin pekiştirmeli öğrenme

    ŞEVKET UTKU AYDINLI

    Yüksek Lisans

    İngilizce

    İngilizce

    2023

    Havacılık ve Uzay MühendisliğiOrta Doğu Teknik Üniversitesi

    Havacılık ve Uzay Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ ALİ TÜRKER KUTAY

  3. Deep reinforcement learning for urban modeling: Morphogenesis simulation of self-organized settlements

    Derin pekiştirmeli öğrenme ile kentsel modelleme: Kendiliğinden örgütlenen yerleşimlerin morfogenez simülasyonu

    HOUSSAME EDDINE HSAIN

    Yüksek Lisans

    İngilizce

    İngilizce

    2023

    Mimarlıkİhsan Doğramacı Bilkent Üniversitesi

    Mimarlık, Planlama ve Tasarım Ana Bilim Dalı

    Assoc. Prof. Dr. BURCU ŞENYAPILI ÖZCAN

    Dr. YİĞİT ACAR

  4. Deep reinforcement learning for autonomous air combat under noisy observations

    Gürültülü gözlem altında otonom hava muharebesi için derin pekiştirmeli ögrenme

    AHMET SEMİH TAŞBAŞ

    Yüksek Lisans

    İngilizce

    İngilizce

    2023

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. NAZIM KEMAL ÜRE

  5. Deep reinforcement learning approach for trading automation in the stock market

    Hisse senetlerinde işlem otomasyonu için derin güçlendirme öğrenme yaklaşımı

    TAYLAN KABBANİ

    Yüksek Lisans

    İngilizce

    İngilizce

    2021

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolÖzyeğin Üniversitesi

    Veri Bilimi Ana Bilim Dalı

    Prof. Dr. EKREM DUMAN