Efficient resource orchestration for distributed large language model inference at the edge
Uç bilişimde dağıtık büyük dil modeli çıkarımı için etkin kaynak orkestrasyonu
- Tez No: 972453
- Danışmanlar: PROF. DR. ÖZGÜR ERÇETİN
- Tez Türü: Doktora
- Konular: Elektrik ve Elektronik Mühendisliği, Electrical and Electronics Engineering
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: İngilizce
- Üniversite: Sabancı Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Elektronik Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Gerçek zamanlı ve kaynak kısıtlı ortamlarda Büyük Dil Modelleri'nin (LLM'ler) giderek daha fazla yaygınlaştırılması, merkezi bulut çıkarımının yüksek gecikme süresi, maliyet ve ölçeklenebilirlik gibi temel sınırlamalarını gözler önüne sermiştir. Bu tez, uç bilişim ortamında etkin ve adil bir dağıtık LLM çıkarımı gerçekleştirmek amacıyla iki entegre çözüm önermektedir: Adil ve Maliyet-Etkin Teşvik Mekanizması (FCIM) ve Uyarlamalı Dinamik Zamanlama Algoritması (ADSA). FCIM, doğruluğu teşvik eden ve heterojen cihazlar arasında adil katılımı garanti altına alan, açık artırma tabanlı bir katman atama çerçevesi sunar. Bu yapı, görev gecikmesini, ödül maliyetini, bellek uygunluğunu ve sistem çapında hizalanmayı dinamik şekilde dengelemektedir. FCIM'i tamamlayıcı nitelikteki ADSA ise, katmanların yürütülmesini son teslim tarihlerine duyarlı ve kesintiye açık şekilde planlayarak, cihaz erişilebilirliği ve ağ koşullarındaki değişkenliklere uyum sağlarken kuyruk gecikmelerini azaltmayı hedeflemektedir. FCIM ve ADSA birlikte, uç ortamda çıkarım için ölçeklenebilir, teşvik uyumlu ve kaynak açısından verimli bir yaklaşım sunar. Bu mekanizmalar, GPT-Neo, GPT-3 ve BLOOM gibi farklı model mimarileri altında çeşitli GPU yapılandırmaları ve teklif senaryolarıyla gerçekleştirilen simülasyonlar aracılığıyla kapsamlı şekilde değerlendirilmiştir. Sonuçlar, FCIM'in iletişim yükünü %54,7'ye kadar, görev işleme süresini ise %36,9 oranında azalttığını; ADSA'nın ise klasik zamanlayıcılara kıyasla kuyruk gecikmelerini %39 oranında düşürdüğünü göstermektedir. Adalet, hem ödül hem de katman dağılımı üzerinde Jain endeksi ile nicel olarak doğrulanmış ve FCIM'in sürekli olarak temel yöntemlerden daha iyi performans gösterdiği ortaya konmuştur.
Özet (Çeviri)
The increasing deployment of Large Language Models (LLMs) in real-time and resource-constrained environments has exposed critical limitations of centralized cloud inference, including high latency, cost, and scalability concerns. This thesis addresses these challenges by proposing two integrated solutions for efficient and fair distributed LLM inference at the edge: the Fair Cost-Efficient Incentive Mechanism (FCIM) and the Adaptive Dynamic Scheduling Algorithm (ADSA). FCIM introduces an auction-based layer allocation framework that ensures truthful participation and fairness among heterogeneous devices, dynamically balancing task latency, reward cost, memory feasibility, and system-wide alignment. ADSA complements FCIM by scheduling layer execution in a deadline-aware and preemption-conscious manner, reducing queuing delay while adapting to fluctuating device availability and network conditions. Together, FCIM and ADSA offer a scalable, incentive-compatible, and resource-efficient approach for edge-based inference. The mechanisms are extensively evaluated through simulations across diverse model architectures, including GPT-Neo, GPT-3, and BLOOM, under varying GPU configurations and bidding scenarios. Results demonstrate that FCIM reduces communication overhead by up to 54.7% and task processing time by 36.9%, while ADSA decreases queuing delays by 39% compared to conventional schedulers. Fairness is quantitatively validated using Jain's index over both reward and layer distributions, with FCIM consistently outperforming baseline methods. This thesis establishes a principled foundation for deploying LLMs in federated, latency-sensitive environments and offers insights into future extensions involving reinforcement learning, multi-tenant inference, and real-world edge deployments.
Benzer Tezler
- Techniques for efficient execution of large-scale scientific workflows in distributed environments
Başlık çevirisi yok
SELİM KALAYCI
Doktora
İngilizce
2014
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolFlorıda Internatıonal UnıversıtyBilgisayar Bilimleri ve Mühendisliği Ana Bilim Dalı
PROF. S. MASOUD SADJADI
- Dağıtık mimari tasarımı ve yönetim sistemi geliştirilmesi
Distributed architecture design and management system development
MUSTAFA HALUK AKGÜNDÜZ
Yüksek Lisans
Türkçe
2015
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. EŞREF ADALI
- Servis yönelimli mimari ve bulanık mantık tabanlı üniversite bilgi sistemi
Service oriented architecture and fuzzy logic based university information system
HACI ALİ CANLI
Yüksek Lisans
Türkçe
2019
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolGazi ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. NECAATTİN BARIŞÇI
- Libya'nın yenilenebilir enerji kaynakları ve ekonomik kalkınmasının geleceği: Türkiye'den pragmatik bir katkı endeksi
Prospective of the Libyan renewable energy sources and economic development: A pragmatic contributive i̇ndex from Türkiye
BADR SALAHEDDİN NASR
Yüksek Lisans
Türkçe
2019
EnerjiNevşehir Hacı Bektaş Veli Üniversitesiİktisat Ana Bilim Dalı
PROF. DR. ALPER ASLAN
- Efficient orchestration methods in air computing using deep reinforcement learning
Havada hesaplamada derin pekiştirmeli öğrenme kullanarak etkili orkestrasyon yöntemleri
BARIŞ YAMANSAVAŞÇILAR
Doktora
İngilizce
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolBoğaziçi ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. CEM ERSOY
DOÇ. DR. ATAY ÖZGÖVDE