Dil modelleri arasında bilgi aktarımı
Information transfer between language models
- Tez No: 997028
- Danışmanlar: PROF. DR. MEHMET FATİH AMASYALI
- Tez Türü: Doktora
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2026
- Dil: Türkçe
- Üniversite: Yıldız Teknik Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Büyük dil modelleri, yüksek performanslarına rağmen eğitimi ve görev-özel uyarlaması yüksek hesaplama maliyeti, geniş veri gereksinimi ve uzun eğitim süreleri isteyen sistemlerdir. Bu durum, yeni görevler veya veri alanları için modeli yeniden eğitmeyi zorlaştırmakta; farklı modellerde öğrenilen bilginin verimli biçimde yeniden kullanılmasını sınırlamaktadır. Tezin temel amacı, dil modellerinde öğrenilmiş bilginin farklı modellere ve görevlere düşük maliyetle aktarılmasını sağlarken performans kaybını en aza indirmektir. Bu doğrultuda üç tamamlayıcı yaklaşım önerilmiştir. İlk bölümde, dil modellerinin ağırlık düzeyinde birleştirilmesi incelenmiştir. Mevcut yöntemlerin tüm katmanlarda sabit karışım oranı kullanması, katmanların işlevsel farklılıklarını göz ardı etmektedir. Bu sorunu aşmak için, katmanların katkılarını dikkate alan ve karışım oranlarını iki aşamalı bir arama stratejisiyle belirleyen KAFA-Merge yaklaşımı geliştirilmiştir. Türkçe değerlendirme senaryolarında yapılan deneyler, KAFA-Merge'in mevcut birleştirme yöntemlerine göre daha yüksek başarı sağladığını göstermiştir. İkinci bölümde, bilgi aktarımında yaygın kullanılan KL tabanlı kaybın her örnek için uygulanmasının yüksek maliyet ve düşük etkinlik oluşturduğu problemi ele alınmıştır. Bu nedenle KL tabanlı distilasyon yalnızca modelin zorlandığı örneklerde etkinleştirilen seçici bir stratejiyle uygulanmıştır. Böylece eğitim süreci kolay örneklerde temel hedefle ilerlerken zor örneklerde ek yönlendirme ile desteklenmiştir. Türkçe veri kümelerinde yapılan deneyler, bu yöntemin verimlilik ve performans açısından avantaj sağladığını göstermiştir. Üçüncü bölümde, modelin kendi çıktılarından yararlanarak hataları azaltmayı hedefleyen seçici kendinden öğrenme yaklaşımı önerilmiştir. Model, kendi tahminlerinden elde ettiği düzeltme sinyalini yalnızca gerekli durumlarda kullanarak zayıf kaldığı örneklere odaklanmıştır. Deneyler, yöntemin verimlilik ve genel performans açısından pratik kazanımlar sunduğunu göstermiştir. Özetle, tez model birleştirme, zor örneklerde seçici KL aktarımı ve seçici öz-düzeltme yaklaşımlarıyla yüksek maliyetli yeniden eğitimi azaltarak Türkçe gibi sınırlı kaynaklı senaryolarda verimlilik, yeniden kullanım ve performans açısından katkı sağlamayı amaçlamaktadır.
Özet (Çeviri)
Large language models, despite their high performance, are systems whose training and task-specific adaptation require high computational cost, large amounts of data, and long training times. This makes it difficult to retrain models for new tasks or new data domains and limits the efficient reuse of knowledge learned by different models. The main objective of this thesis is to transfer learned knowledge across models and tasks at low cost while minimizing performance loss. To this end, the thesis proposes three complementary approaches. In the first part, the study focuses on model merging at the weight level across different language models. Existing merging methods typically use fixed mixing ratios across all layers, which can limit merge quality by ignoring functional differences between layers. To address this, the thesis introduces KAFA-Merge, a method that accounts for varying layer contributions and determines mixing ratios through a two-stage search strategy. Extensive experiments in Turkish evaluation scenarios show that KAFA-Merge can achieve higher performance than existing merging methods. In the second part, the thesis addresses a limitation of knowledge transfer methods that apply a KL-based loss to every example: this can be computationally expensive and may reduce effectiveness by unnecessarily spreading the learning signal over“easy”examples. Accordingly, a selective strategy is adopted in which KL-based distillation is activated only on examples where the model struggles. Thus, training proceeds with the base objective on regular examples while receiving stronger guidance on difficult ones. Experiments on different Turkish datasets demonstrate that this selective approach can provide advantages in both efficiency and performance. In the third part, the thesis examines a selective self-learning (self-distillation) approach that aims to reduce errors by leveraging the model's own outputs in addition to classical training. The model generates a correction signal from its own predictions and uses this signal as a learning target only when deemed necessary. In this way, the method is transformed from a general mechanism applied uniformly to all outputs into a selective self-correction process that focuses on cases where the model is weak. Experimental findings indicate practical gains in both efficiency and overall performance. In summary, this thesis addresses knowledge transfer among language models through model merging, selective KL-based transfer on hard examples, and selective self-correction, aiming to reduce the need for costly retraining and to offer practical contributions in efficiency, reusability, and performance—especially in relatively resource-limited settings such as Turkish.
Benzer Tezler
- Eine didaktisch- komparatistische annäherung an die phänomene“ empathie, identitätsuche und fremdverstehen”in der kinder-und jugendliteratur: dargestellt an den werken , von Canan Tan's „Eroi̇nle Dans“ und Renate Welshs „Dieda oder das fremde Kind”
Renate Welsh'in“Dieda oder das fremde Kind„ ve Canan Tan'ın ”Eroinle Dans„ adlı eserlerinde çocuk ve gençlik yazını bağlamında ‚ "empati, kimlik arayışı ve yabancılaşma„ ' kavramlarına öğretbilimsel bir yaklaşım
ZEYNEP TEKİN MEDENİ
Doktora
Almanca
2017
Alman Dili ve EdebiyatıÇukurova ÜniversitesiAlman Dili Eğitimi Ana Bilim Dalı
YRD. DOÇ. DR. CAVİDAN ÇÖLTÜ İMREN
- Cross model alignment in natural language processing
Doğal dil işlemede modeller arası hizalama
KADİR GÜNEL
Doktora
İngilizce
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolYıldız Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. MEHMET FATİH AMASYALI
- Distilling knowledge of neural networks for image analysis, model compression, data protection and minimization
Görüntü analizi, model sıkıştırma, veri koruma ve minimizasyonu için yapay sinir ağlarının bilgisinin damıtılması
REYHAN KEVSER KESER
Doktora
İngilizce
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilişim Uygulamaları Ana Bilim Dalı
PROF. DR. BEHÇET UĞUR TÖREYİN
- Bridging knowledge across architectural heritage and digital fabrication technologies
Mimari miras ile dijital fabrikasyon teknolojileri arasında bilgi köprüsü kurmak
BEGÜM HAMZAOĞLU
Doktora
İngilizce
2024
Mimarlıkİstanbul Teknik ÜniversitesiBilişim Ana Bilim Dalı
PROF. DR. MİNE ÖZKAR KABAKÇIOĞLU
- Taxonomy and visualization of digital architecture knowledge: Proposal for a scientific online encyclopedia
Dijital mimarlık bilgisinin taksonomisi ve görselleştirilmesi: Bilimsel bir çevrim içi ansiklopedi önerisi
ESRANUR KARACİF