Geri Dön

Dil modelleri arasında bilgi aktarımı

Information transfer between language models

  1. Tez No: 997028
  2. Yazar: MUZAFFER KAAN YÜCE
  3. Danışmanlar: PROF. DR. MEHMET FATİH AMASYALI
  4. Tez Türü: Doktora
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2026
  8. Dil: Türkçe
  9. Üniversite: Yıldız Teknik Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Bilgisayar Mühendisliği Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Büyük dil modelleri, yüksek performanslarına rağmen eğitimi ve görev-özel uyarlaması yüksek hesaplama maliyeti, geniş veri gereksinimi ve uzun eğitim süreleri isteyen sistemlerdir. Bu durum, yeni görevler veya veri alanları için modeli yeniden eğitmeyi zorlaştırmakta; farklı modellerde öğrenilen bilginin verimli biçimde yeniden kullanılmasını sınırlamaktadır. Tezin temel amacı, dil modellerinde öğrenilmiş bilginin farklı modellere ve görevlere düşük maliyetle aktarılmasını sağlarken performans kaybını en aza indirmektir. Bu doğrultuda üç tamamlayıcı yaklaşım önerilmiştir. İlk bölümde, dil modellerinin ağırlık düzeyinde birleştirilmesi incelenmiştir. Mevcut yöntemlerin tüm katmanlarda sabit karışım oranı kullanması, katmanların işlevsel farklılıklarını göz ardı etmektedir. Bu sorunu aşmak için, katmanların katkılarını dikkate alan ve karışım oranlarını iki aşamalı bir arama stratejisiyle belirleyen KAFA-Merge yaklaşımı geliştirilmiştir. Türkçe değerlendirme senaryolarında yapılan deneyler, KAFA-Merge'in mevcut birleştirme yöntemlerine göre daha yüksek başarı sağladığını göstermiştir. İkinci bölümde, bilgi aktarımında yaygın kullanılan KL tabanlı kaybın her örnek için uygulanmasının yüksek maliyet ve düşük etkinlik oluşturduğu problemi ele alınmıştır. Bu nedenle KL tabanlı distilasyon yalnızca modelin zorlandığı örneklerde etkinleştirilen seçici bir stratejiyle uygulanmıştır. Böylece eğitim süreci kolay örneklerde temel hedefle ilerlerken zor örneklerde ek yönlendirme ile desteklenmiştir. Türkçe veri kümelerinde yapılan deneyler, bu yöntemin verimlilik ve performans açısından avantaj sağladığını göstermiştir. Üçüncü bölümde, modelin kendi çıktılarından yararlanarak hataları azaltmayı hedefleyen seçici kendinden öğrenme yaklaşımı önerilmiştir. Model, kendi tahminlerinden elde ettiği düzeltme sinyalini yalnızca gerekli durumlarda kullanarak zayıf kaldığı örneklere odaklanmıştır. Deneyler, yöntemin verimlilik ve genel performans açısından pratik kazanımlar sunduğunu göstermiştir. Özetle, tez model birleştirme, zor örneklerde seçici KL aktarımı ve seçici öz-düzeltme yaklaşımlarıyla yüksek maliyetli yeniden eğitimi azaltarak Türkçe gibi sınırlı kaynaklı senaryolarda verimlilik, yeniden kullanım ve performans açısından katkı sağlamayı amaçlamaktadır.

Özet (Çeviri)

Large language models, despite their high performance, are systems whose training and task-specific adaptation require high computational cost, large amounts of data, and long training times. This makes it difficult to retrain models for new tasks or new data domains and limits the efficient reuse of knowledge learned by different models. The main objective of this thesis is to transfer learned knowledge across models and tasks at low cost while minimizing performance loss. To this end, the thesis proposes three complementary approaches. In the first part, the study focuses on model merging at the weight level across different language models. Existing merging methods typically use fixed mixing ratios across all layers, which can limit merge quality by ignoring functional differences between layers. To address this, the thesis introduces KAFA-Merge, a method that accounts for varying layer contributions and determines mixing ratios through a two-stage search strategy. Extensive experiments in Turkish evaluation scenarios show that KAFA-Merge can achieve higher performance than existing merging methods. In the second part, the thesis addresses a limitation of knowledge transfer methods that apply a KL-based loss to every example: this can be computationally expensive and may reduce effectiveness by unnecessarily spreading the learning signal over“easy”examples. Accordingly, a selective strategy is adopted in which KL-based distillation is activated only on examples where the model struggles. Thus, training proceeds with the base objective on regular examples while receiving stronger guidance on difficult ones. Experiments on different Turkish datasets demonstrate that this selective approach can provide advantages in both efficiency and performance. In the third part, the thesis examines a selective self-learning (self-distillation) approach that aims to reduce errors by leveraging the model's own outputs in addition to classical training. The model generates a correction signal from its own predictions and uses this signal as a learning target only when deemed necessary. In this way, the method is transformed from a general mechanism applied uniformly to all outputs into a selective self-correction process that focuses on cases where the model is weak. Experimental findings indicate practical gains in both efficiency and overall performance. In summary, this thesis addresses knowledge transfer among language models through model merging, selective KL-based transfer on hard examples, and selective self-correction, aiming to reduce the need for costly retraining and to offer practical contributions in efficiency, reusability, and performance—especially in relatively resource-limited settings such as Turkish.

Benzer Tezler

  1. Eine didaktisch- komparatistische annäherung an die phänomene“ empathie, identitätsuche und fremdverstehen”in der kinder-und jugendliteratur: dargestellt an den werken , von Canan Tan's „Eroi̇nle Dans“ und Renate Welshs „Dieda oder das fremde Kind”

    Renate Welsh'in“Dieda oder das fremde Kind„ ve Canan Tan'ın ”Eroinle Dans„ adlı eserlerinde çocuk ve gençlik yazını bağlamında ‚ "empati, kimlik arayışı ve yabancılaşma„ ' kavramlarına öğretbilimsel bir yaklaşım

    ZEYNEP TEKİN MEDENİ

    Doktora

    Almanca

    Almanca

    2017

    Alman Dili ve EdebiyatıÇukurova Üniversitesi

    Alman Dili Eğitimi Ana Bilim Dalı

    YRD. DOÇ. DR. CAVİDAN ÇÖLTÜ İMREN

  2. Cross model alignment in natural language processing

    Doğal dil işlemede modeller arası hizalama

    KADİR GÜNEL

    Doktora

    İngilizce

    İngilizce

    2024

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolYıldız Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. MEHMET FATİH AMASYALI

  3. Distilling knowledge of neural networks for image analysis, model compression, data protection and minimization

    Görüntü analizi, model sıkıştırma, veri koruma ve minimizasyonu için yapay sinir ağlarının bilgisinin damıtılması

    REYHAN KEVSER KESER

    Doktora

    İngilizce

    İngilizce

    2024

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilişim Uygulamaları Ana Bilim Dalı

    PROF. DR. BEHÇET UĞUR TÖREYİN

  4. Bridging knowledge across architectural heritage and digital fabrication technologies

    Mimari miras ile dijital fabrikasyon teknolojileri arasında bilgi köprüsü kurmak

    BEGÜM HAMZAOĞLU

    Doktora

    İngilizce

    İngilizce

    2024

    Mimarlıkİstanbul Teknik Üniversitesi

    Bilişim Ana Bilim Dalı

    PROF. DR. MİNE ÖZKAR KABAKÇIOĞLU

  5. Taxonomy and visualization of digital architecture knowledge: Proposal for a scientific online encyclopedia

    Dijital mimarlık bilgisinin taksonomisi ve görselleştirilmesi: Bilimsel bir çevrim içi ansiklopedi önerisi

    ESRANUR KARACİF

    Doktora

    İngilizce

    İngilizce

    2025

    Mimarlıkİstanbul Teknik Üniversitesi

    Bilişim Ana Bilim Dalı

    DOÇ. DR. ETHEM GÜRER