Geri Dön

Türkçe metinlerde sorguya uygun kısımların token seviyesinde tespiti için geç etkileşimli füzyon modeli

Token-level detection of query-relevant sections in Turkish texts using late-interaction fusion model

  1. Tez No: 985689
  2. Yazar: SALİH CAN TURAN
  3. Danışmanlar: DOÇ. DR. KAZIM YILDIZ, DR. ÖĞR. ÜYESİ ALİ SARIKAŞ
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilim ve Teknoloji, Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Science and Technology, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2025
  8. Dil: Türkçe
  9. Üniversite: Marmara Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Bilgisayar Bilimi ve Mühendisliği Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu tez çalışmasında, Türkçe metinlerde kullanıcı sorgularına uygun olan kısım-ların otomatik olarak tespit edilmesi ve vurgulanması problemi ele alınmıştır. Çalış-manın temel amacı, az sayıda etiketli veri ile etkili bir token seviyesi sınıflandırmamodeli geliştirerek, mevcut literatürdeki veri kıtlığı ve verimlilik sorunlarına çözümsunmaktır.Geleneksel bilgi erişim sistemlerinin belge seviyesinde çalışmasının aksine, buçalışma, metin içerisindeki token düzeyinde ayrıntılı bir analiz sunmaktadır. Buyaklaşım, kullanıcı sorgularına tam olarak hangi ifadelerin karşılık geldiğini sapta-yarak daha hassas sonuçlar üretmeyi amaçlamaktadır. Türkçe gibi eklemeli dillerinmorfolojik zenginliği, bu seviyedeki bir analizi özellikle zorlu kılmaktadır.Literatür incelemesi sonucunda, mevcut çalışmaların İngilizce metinler üzerindeyoğunlaştığı ve Türkçe için yeterli kaynak bulunmadığı tespit edilmiştir. Mevcut çö-zümler genellikle ya yüksek hesaplama maliyeti gerektiren cross-encoder mimarileriya da düşük performanslı bi-encoder yaklaşımları kullanmaktadır.Önerilen yaklaşım, artiwise-ai/modernbert-base-tr-uncased temel modeliüzerine“Geç Etkileşimli Füzyon”adı verilen hibrit bir mimari kullanmaktadır. Bumimari iki aşamadan oluşur: İlk aşamada sorgu ve metin birbirinden bağımsız olarakkodlanır, ikinci aşamada özel füzyon katmanı ile bu temsiller arasında zengin etkile-şim kurulur. Bu yaklaşım, bi-encoder'ların verimliliğini korurken cross-encoder'larınyüksek performansını yakalamayı hedefler.Sınıf dengesizliği problemini çözmek için Focal Loss tabanlı eğitim stratejisi be-nimsenmiştir. Bu yaklaşım, pozitif ve negatif token'lar arasındaki dengesizliği gide-rerek modelin zorlu örnekleri öğrenmesini sağlar.Veri seti, internet üzerindeki çeşitli kaynaklardan derlenen 500 bin adet Türkçemetnin, bu tezde geliştirilen LLM-destekli yarı denetimli bir yaklaşımla etiketlen-mesiyle oluşturulmuştur. Bu süreç sonucunda, yaklaşık 2 milyon adet etiketli sorgu-metin çifti elde edilmiştir. Veri seti haber makaleleri, teknik blog yazıları, ürünyorumları ve forum yazıları gibi çeşitli kaynaklardan derlenmiştir.Model eğitimi, 2 adet NVIDIA H100 GPU üzerinde 10 epoch boyunca gerçekleş-tirilmiştir. Doğrulama seti (validation set) üzerindeki başarımın 2. epoch'ta tepenoktasına ulaştığı gözlemlenmiş ve nihai değerlendirmeler için bu en iyi kontrolnoktası seçilmiştir. Eğitim sürecinde batch size 32, learning rate 2e-5 ve AdamW optimizer kullanılmıştır.Deneysel sonuçlar, önerilen modelin en iyi kontrol noktasında (epoch 2) ulaştığı0.557 F1-skoru ile temel 'Keyword Matching' (0.065) ve 'Klasik Bi-Encoder' (0.481)modellerine göre belirgin bir üstünlük sağladığını göstermektedir. Ayrıca, modelinperformansı, SOTA bir referans model olan 'GLiNER''ın (0.580) performansına ol-dukça yakındır.Verimlilik açısından, önerilen model, mimari olarak kendisinden daha karmaşıkolan GLiNER modeline kıyasla daha az parametre kullanırken, çıkarım hızı olarakda avantajlar sunmaktadır. Bu durum, modelin pratik uygulamalardaki kullanımpotansiyelini artırmaktadır.Sonuç olarak, bu çalışma Türkçe metinlerde token seviyesi sorgu-metin eşleştirme için etkili bir hibrit mimari sunmaktadır. Model, verimlilik ve performans dengesi kurarak pratik uygulamalar için ölçeklenebilir bir çözüm sağlamaktadır.

Özet (Çeviri)

This thesis addresses the problem of automatically detecting and highlightingquery-relevant segments in Turkish texts. The main objective is to develop an effec-tive token-level classification model using zero-shot learning, addressing data scarcityand efficiency issues in current literature.Unlike traditional information access systems that operate at the document level,this study requires detailed analysis at the token level. This approach aims to deter-mine exactly which words respond to user queries, providing more precise results.For agglutinative languages like Turkish, such analyses present additional challengesdue to morphological richness.Literature review revealed that existing studies focus primarily on English te-xts with insufficient resources for Turkish. Most existing solutions use either com-putationally expensive cross-encoder architectures or lower-performing bi-encoderapproaches.The proposed approach utilizes a hybrid architecture called“Late-InteractionFusion”built upon the artiwise-ai/modernbert-base-tr-uncased base model.This architecture consists of two stages: first, queries and texts are encoded inde-pendently; second, rich interaction is established through a specialized fusion layer.This approach maintains bi-encoder efficiency while capturing cross-encoder perfor-mance.A Focal Loss-based training strategy addresses class imbalance problems by hel-ping the model focus on challenging examples and balancing positive and negativetokens.The dataset was created by labeling 500 thousand Turkish texts, compiled fromvarious online sources, using a semi-supervised approach powered by Large LanguageModels (LLMs) developed in this thesis. This process resulted in approximately 2million labeled query-text pairs. Data was compiled from news articles, technicalblogs, product reviews, and forum posts.Model training was conducted on 2 NVIDIA H100 GPUs for 10 epochs. Aftertraining, the best checkpoint (epoch 2) was selected based on the highest validationF1, using a batch size of 32, a learning rate of 2e-5, and the AdamW optimizer.To fully analyze the model's learning dynamics, the training process ran for 10epochs. The validation performance peaked at epoch 2; therefore, all final evaluations report results from this best checkpoint.Experimental results show the proposed model, at its best checkpoint (epoch 2),achieved an F1-score of 0.557, significantly outperforming the 'Keyword Matching'(0.065) and 'Classic Bi-Encoder' (0.481) baselines. Furthermore, its performance ishighly competitive with the SOTA reference model, 'GLiNER' (0.580).In terms of efficiency, the proposed model uses fewer parameters and offers afaster inference speed compared to the more complex GLiNER architecture, high-lighting its potential for practical applications.In conclusion, this study presents an effective hybrid architecture for token-levelquery-text matching in Turkish texts. The model achieves a successful balance bet-ween efficiency and performance, providing a scalable solution for practical applica-tions.

Benzer Tezler

  1. Eine didaktisch- komparatistische annäherung an die phänomene“ empathie, identitätsuche und fremdverstehen”in der kinder-und jugendliteratur: dargestellt an den werken , von Canan Tan's „Eroi̇nle Dans“ und Renate Welshs „Dieda oder das fremde Kind”

    Renate Welsh'in“Dieda oder das fremde Kind„ ve Canan Tan'ın ”Eroinle Dans„ adlı eserlerinde çocuk ve gençlik yazını bağlamında ‚ "empati, kimlik arayışı ve yabancılaşma„ ' kavramlarına öğretbilimsel bir yaklaşım

    ZEYNEP TEKİN MEDENİ

    Doktora

    Almanca

    Almanca

    2017

    Alman Dili ve EdebiyatıÇukurova Üniversitesi

    Alman Dili Eğitimi Ana Bilim Dalı

    YRD. DOÇ. DR. CAVİDAN ÇÖLTÜ İMREN

  2. S ve Y Tipi yüksek güvenlikli hapishanelerde tutulma koşulları ve insan hakları açısından eleştirisi

    Conditions of detention in S and Y Type high security prisons and criticism in terms of human rights

    RUKEN ALTUN

    Yüksek Lisans

    Türkçe

    Türkçe

    2024

    Hukukİstanbul Bilgi Üniversitesi

    İnsan Hakları Hukuku Bilim Dalı

    DR. ÖĞR. ÜYESİ MUALLA BUKET SOYGÜT

  3. Öbeksi eylemlerin üst-orta düzeyde İngilizce bilen öğrencilere çoklu zeka kuramı ile öğretilmesi

    Teaching phrasal verbs to upper-intermediate students through multiple intelligence

    DENİZ ÇOKER

    Yüksek Lisans

    Türkçe

    Türkçe

    2009

    Eğitim ve ÖğretimAnkara Üniversitesi

    Dilbilim Ana Bilim Dalı

    YRD. DOÇ. DR. NAZAN TUTAŞ

  4. Deneme ve makale türlerinin öğretilme güçlükleri ve öğrenilme düzeyleri (11. sınıf örneklemi)

    Difficulty in the teaching of the essay and article genres and their levels of being learned (In the 11th grade sample)

    ESRA AKDİN

    Yüksek Lisans

    Türkçe

    Türkçe

    2019

    Eğitim ve ÖğretimTrabzon Üniversitesi

    Ortaöğretim Sosyal Alanlar Eğitimi Ana Bilim Dalı

    DOÇ. DR. ERHAN DURUKAN

  5. Devlet tanımada Uluslararası Hukuka uygunluk: Güney Sudan, Filistin ve DEAŞ

    The compliance of International Law for the recognition of states: South Sudan, Palestine and ISIS

    ENSAR MUSLU

    Doktora

    Türkçe

    Türkçe

    2018

    Uluslararası İlişkilerSakarya Üniversitesi

    Uluslararası İlişkiler Ana Bilim Dalı

    DOÇ. DR. TUNCAY KARDAŞ