Geri Dön

Ham verilerden akıllı sorulara: İnsan doğrulamasıyla büyük dil modelleri destekli üretim

From raw data to intelligent questions: Large language models powered generation with human validation

  1. Tez No: 970793
  2. Yazar: ABDÜLKADİR AKYILDIZ
  3. Danışmanlar: DOÇ. SÜLEYMAN EKEN
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilim ve Teknoloji, Eğitim ve Öğretim, Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Science and Technology, Education and Training, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2025
  8. Dil: Türkçe
  9. Üniversite: Kocaeli Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilişim Sistemleri Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

İnsan etkileşimli veri analitiği, uzun zamandır araştırılan bir konu olarak, insan katılımını veri yönetiminde birinci sınıf vatandaşlar olarak ele almayı hedefleyen optimize edilmiş sistemler ve teknikler geliştirmek amacıyla, insanın rolünü değerlendirme, anlama ve formel olarak mantık yürütme süreçlerine odaklanmaktadır. Bu çalışma, heterojen kaynaklardan (metin, ses, video ve diğer belgeler) insan etkileşimli ve büyük dil modelleri (Large Language Model-LLM) destekli bir soru oluşturma sistemi geliştirmeyi amaçlamaktadır. Araştırmanın problemi, çok çeşitli veri kaynaklarının toplanması ve işlenmesi ile bu kaynaklardan anlamlı, seviye uygun ve çeşitli soru türlerinin üretilmesi gerekliliğine odaklanmaktadır. Önerilen sistem, önce faster-whisper, PyMuPDF ve diğer Python tabanlı kütüphaneler kullanılarak içeriklerden metin çıkarımı yapar. Daha sonra, çıkarılan metinleri LLM'lerin token sınırını aştığı durumlarda, Luhn ve TextRank gibi özetleme teknikleri ile birleştirip düzenler. Çoktan seçmeli, doğru/yanlış, boşluk doldurma, açık uçlu, eşleştirme ve kısa cevap olmak üzere altı farklı soru türü, Application Programming Interface (API) tabanlı ve yerel olarak dağıtılmış LLM'ler kullanılarak otomatik olarak üretilmektedir. Ayrıca, oluşturulan soruların dil ve içerik kalitesini artırmak amacıyla, eğitimciler ve alan uzmanlarından gelen geri bildirimler sistemin revizyon aşamasına entegre edilmektedir. Modellerin değerlendirmesi, Türkçe, sosyal bilgiler ve fen olmak üzere üç dersi kapsayan ve 5., 6., 7. ile 8. sınıflar için oluşturulan 60 konuluk soru setleri üzerinde gerçekleştirilmiştir. Değerlendirme metrikleri arasında alaka düzeyi, soru türü, zorluk seviyesi, doğruluk, açıklık ve genel kalite yer almaktadır.“aya-expanse”, diğer LLM'ler arasında en yüksek değerlendirme puanlarına sahiptir. Bu çalışma, eğitim içeriklerinin otomatik ve verimli üretimine önemli bir katkı sağlamaktadır.

Özet (Çeviri)

Human-in-the-loop data analytics, a long-standing research interest, focuses on evaluating, understanding, and formally reasoning about human participation in data management to develop optimized systems and techniques that treat humans as first-class citizens alongside data. This study aims to develop a human-in-the-loop and large language models-supported question generation system from heterogeneous sources (text, audio, video, and other documents). The research problem focuses on the need to gather and process a wide variety of data sources and to generate meaningful, leveled, and diverse types of questions from these sources. The proposed system first extracts text from the contents using faster-whisper, PyMuPDF, and other Python-based libraries. Then it combines extracted texts and organizes them with summarization techniques such as Luhn and TextRank in case the merged text exceeds the token limit of large language models. Six different types of questions (multiple choice, true/false, fill-in-the-blank, open-ended, matching, and short answer) are generated automatically using multiple API-based and locally deployed large language models. Also, feedback from educators and domain experts is integrated into the revision phase of the system to enhance the linguistic and content quality of the generated questions. Evaluation of the models is conducted on the created questions for different grade levels (5th, 6th, 7th, and 8th) consisting of 60 topics spanning three subjects (Turkish, social studies, and science). Evaluation metrics include relevance, question type, difficulty level, correctness, clarity, and overall quality.“aya-expanse”has the best evaluation scores among other large language models. This study makes an important contribution to the automated and efficient production of educational content.

Benzer Tezler

  1. Implementation of data-driven decisions in urban governance and planning

    Kent yönetişim ve planlamasında veri odaklı kararların uygulanması

    JAFAR NAJAFLI

    Yüksek Lisans

    İngilizce

    İngilizce

    2020

    Şehircilik ve Bölge Planlamaİstanbul Teknik Üniversitesi

    Şehir ve Bölge Planlama Ana Bilim Dalı

    DOÇ. DR. ÖZHAN ERTEKİN

  2. Machine learning-enabled stress detection in children using physiological signals during robot assisted therapy

    Çocuklarda makine öğrenmesi ile desteklenmiş robot ile yapılan terapi sırasında fizyolojik sinyallerle stres tespiti

    SEVGİ NUR BİLGİN AKTAŞ

    Yüksek Lisans

    İngilizce

    İngilizce

    2024

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Eğitimi Ana Bilim Dalı

    PROF. DR. HATİCE KÖSE

  3. Fake news classification using machine learning and deep learning approaches

    Makine öğrenimi ve derin öğrenme yaklaşımlarını kullanarak sahte haber sınıflandırması

    SAJA ABDULHALEEM MAHMOOD AL-OBAIDI

    Yüksek Lisans

    İngilizce

    İngilizce

    2023

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolGazi Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ TUBA ÇAĞLIKANTAR

  4. Yaşam kalitesinin iyileştirilmesinde akıllı kent stratejileri: Sakarya Büyükşehir Belediyesi örneği ve yerel yönetimler için bir model önerisi

    Smart city strategies in enhancement of quality of life: Example of Sakarya Metropolitan Municipality and a model proposal for the local governments in Turkey

    AKIN ÖZDEMİR

    Doktora

    Türkçe

    Türkçe

    2022

    Çalışma Ekonomisi ve Endüstri İlişkileriSakarya Üniversitesi

    Çalışma Ekonomisi ve Endüstri İlişkileri Ana Bilim Dalı

    DOÇ. DR. MUSTAFA ÇAĞLAR ÖZDEMİR

  5. A federated learning approach for inter-cell handover optimisation in open 6G ran

    Açık 6G radyo erişim ağında federasyon tabanlı öğrenme yaklaşımı ile hücre arası handover optimizasyonu

    BATUHAN AKDOĞAN

    Yüksek Lisans

    İngilizce

    İngilizce

    2026

    Elektrik ve Elektronik Mühendisliğiİstanbul Teknik Üniversitesi

    Elektronik ve Haberleşme Mühendisliği Ana Bilim Dalı

    PROF. DR. HAKAN ALİ ÇIRPAN