Geri Dön

Açık uçlu maddelerin değerlendirildiği ekosistemin yapay zekâ entegrasyonuyla geliştirilen otomatik puanlama sonuçlarının incelenmesi

Analyzing the automated scoring results of the ecosystem in which open-ended items are assessed with artificial intelligence integration

  1. Tez No: 994690
  2. Yazar: OYTUN ÇETİN
  3. Danışmanlar: PROF. DR. TUFAN ADIGÜZEL
  4. Tez Türü: Doktora
  5. Konular: Eğitim ve Öğretim, Education and Training
  6. Anahtar Kelimeler: Sayısal görüntü işleme, Yapay zeka, Ölçme-değerlendirme, Digital image processing, Artificial intelligence, Measurement and evaluation
  7. Yıl: 2025
  8. Dil: Türkçe
  9. Üniversite: Bahçeşehir Üniversitesi
  10. Enstitü: Lisansüstü Eğitim Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar ve Öğretim Teknolojileri Ana Bilim Dalı
  12. Bilim Dalı: Eğitim Teknolojisi Bilim Dalı
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Eğitimde üst düzey becerilerin ölçülmesi ve geliştirilmesi için açık uçlu maddeler önemli araçlardandır. Ancak, bu tür maddelerin manuel puanlanması operasyonel zorluklar yaratmaktadır. Açık uçlu ve kısa cevaplı maddelerin otomatik puanlanmasına yönelik çalışmalarda ise genellikle makine öğrenmesi tekniklerinin kullanıldığı görülmüştür. Yeni bir teknoloji olması dolayısıyla çok modlu geniş dil modellerinin basılı uygulamaların otomatik değerlendirilmesine yönelik henüz yeterli uygulama örneğine ulaşılamamıştır. Nicel araştırma yöntemi kullanılarak yapılan bu değerlendiriciler arası güvenilirlik çalışmasında, açık uçlu ve kısa cevaplı maddelerin manuel puanlama sürecinin yapay zekâ destekli robot puanlayıcılarla otomatikleştirilerek, bu robotların insan puanlayıcılar yerine kullanılabilirliğinin incelenmesi amaçlanmıştır. Araştırmada, 600 öğrencinin açık uçlu maddelere verdikleri yanıtlar insan ve robot puanlayıcılar tarafından puanlanmıştır. McDonald's Omega güvenirlik analizleri yapılmış, ağırlıklandırılmış Kappa tekniği ile değerlendiriciler arası uyum analiz edilmiştir. İnsan-insan, insan-standart robot ve insan-eğitilmiş robot arasındaki ağırlıklandırılmış Kappa değerleri sırasıyla 0,94, 0,90 ve 0,94 olarak bulunmuştur. Robotlar, bir maddeyi ortalama 3,88 saniyede puanlamış, bunun yaklaşık 2,4 saniyesi görüntü işleme, 1,48 saniyesi doğal dil işleme sürecinde harcanmıştır. Sonuçlar, robotların insan puanlayıcılardan birinin yerine geçebileceğini ancak insandan bağımsız kullanımlarında risklerin devam ettiğini göstermiş olup hibrit puanlama modeli önerilmiştir. Gelecek araştırmalar için, yapay zekâ destekli puanlama süreçlerinde mizanpaj, rubrik standartları, geri bildirim mekanizmaları gibi hususlara dikkat edilmesi önemli görülmüştür.

Özet (Çeviri)

Open-ended items are among the essential tools for assessing and fostering higher-order thinking skills in education. However, manual scoring of such items poses significant operational challenges. Studies on the automatic scoring of open-ended and short-answer items predominantly utilize machine learning techniques. As a relatively new technology, multimodal large language models (MM-LLM) have not yet been sufficiently applied in the automated evaluation of paper-based assessments. In this inter-rater reliability study employing a quantitative research method, the aim was to automate the manual scoring process for open-ended and short-answer items using AI-supported automated scorers and to examine the feasibility of using these scorers in place of human raters. In the study, responses to open-ended items from 600 students were scored by both human and robot raters. McDonald's Omega reliability analyses and weighted Kappa statistics were used to assess inter-rater agreement. The weighted Kappa values for human-human, human-standard robot, and human-finetuned robot comparisons were found to be 0.94, 0.90, and 0.94, respectively. The robots scored each item in an average of 3.88 seconds, of which approximately 2.4 seconds were spent on image processing and 1.48 seconds on natural language processing. The results suggest that robot scorers can potentially replace one of the human raters, although risks remain when used independently of human oversight. Therefore, a hybrid scoring model is recommended. For future research, attention should be paid to aspects such as layout design, rubric standardization, and feedback mechanisms in AI-supported scoring systems.

Benzer Tezler

  1. Kadın cinsel sağlığının değerlendirilmesi ve danışmanlığına yönelik delphi tekniği ile klinik uygulama rehberi geliştirilmesi

    Developing a clinical practice guideline with the delphi technique for evaluation and counseling of women's sexual health

    HANDAN ERİTEN TİLAVER

    Doktora

    Türkçe

    Türkçe

    2026

    Kadın Hastalıkları ve Doğumİstanbul Üniversitesi-Cerrahpaşa

    Kadın Sağlığı ve Hastalıkları Hemşireliği Ana Bilim Dalı

    PROF. DR. ERGÜL ASLAN

  2. Matematik dersinde problem çözme becerilerinin dereceli puanlama anahtarı kullanılarak değerlendirilmesi

    The evaluation of problem solving skills in mathematics by usig rubric

    DERYA GÜNDÜZ SEFER

    Yüksek Lisans

    Türkçe

    Türkçe

    2006

    Eğitim ve ÖğretimHacettepe Üniversitesi

    Eğitim Bilimleri Ana Bilim Dalı

    Y.DOÇ.DR. HÜLYA KELECİOĞLU

  3. Ortaöğretim kimya müfredatında yer alan madde konsunda pratik test uygulamalı öğretim materyali geliştirme ve uygulama

    Development and evaluation of a practical test application on the matter subject of high school chemistry curriculum

    ARZU ÖNAL

    Yüksek Lisans

    Türkçe

    Türkçe

    2006

    Eğitim ve ÖğretimDokuz Eylül Üniversitesi

    Kimya Eğitimi Ana Bilim Dalı

    PROF. DR. HÜSAMETTİN AKÇAY

  4. Pediyatrik humerus suprakondiler kırıkları için yapay zekâ tarafından oluşturulmuş aydınlatılmış onam formunun tıbbi ve hukuki açıdan yeterliliğinin değerlendirilmesi

    Evaluation of the medical and legal adequacy of an informed consent form generated by artificial intelligence for pediatric humerus suprakondiler fractures

    AHMET ÖZCAN AKTEPE

    Tıpta Uzmanlık

    Türkçe

    Türkçe

    2026

    Ortopedi ve TravmatolojiVan Yüzüncü Yıl Üniversitesi

    Ortopedi ve Travmatoloji Ana Bilim Dalı

    DOÇ. DR. TÜLİN TÜRKÖZÜ

  5. Mukopolisakkaridoz hastalığında ölçek geliştirerek hekimlerin farkındalık ve bilgi düzeylerinin araştırılması

    Scale development: Physicians awareness and knowledge of Mucopolysaccharidosis

    ECE ASLAN

    Tıpta Uzmanlık

    Türkçe

    Türkçe

    2023

    Endokrinoloji ve Metabolizma Hastalıklarıİstanbul Üniversitesi

    Çocuk Sağlığı ve Hastalıkları Ana Bilim Dalı

    PROF. DR. GÜLDEN FATMA GÖKÇAY