Geri Dön

Comparing scores, quality, and difficulty of AI-generated and human-designed reading comprehension tests for EFL students

Yabancı dil olarak ingilizce öğrenen öğrenciler için yapay zeka tarafından oluşturulan ve insan tarafından oluşturulan okuduğunu anlama testlerinin puanları, kalitesi ve zorluk düzeylerinin karşılaştırılması

  1. Tez No: 952397
  2. Yazar: ŞEVVAL KURT
  3. Danışmanlar: DR. ÖĞR. ÜYESİ ZEYNEP BANU KOÇOĞLU
  4. Tez Türü: Yüksek Lisans
  5. Konular: Dilbilim, Eğitim ve Öğretim, Linguistics, Education and Training
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2025
  8. Dil: İngilizce
  9. Üniversite: Yeditepe Üniversitesi
  10. Enstitü: Eğitim Bilimleri Enstitüsü
  11. Ana Bilim Dalı: İngiliz Dili Eğitimi Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu çalışma, yapay zeka (YZ) modelleri tarafından oluşturulan okuduğunu anlama testlerinin psikometrik özelliklerini, güvenirliğini, geçerliğini ve madde düzeyindeki kalitesini insan yapımı bir TOEFL okuma testi ile karşılaştırarak incelemektedir. Beş ayrı oturum boyunca, öğrenci grupları insan yapımı bir TOEFL testi veya ChatGPT, Claude ve Perplexity tarafından üretilen YZ tabanlı testlerden birini tamamlamıştır. Araştırmada, nicel analizler (Mann-Whitney U testleri, madde güçlük ve madde ayırt edicilik hesaplamaları) ile nitel uzman değerlendirmelerini (alt beceri uyumu, içerik geçerliği ve madde yazım kurallarına uygunluk) bir araya getiren karma yöntem araştırma deseni kullanılmıştır. Bulgular, insan yapımı TOEFL testinin psikometrik açıdan istikrarlı bir şekilde üstün performans sergilediğini, daha yüksek güvenirlik, dengeli güçlük seviyeleri ve güçlü ayırt edicilik indeksleri gösterdiğini ortaya koymuştur. Buna karşılık, YZ tarafından oluşturulan testler daha fazla değişkenlik göstermiş; bazı maddeler kabul edilebilir ölçütleri karşılarken, diğerlerinde yanıltıcı seçeneklerin yetersizliği, soru köklerinde belirsizlik ve alt beceri uyumsuzlukları gibi eksiklikler gözlemlenmiştir. Bulgular, mevcut literatürle paralel olarak, YZ modellerinin yüzey düzeyinde geçerli maddeler üretebilse de bilişsel bütünlük ve psikometrik sağlamlık açısından eksiklikler taşıdığını ortaya koymaktadır. Bu çalışma, YZ tarafından oluşturulan çoktan seçmeli okuduğunu anlama testlerinin etkililiğini ve kalitesini, insan tarafından tasarlanmış testlerle karşılaştırarak incelemektedir. Çalışma, YZ ile üretilen maddelerin potansiyelini ve mevcut sınırlılıklarını ortaya koyarak, yüksek riskli okuduğunu anlama sınavlarında test uygulamalarının geliştirilmesine yönelik önemli çıkarımlar sunmaktadır.

Özet (Çeviri)

This study investigates the psychometric properties, reliability, validity, and item-level quality of reading comprehension tests generated by artificial intelligence (AI) models compared to a human-designed TOEFL reading test. Across five separate sessions, student groups completed one of four different test types: a human-designed TOEFL test or AI-generated tests created by ChatGPT, Claude, and Perplexity. A mixed-methods research design was employed, combining quantitative analysis, including Mann-Whitney U tests, item facility (IF) and item discrimination (ID) calculations with qualitative expert evaluations assessing subskill alignment, content validity, and item-writing guideline adherence. Results demonstrated that the human-designed TOEFL test consistently exhibited superior psychometric performance, with higher reliability, balanced difficulty, and stronger discrimination indices across items. In contrast, AI-generated tests showed greater variability, with some items displaying acceptable metrics while others revealed deficiencies such as distractor implausibility, stem ambiguity, and subskill misalignment. These findings align with recent literature indicating that while AI models can generate assessment items with surface-level validity, they often lack deeper cognitive coherence and psychometric robustness. The study explores the effectiveness and quality of AI-generated multiple-choice reading comprehension tests by comparing them with human-designed versions. It highlights both the potential and current limitations of AI-generated items, offering insights for improving testing practices in high-stakes reading comprehension assessments.

Benzer Tezler

  1. The significance and the contribution of 6+1 traits of writing to the success of the students in writing courses in English language teaching

    Yazmanın 6+1 özelliğinin İngilizce öğretiminde yazılı anlatım derslerindeki öğrenci başarısına katkısı ve önemi

    ÖZLEM YAZAR

    Yüksek Lisans

    İngilizce

    İngilizce

    2004

    Eğitim ve ÖğretimGazi Üniversitesi

    İngiliz Dili Eğitimi Ana Bilim Dalı

    YRD. DOÇ. DR. PAŞA TEVFİK CEPHE

  2. Kentsel açık mekân olarak caddelerin kalite kriterleri bağlamında değerlendirilmesi ve kavramsal bir model önerisi: Van Cumhuriyet Caddesi örneği

    The evaluation of main streets as urban open space in context of quality criteria and a conceptual model proposal: The case of Van Cumhuriyet Main Street

    ASUDE BOLAT

    Yüksek Lisans

    Türkçe

    Türkçe

    2022

    Şehircilik ve Bölge Planlamaİstanbul Teknik Üniversitesi

    Kentsel Tasarım Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ İSMAİL EREN KÜRKÇÜOĞLU

  3. Yoğun bakım hastalarında egzersiz grubuna kıyasla egzersiz ve nöromusküler elektriksel stimülasyon grubunun hasta mortalitesine, mekanik ventilasyondan ayrılma süresine, ybü'de ve hastanede kalış süresine, kas gücüne, fonksiyonel durumuna, sağlıkla ilişkili yaşam kalitesine etkisi

    The impact of neuromuscular electrical stimulation combined with exercise compared to exercise alone on patient mortality, weaning from mechanical ventilation, length of icu and hospital stay, muscle strength, functional status, and health-related quality of life in icu patients

    MURAT ALBAŞKARA

    Tıpta Uzmanlık

    Türkçe

    Türkçe

    2025

    Anestezi ve ReanimasyonFırat Üniversitesi

    Anesteziyoloji ve Reanimasyon Ana Bilim Dalı

    PROF. DR. İSMAİL DEMİREL

  4. Bipolar ve unipolar depresyon dönemindeki hastalarda uyku kalitesi, suisidalite ve dürtüsellik

    SLEEP quality, insomnia severity,impulsivity and suicidality in patients with bipolar and unipolar depression

    ÖZGE BINNAT

    Tıpta Uzmanlık

    Türkçe

    Türkçe

    2023

    Psikiyatriİzmir Katip Çelebi Üniversitesi

    Ruh Sağlığı ve Hastalıkları Ana Bilim Dalı

    PROF. DR. MUSTAFA GÜLEÇ

  5. Ftir histo-spectroscopic evaluation and chemometric discrimination of colon cancer

    Kolon kanserinin ftır hısto-spectroscopıc değerlendirmesi ve kemometrik ayrıştırımı

    SUSAN NAJAH MAHDI AL-KINANI

    Yüksek Lisans

    İngilizce

    İngilizce

    2020

    Biyokimyaİstanbul Teknik Üniversitesi

    Kimya Mühendisliği Ana Bilim Dalı

    YRD. DOÇ. DR. RAMAZAN KIZIL