Comparing scores, quality, and difficulty of AI-generated and human-designed reading comprehension tests for EFL students
Yabancı dil olarak ingilizce öğrenen öğrenciler için yapay zeka tarafından oluşturulan ve insan tarafından oluşturulan okuduğunu anlama testlerinin puanları, kalitesi ve zorluk düzeylerinin karşılaştırılması
- Tez No: 952397
- Danışmanlar: DR. ÖĞR. ÜYESİ ZEYNEP BANU KOÇOĞLU
- Tez Türü: Yüksek Lisans
- Konular: Dilbilim, Eğitim ve Öğretim, Linguistics, Education and Training
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: İngilizce
- Üniversite: Yeditepe Üniversitesi
- Enstitü: Eğitim Bilimleri Enstitüsü
- Ana Bilim Dalı: İngiliz Dili Eğitimi Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu çalışma, yapay zeka (YZ) modelleri tarafından oluşturulan okuduğunu anlama testlerinin psikometrik özelliklerini, güvenirliğini, geçerliğini ve madde düzeyindeki kalitesini insan yapımı bir TOEFL okuma testi ile karşılaştırarak incelemektedir. Beş ayrı oturum boyunca, öğrenci grupları insan yapımı bir TOEFL testi veya ChatGPT, Claude ve Perplexity tarafından üretilen YZ tabanlı testlerden birini tamamlamıştır. Araştırmada, nicel analizler (Mann-Whitney U testleri, madde güçlük ve madde ayırt edicilik hesaplamaları) ile nitel uzman değerlendirmelerini (alt beceri uyumu, içerik geçerliği ve madde yazım kurallarına uygunluk) bir araya getiren karma yöntem araştırma deseni kullanılmıştır. Bulgular, insan yapımı TOEFL testinin psikometrik açıdan istikrarlı bir şekilde üstün performans sergilediğini, daha yüksek güvenirlik, dengeli güçlük seviyeleri ve güçlü ayırt edicilik indeksleri gösterdiğini ortaya koymuştur. Buna karşılık, YZ tarafından oluşturulan testler daha fazla değişkenlik göstermiş; bazı maddeler kabul edilebilir ölçütleri karşılarken, diğerlerinde yanıltıcı seçeneklerin yetersizliği, soru köklerinde belirsizlik ve alt beceri uyumsuzlukları gibi eksiklikler gözlemlenmiştir. Bulgular, mevcut literatürle paralel olarak, YZ modellerinin yüzey düzeyinde geçerli maddeler üretebilse de bilişsel bütünlük ve psikometrik sağlamlık açısından eksiklikler taşıdığını ortaya koymaktadır. Bu çalışma, YZ tarafından oluşturulan çoktan seçmeli okuduğunu anlama testlerinin etkililiğini ve kalitesini, insan tarafından tasarlanmış testlerle karşılaştırarak incelemektedir. Çalışma, YZ ile üretilen maddelerin potansiyelini ve mevcut sınırlılıklarını ortaya koyarak, yüksek riskli okuduğunu anlama sınavlarında test uygulamalarının geliştirilmesine yönelik önemli çıkarımlar sunmaktadır.
Özet (Çeviri)
This study investigates the psychometric properties, reliability, validity, and item-level quality of reading comprehension tests generated by artificial intelligence (AI) models compared to a human-designed TOEFL reading test. Across five separate sessions, student groups completed one of four different test types: a human-designed TOEFL test or AI-generated tests created by ChatGPT, Claude, and Perplexity. A mixed-methods research design was employed, combining quantitative analysis, including Mann-Whitney U tests, item facility (IF) and item discrimination (ID) calculations with qualitative expert evaluations assessing subskill alignment, content validity, and item-writing guideline adherence. Results demonstrated that the human-designed TOEFL test consistently exhibited superior psychometric performance, with higher reliability, balanced difficulty, and stronger discrimination indices across items. In contrast, AI-generated tests showed greater variability, with some items displaying acceptable metrics while others revealed deficiencies such as distractor implausibility, stem ambiguity, and subskill misalignment. These findings align with recent literature indicating that while AI models can generate assessment items with surface-level validity, they often lack deeper cognitive coherence and psychometric robustness. The study explores the effectiveness and quality of AI-generated multiple-choice reading comprehension tests by comparing them with human-designed versions. It highlights both the potential and current limitations of AI-generated items, offering insights for improving testing practices in high-stakes reading comprehension assessments.
Benzer Tezler
- The significance and the contribution of 6+1 traits of writing to the success of the students in writing courses in English language teaching
Yazmanın 6+1 özelliğinin İngilizce öğretiminde yazılı anlatım derslerindeki öğrenci başarısına katkısı ve önemi
ÖZLEM YAZAR
Yüksek Lisans
İngilizce
2004
Eğitim ve ÖğretimGazi Üniversitesiİngiliz Dili Eğitimi Ana Bilim Dalı
YRD. DOÇ. DR. PAŞA TEVFİK CEPHE
- Kentsel açık mekân olarak caddelerin kalite kriterleri bağlamında değerlendirilmesi ve kavramsal bir model önerisi: Van Cumhuriyet Caddesi örneği
The evaluation of main streets as urban open space in context of quality criteria and a conceptual model proposal: The case of Van Cumhuriyet Main Street
ASUDE BOLAT
Yüksek Lisans
Türkçe
2022
Şehircilik ve Bölge Planlamaİstanbul Teknik ÜniversitesiKentsel Tasarım Ana Bilim Dalı
DR. ÖĞR. ÜYESİ İSMAİL EREN KÜRKÇÜOĞLU
- Yoğun bakım hastalarında egzersiz grubuna kıyasla egzersiz ve nöromusküler elektriksel stimülasyon grubunun hasta mortalitesine, mekanik ventilasyondan ayrılma süresine, ybü'de ve hastanede kalış süresine, kas gücüne, fonksiyonel durumuna, sağlıkla ilişkili yaşam kalitesine etkisi
The impact of neuromuscular electrical stimulation combined with exercise compared to exercise alone on patient mortality, weaning from mechanical ventilation, length of icu and hospital stay, muscle strength, functional status, and health-related quality of life in icu patients
MURAT ALBAŞKARA
Tıpta Uzmanlık
Türkçe
2025
Anestezi ve ReanimasyonFırat ÜniversitesiAnesteziyoloji ve Reanimasyon Ana Bilim Dalı
PROF. DR. İSMAİL DEMİREL
- Bipolar ve unipolar depresyon dönemindeki hastalarda uyku kalitesi, suisidalite ve dürtüsellik
SLEEP quality, insomnia severity,impulsivity and suicidality in patients with bipolar and unipolar depression
ÖZGE BINNAT
Tıpta Uzmanlık
Türkçe
2023
Psikiyatriİzmir Katip Çelebi ÜniversitesiRuh Sağlığı ve Hastalıkları Ana Bilim Dalı
PROF. DR. MUSTAFA GÜLEÇ
- Ftir histo-spectroscopic evaluation and chemometric discrimination of colon cancer
Kolon kanserinin ftır hısto-spectroscopıc değerlendirmesi ve kemometrik ayrıştırımı
SUSAN NAJAH MAHDI AL-KINANI
Yüksek Lisans
İngilizce
2020
Biyokimyaİstanbul Teknik ÜniversitesiKimya Mühendisliği Ana Bilim Dalı
YRD. DOÇ. DR. RAMAZAN KIZIL