Automatic detection of clusters and switches in turkish semantic verbal fluency data
Türkçe semantik sözel akıcılık verilerinde kümelerin ve anahtarların otomatik tespiti
- Tez No: 938046
- Danışmanlar: DOÇ. DR. MARIA K. WOLTERS
- Tez Türü: Doktora
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Bilgisayar destekli analiz, Dil özellikleri, Doğal dil işleme, Makine öğrenmesi, Nöropsikolojik testler, Sistematik derleme, Sözel akıcılık, Türkçe, Veri işleme, Çok dillilik, Computer aided analysis, Language features, Natural language processing, Machine learning, Neuropsychological tests, Systematic review, Verbal fluency, Turkish, Data processing, Multilingualism
- Yıl: 2024
- Dil: İngilizce
- Üniversite: The Unıversıty Of Edınburgh
- Enstitü: Yurtdışı Enstitü
- Ana Bilim Dalı: Bilgisayar Bilimleri ve Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Bilgisayar Bilimi ve Mühendisliği Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Sözel akıcılık testleri, yürütücü işlevin popüler ölçümlerindendir. Bu testler, genellikle 60 saniye gibi kısa bir süre içinde belirli bir kategoriden mümkün olduğunca çok sayıda kelimenin listelenmesini içerir. Fonemik sözel akıcılık testlerinde, bu kelimeler aynı harfle başlamalıdır; semantik sözel akıcılık testlerinde (SVF), aynı kategoriye ait olmalıdır, örneğin hayvanlar. SVF'nin uygulanması hızlıdır, yarı otomatik analize uygundur ve demans gibi bilişsel bozuklukları taramak için kullanılabilir. Troyer ve arkadaşları, SVF dizileri için bunları kümelere, yani anlamsal olarak daha yakından ilişkili kelime dizilerine ayıran ince taneli bir analiz yöntemi önermişlerdir. Böyle bir analizden elde edilebilecek faydalı ölçütler arasında ortalama küme boyutu ve kümeler arasındaki geçişlerin sayısı yer almaktadır. Bu tezin amacı, Türkçe SVF dizilerinden küme ve anahtarla ilgili metrikleri çıkarmak için yarı otomatik yöntemler geliştirmektir. İlk olarak, yayına çevrilmemiş tezler de dahil olmak üzere uluslararası ve Türkçe veri tabanlarını kullanarak, anadili Türkçe olan sağlıklı yetişkinlerin SVF performansını rapor eden çalışmaların sistematik bir incelemesini yaptık. Özellikle normatif verilere ve SVF verilerini toplamak ve analiz etmek için yaygın olarak kullanılan yöntemlere odaklandık. Dahil edilen tüm makalelerin hayvan kategorisi kullanılarak SVF dizilerini bildirdiğini ve bunun ardından kişi adlarının geldiğini tespit ettik. Türk diasporasının büyüklüğü göz önüne alındığında, tek dilli konuşmacıları iki dilli konuşmacılarla karşılaştıran çalışmaların eksikliği göze çarpmaktadır. Kelime sayısının ötesinde, perseverasyonlar, kategori ihlalleri ve kümeleme/anahtarlama gibi detaylı analizler nadiren rapor edilmiştir. Yarı otomatik ve otomatik yaklaşımlar neredeyse hiç kullanılmamıştır. Bu nedenle tez, literatürdeki açık bir boşluğu doldurmaktadır. Türkçe üzerindeki çalışmamız için, nispeten az derlem kaynağına sahip dillere kolayca uyarlanabilecek iki hesaplama yaklaşımı seçtik: basit bir Bigram yöntemi ve bir vektör-uzay modeli (word2vec). Bu yöntemleri ilk olarak 50 sağlıklı katılımcı ve ailesel AD tanısı konmuş 14 katılımcı içeren İspanyolca bir veri kümesi üzerinde uyguladık ve test ettik. Her iki hesaplama modeli de anahtarları manuel analiz (el ile etiketleme) ile çok benzer şekilde konumlandırarak, Bigram için F1=0,756 ve Word2vec için F1=0,8309 değerlerine ulaşmıştır. Küme büyüklükleri açısından bir fark yoktur (p>0,01), ancak sağlıklı katılımcılar önemli ölçüde daha fazla anahtar üretmektedir (p<0,001). Bu bulgular hem manuel analiz hem de otomatik analiz için geçerlidir. Türkçe SVF verilerine ilişkin kamuya açık veri kümeleri bulunmadığından hem Türkiye'de hem de yurtdışında yaşayan ve kendi bildirdiği bir bilişsel bozukluğu olmayan anadili Türkçe olan kişilerden çevrimiçi SVF verileri topladık. Bildiğimiz kadarıyla bu, Türkçe için ilk çevrimiçi sözlü SVF derlemidir. Çalışmada, Türkçe SVF verilerinde en sık kullanılan ve diğer diller için de rapor edilmiş olan üç kategori; hayvanlar, meyve ve sebzeler ve süpermarket ürünleri kullanılmıştır. Çalışma, ilgili katılımcı bilgilerini taramak ve toplamak için bir başlangıç Qualtrics anketi ve üç kategoride SVF dizisini toplamak için web tabanlı bir uygulama olmak üzere iki bölümden oluşmuştur. 286 katılımcı onay vererek ankete katılmayı kabul etti ve 137'si (%47,9) SVF uygulamasına devam etti. Toplamda, 137 yetişkinden 311 SVF dizisi (Hayvanlar=105, Sebze ve Meyveler=105, Süpermarket Ürünleri=101) topladık. Kategori başına üretilen ortalama kelime sayısı hayvanlar için 25,04 (SD=X), meyve ve sebzeler için 25,32 (SD=Y) ve süpermarket ürünleri için 25,97 (SD=Z)'dir. Genel olarak, kaydedilen dizilerin veri kalitesi iyiydi. Anket ve SVF veri toplamaları arasındaki düşüşün nedenlerinin daha sonraki çalışmalarda araştırılması gerekmektedir. Son olarak, İspanyolca için kullanılan hesaplama tekniklerini Türkçe SVF verilerine uyarladık ve kümeleme ve anahtarlama tabanlı metrikleri çoğaltma yeteneklerini değerlendirdik. Hem Bigram hem de word2vec'in tatmin edici bir performans sergilediğini gördük. Küme boyutlarında önemli bir fark yoktu ve anahtar sayıları yüksek oranda korelasyon gösteriyordu (p<0,001). Anahtar konumunu tahmin etme açısından, word2vec F1=0,738'e ve Bigram F1=0,66'ya ulaştı. Sonraki adımda, kümelerin ve anahtarların manuel analizinden elde edilen bulguların, iki hesaplama yöntemi kullanılarak elde edilen metriklerle tekrarlanabilir olup olmadığını inceledik. Özellikle, erkek ve kadın katılımcılar (cinsiyet) ile tek ve çok dilli katılımcılar arasındaki küme büyüklüğü ve anahtar sayılarını araştırdık. Manuel analize dayanarak, erkek katılımcıların kadın katılımcılara göre daha büyük kümeler oluşturduğunu, ancak benzer sayıda anahtar kullandığını tespit ettik. Tek dilli ve çok dilli katılımcılar arasında önemli bir fark yoktu. Her iki bulgu da Türkçe SVF ile ilgili mevcut literatürle uyumludur. Bigram ve word2vec anahtar sayısı açısından benzer bir sonuç verirken, sadece word2vec türevi metrikler erkek ve kadın katılımcılar arasındaki küme büyüklüğü farkını tekrarlamıştır. Gelecekteki çalışmalarda, büyük dil modelleri gibi diğer hesaplama yaklaşımları araştırılmalı, manuel transkripsiyon ihtiyacını ortadan kaldırmak için otomatik konuşma tanıma entegre edilmeli ve ayrıca ek konuşma tabanlı özellikler araştırılabilir. Son olarak, kullanıcı deneyimi araştırması, çevrimiçi veri toplamayı iyileştirmeye ve konuşma verileri toplanmadan önce çalışmadan ayrılan katılımcıların sayısını azaltmaya yardımcı olabilir.
Özet (Çeviri)
Verbal fluency tests are popular measures of executive function. These tests involve listing as many words from a given category as possible in a short time, typically 60 seconds. In phonemic verbal fluency tests, these words should begin with the same letter; in semantic verbal fluency tests (SVF), they should belong to the same category, e.g., animals. SVF is quick to administer, amenable to semi-automated analysis, and can be used to screen for cognitive impairments such as dementia. Troyer and collaborators proposed a fine-grained analysis method for SVF sequences that divides them into clusters, i.e., sequences of more closely semantically related words. Useful metrics that can be derived from such an analysis include mean cluster size and the number of switches between clusters. The aim of this thesis is to develop semiautomated methods to extract cluster- and switch-related metrics from Turkish SVF sequences. First, we conducted a systematic review of studies that report SVF performance of healthy adult native Turkish speakers, using international and Turkish databases including unpublished theses. We particularly focused on normative data and commonly used methods for collecting and analysing SVF data. We found that all included papers reported SVF sequences using the animal category, followed by first names. Considering the size of Turkish diaspora, there was a lack of studies comparing monolingual speakers to bilingual speakers. Detailed analyses beyond word count, such as perseverations, category violations, and clustering/switching were only rarely reported. Semi-automatic and automatic approaches were almost never used. The thesis therefore fills a clear gap in the literature. For our work on Turkish, we chose two computational approaches that can be easily adapted to languages with comparatively few corpus resources: a simple bigram method and a vector-space model (word2vec). We initially implemented and tested those methods on a Spanish dataset which included 50 healthy participants and 14 participants diagnosed with familial AD. Both computational models positioned switches very similarly to manual annotations, achieving F1=0.756 for Bigram and F1=0.8309 for Word2vec. There is no difference in terms of cluster sizes (p>0.01), but healthy participants produce significantly more switches (p<0.001). These findings hold both for the manual analysis and the automatic analysis. Since there are no public datasets of Turkish SVF data, we collected SVF data online from native speakers of Turkish with no self-reported cognitive impairments living both in Turkey and abroad. To the best of our knowledge, this is the first online spoken corpus of SVF for Turkish. The study used the three most frequently used categories in Turkish SVF data that have also been reported for other languages, namely animals, fruits and vegetables, and supermarket items. The study had two parts, an initial Qualtrics survey for screening and collecting relevant participant information, and a web-based app for collecting three SVF sequences. 286 participants consented to take part in the survey, and 137 (47.9%) continued on to the SVF app. In total, we collected 311 SVF sequences (Animals=105, Vegetables and Fruits=105, Supermarket Items=101) from 137 adults. The mean number of items produced per category is 25.04 (SD=X) for animals, 25.32 (SD=Y) for fruits and vegetables, and 25.97 (SD=Z) for supermarket items. Overall, data quality of the recorded sequences was good. The reasons for the drop off between survey and SVF data collections need to be investigated in further work. Finally, we adapted the computational techniques used for Spanish to the Turkish SVF data and assessed their ability to replicate clustering and switching based metrics. We found that both bigram and word2vec performed satisfactorily. There was no significant difference in cluster sizes, and switch numbers were highly correlated (p<0.001). In terms of predicting switch position, word2vec reached F1=0.738 and Bigram achieved F1=0.66. Next, we examined whether findings obtained from manual annotation of clusters and switches could be replicated using metrics derived using the two computational methods. Specifically, we investigated cluster size and switch numbers between male and female participants (sex) and between mono- and multilingual participants (multilinguality). Based on the manual analysis, we established that male participants created larger clusters than female participants, but used a similar number of switches. There were no significant differences between monolingual and multilingual participants. Both findings are in line with the existing literature on Turkish SVF. While bigram and word2vec yielded a similar result regarding number of switches, only word2vec-derived metrics replicated the difference in cluster size between male and female participants. In future work, other computational approaches, such as large language models, should be explored, automatic speech recognition should be integrated to eliminate the need for manual transcription, and additional speech-based features can be investigated. Finally, user experience research may help to improve online data collection and reduce the number of participants who drop out of the study before speech data collection.
Benzer Tezler
- Automatic analysis and detection of malware behavior using machine learning for computer device
Başlık çevirisi yok
ABDULLAH QASSIM ALI
Yüksek Lisans
İngilizce
2020
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolAltınbaş ÜniversitesiElektrik ve Bilgisayar Mühendisliği Ana Bilim Dalı
Prof. Dr. OSMAN NURİ UÇAN
- New cluster ensemble algorithm with automatic cluster number and new pruning technique for fast detection of neighbors on binary data
Küme sayısını otomatik bulan bir kümelenme birleştirme algoritması ve ikili veride komşuların hızlı bulunması için yeni budama yöntemi
MEHMET EMİN AKŞEHİRLİ
Yüksek Lisans
İngilizce
2011
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolBahçeşehir ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
YRD. DOÇ. DR. SELİM NECDET MİMAROĞLU
- An approach for the automatic detection of agricultural field sub-boundaries from high resolution satellite images
Yüksek çözünürlüklü uydu görüntülerinden tarımsal arazi alt-sınırların otomatik tespiti için bir yaklaşım
SAMAN GHAFFARİAN
Yüksek Lisans
İngilizce
2014
Jeodezi ve FotogrametriHacettepe ÜniversitesiGeomatik Mühendisliği Ana Bilim Dalı
PROF. DR. MUSTAFA TÜRKER
- BGA malzemelerin x-ışını görüntülerindeki lehim hatalarının derin sinir ağı kullanarak tespiti
Detection of BGA solder defects from x-ray images using deep neural network
CEREN TÜRER AKDENİZ
Yüksek Lisans
Türkçe
2019
Elektrik ve Elektronik Mühendisliğiİstanbul Teknik ÜniversitesiElektronik ve Haberleşme Mühendisliği Ana Bilim Dalı
PROF. DR. ZÜMRAY ÖLMEZ
- Laser-based structural sensing and surface damage detection
Lazer tabanlı yapısal algılama ve yüzey hasar tespiti
BURCU GÜLDÜR ERKAL
Doktora
İngilizce
2014
İnşaat MühendisliğiNortheastern Unıversıtyİnşaat Mühendisliği Ana Bilim Dalı
PROF. DR. JEROME F. HAJJAR