Dizilerden birimlere: Bilişimsel dilbilim çerçevesinde bir birimlendirici tasarımı
Strings to tokens: Designing a tokenizer within a computational linguistics framework
- Tez No: 959204
- Danışmanlar: PROF. DR. ÖZAY KARADAĞ
- Tez Türü: Doktora
- Konular: Eğitim ve Öğretim, Dilbilim, Education and Training, Linguistics
- Anahtar Kelimeler: Bilgisayarlı dil bilim, Derlem dil bilim, Dil bilim, Doğal dil işleme, Computerized linguistics, Corpus linguistics, Linguistics, Natural language processing
- Yıl: 2025
- Dil: Türkçe
- Üniversite: Hacettepe Üniversitesi
- Enstitü: Eğitim Bilimleri Enstitüsü
- Ana Bilim Dalı: Türkçe ve Sosyal Bilimler Eğitimi Ana Bilim Dalı
- Bilim Dalı: Türkçe Eğitimi Bilim Dalı
- Sayfa Sayısı: Belirtilmemiş.
Özet
Birimlendirme, doğal dilin bilgisayar tarafından işlenmesinde temel bir adımdır; bu işlem karakter dizilerinin anlamlı birimlere dönüştürülmesini sağlar. Çalışmada, bir metni oluşturan her karakter dizisinin bir birim olabileceği, ancak her birimin mutlaka bir sözcük olması gerekmediği savından hareketle özgün bir birimlendirici tasarlanmıştır. TS Tokenizer adıyla geliştirilen araç, düzenli ifadeler ve sözcük listelerini birleştiren hibrit bir yapı ile tasarlanmıştır. Böylelikle hem sözcükler hem de rakamlar, noktalama işaretleri, sosyal medyaya özgü kullanımlar gibi sözcük dışı birimler ilgili karakter dizisinin metin içindeki işlevi temel alınarak birimlendirme sürecine dahil edilmiştir. TS Tokenizer, Python diliyle hazırlanmış, hem bir Python kütüphanesi olarak hem de komut satırı üstünden kullanılabilecek şekilde tasarlanmış ve sunulmuştur. Çalışmada, geleneksel birimlendirme yaklaşımları ile güncel sözcük-altı birimlendirme yöntemleri karşılaştırmalı olarak ele alınmış; bu yöntemlerin sözcük bütünlüğünü gözetmemesi nedeniyle sosyal bilimlerin dil çözümleme beklentilerini karşılamada yetersiz kaldığı eleştirel bir bakışla tartışılmıştır. Uygulama bölümünde NLTK kütüphanesinin sunduğu birimlendiriciler ile TS Tokenizer karşılaştırılmış, ders kitaplarından ve sosyal medya verilerinden oluşan iki farklı derlem analiz edilmiştir. Her iki derlemde de TS Tokenizer'ın, daha verimli sonuç ürettiği, sözcük bütünlüğünü koruma ve noktalama işaretlerinin ayrıştırılması gibi ölçütlerde daha yüksek başarı sağladığı gözlenmiştir. Sonuç olarak, TS Tokenizer; dil eğitimi, uygulamalı dilbilim, derlem dilbilim ve dijital beşeri bilimler gibi alanlarda özgün birimlendirme ihtiyaçlarına yanıt veren, erişilebilir ve açık kaynaklı bir birimlendirici olarak sunulmuştur.
Özet (Çeviri)
Tokenization is a fundamental step in the computational processing of natural language, enabling the conversion of character sequences into meaningful tokens. This study is based on the premise that any sequence of characters in a text can be considered as a token, but not every token must necessarily be a word. Upon this idea, a novel tokenizer named TS Tokenizer has been developed. This tool employs a hybrid architecture that combines using both regular expressions and lexicons. In this way, both words and non-word elements, such as numbers, punctuation marks, and social media-specific expressions, are included in the tokenization process based on their function within the text. TS Tokenizer is implemented in Python and is designed to function both as a Python library and a command-line tool. The study provides a comparative analysis of traditional tokenization methods and recent subword-level approaches. These newer methods are critically examined for their inability to preserve word integrity, a limitation that reduces their usefulness for linguistic analysis in the social sciences. In the experimental section, TS Tokenizer is evaluated against existing tokenizers provided by the NLTK library using two different corpora: one derived from textbooks and the other from social media data. In both corpora, TS Tokenizer demonstrated better performance, particularly in preserving word boundaries and correctly segmenting punctuation. In conclusion, TS Tokenizer is presented as an accessible and open-source tokenizer that responds to the specific tokenization needs of fields such as language education, applied linguistics, corpus linguistics, and digital humanities.
Benzer Tezler
- İzmir ve çevresinin sivrisinek türleri (diptera, culicidae) üzerine sistematik araştırma
Başlık çevirisi yok
TAHSİN YAZICIOĞLU
- Bornova (İzmir) koşullarında çeşitli kültür bitkilerinde zarar yapan Dolycoris baccarum (L.) (Heteroptera: Pentatomidae)'un biyolojisi ve ekolojisi üzerinde araştırmalar
Investigations on the biology and ecology of Dolycoris baccarum (L.) (Heteroptera: Pentatomidae) which attacks to various plants of economic importance at Bornova (İzmir)
YUSUF KARSAVURAN