Geri Dön

Extraction of named entities from Turkish document collections

Türkçe doküman koleksiyonlarından varlık isimlerinin çıkarımı

  1. Tez No: 539877
  2. Yazar: OKAN ÖZTÜRKMENOĞLU
  3. Danışmanlar: DOÇ. DR. ADİL ALPKOÇAK
  4. Tez Türü: Doktora
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Belirtilmemiş.
  7. Yıl: 2018
  8. Dil: İngilizce
  9. Üniversite: Dokuz Eylül Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu tez, Türkçe dokümanlarda Varlık İsmi Tanıma (VİT) görevi için iki yaygın dizi sınıflandırıcı teknik olan Saklı Markov Model (SMM) ve Koşullu Rasgele Alan (KRA)'ı iyileştiren bir model geliştirmeyi hedefler. Bu nedenle, ilk olarak bu modellerde girdi olarak kullanılan parametrelerin en iyi değerlerini inceledik. SMM'de her bir belirtkeyi çoklu özelliklerle temsil ettik. Daha sonra, KRA modelini, pencere boyutu, çıktı kodlama formatı ve belirtkelerden çıkarılan özellikler gibi bu modelde girdi olarak kullanılan parametrelerin en etkili değerlerini belirlemek için kullandık. Hem SMM ve hem de KRA modellerinin detaylı incelemesinden sonra, Türkçe dokümanlarda VİT için lineer zincirli bir CRF modeli uyguladık. Ayrıca, dört kategoride 41 farklı özellik önerdik: kural tabanlı, sözcüksel, sözlük araması ve morfoloji temelli özellikler. İlk olarak, bu özellik kümesini kullanarak kamuya açık VİT veri setleri üzerinde bir dizi deney gerçekleştirdik. Pencere boyutu olarak [-3,+3], çıktı kodlama formatı olarak BIO kodlaması ve genişletilmiş özellik kümesini kullanarak lineer zincirli CRF modeli ile en iyi performansı elde ettik. F1 ölçütü olarak, sırasıyla kişi isimleri, yer isimler ve kurum isimleri için 91.83, 91.2 ve 88.62 elde ettik. Ayrıca bu tez, VİT için etiketlenmiş ODTÜ derlemine dayanan ODTÜ-VİT derlemini de sunmaktadır. Lineer zincirli KRA modelini önceki veri setinde kullanılan aynı parametrelerle değerlendirdik. F1 ölçütü açısından kişi, yer, kurum, zamansal isimler ve genel olarak sırasıyla yüzde 73.26, 70.12, 63.83, 61.54 ve 69.14 elde ettik.

Özet (Çeviri)

This thesis aims to develop a model improving Hidden Markov Model (HMM) and Conditional Random Field (CRF), which are two common sequence classifier techniques, for Named Entity Recognition (NER) task on Turkish documents. So, we first examined for the best values of parameters used as input in these models. In HMM, we represented each token with multi features. Next, we used CRF model to determine most effective parameters values that are used as input in this model such as window size, output encoding format and features extracted from tokens. After detailed examination of both HMM and CRF models, we applied a linear-chain CRF model, for NER in Turkish documents. Besides, we proposed 41 different features in four categories: rule based, lexical, dictionary lookup and morphological based features. First, we performed a set of experiments using this feature set on publically available NER datasets. We achieved the best performance with a linear-chain CRF model using [-3, +3] as a window size, BIO encoding as an output encoding format and extended feature set. In terms of F1 measure, we obtained the 91.83 percent, 91.2 and 88.62 for person names, location names and organization names respectively. Furthermore, this thesis also presents METU-NER corpus, which is based on annotation METU corpus for NER. We evaluated our a linear-chain CRF model with the same parameters used in the previous dataset. In terms of F1-measure, we achieved 73.26 percent, 70.12, 63.83, 63.83 and 69.14 for person, location, organization, temporal names and overall, respectively.

Benzer Tezler

  1. Design and implementation of Turkish question answering system

    Türkçe soru cevap sisteminin tasarımı ve gerçekleştirimi

    OKAN ÖZTÜRKMENOĞLU

    Yüksek Lisans

    İngilizce

    İngilizce

    2012

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolDokuz Eylül Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    YRD. DOÇ. DR. ADİL ALPKOÇAK

  2. A hybrid method for toponym recognition on informal Turkish text

    Gündelik Türkçe metinlerde hibrit yöntemle yer isimlerini tanıma

    MERYEM KILINÇ

    Yüksek Lisans

    İngilizce

    İngilizce

    2014

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolOrta Doğu Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. PINAR KARAGÖZ

  3. Yazılı para transferi talimatları üzerinden bilgi çıkarımı

    Information extraction from written money transfer orders

    BERKE ORAL

    Yüksek Lisans

    Türkçe

    Türkçe

    2021

    Bankacılıkİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. GÜLŞEN ERYİĞİT

  4. Türkçe hedef tabanlı duygu analizi için alt görevlerin incelenmesi–hedef terim, hedef kategori ve duygu sınıfı belirleme

    Inspecting sub tasks of aspect based sentiment analysis in Turkish language–opinion target expression, aspect category and sentiment polarity detection

    FATİH SAMET ÇETİN

    Yüksek Lisans

    Türkçe

    Türkçe

    2017

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    YRD. DOÇ. DR. GÜLŞEN ERYİĞİT

  5. Türkçe eşgönderge çözümlemesi

    Turkish coreference resolution

    TUĞBA PAMAY

    Yüksek Lisans

    Türkçe

    Türkçe

    2018

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ GÜLŞEN ERYİĞİT