Geri Dön

Tagging and morphological disambiguation of turkish text

Türkçe metinlerin işaretlenmesi ve biçimbirimsel çokyapılılık çözümlemesi

  1. Tez No: 33500
  2. Yazar: İLKER KURUÖZ
  3. Danışmanlar: YRD. DOÇ. DR. KEMAL OFLAZER
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: işaretleme, Biçimbirimsel inceleme iv, Biçimbilim, Türkçe metinler, Tagging, Morphological Analysis, Corpus Development m, Morphology, Turkish texts, Marking
  7. Yıl: 1994
  8. Dil: İngilizce
  9. Üniversite: İhsan Doğramacı Bilkent Üniversitesi
  10. Enstitü: Mühendislik ve Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Sözcük türlerinin işaretlenmesi için kullanılan sistemler metin bilgilerini kullanarak o metinde bulunan her sözcüğü tek bir tür ile işaretlemeye çalışırlar. Otomatik olarak işaretleme, metinlerin üst düzey çözümlemesi açısından önemli bir adımdır ve bu adımın çıktıları pek çok doğal dil işleme uygulamasında kullanılabilir. Türkçe ve Fince gibi çekimli ve bitişken biçimbirimlere sahip dillerde, sözcükler çoğunlukla biçimbirimsel olarak çok yapılı olduğu için biçimbirimsel çok yapılılık çözümlemesi önemli bir işlemdir. Bu tez, Türkçe'nin tam kapsamlı iki aşamalı biçimbirimsel tanımlamasına dayanılarak geliştirilen bir sözcük türü işaretleyicisini sunmaktadır, işaretleyici aynı zamanda çok kelimeli ve deyimsel yapıları tanımlayabilmekte, daha önemlisi sözcüklerin komşularının biçimbirimsel bilgileri ve bir kısım sezgisel bilgiler (heuristics) kullanarak biçimbirimsel çok yapılılık çözümlemesi yapabilmektedir, işaretleyici istatistiksel bilgiler toplamak, biçimbirimsel çözümleyicinin bazı hatalarını düzeltmek gibi ek işlevlere de sahiptir. Deney sonuçları, işaretleyicinin metinlerin %97 ila %99'unu çok az kullanıcı yardımı alarak doğru işaretlediğini göstermiş, bir başka deneyde ise biçimbirimsel çok yapılılık çözümlemesi yapılan cümlelerin Türkçe için geliştirilen sözcüksel-işlevsel gramer (LPG) sözdizimsel çözümleyicisi tarafından işlenmesi sonucunda yarıya yakın daha az çözüm yapısı üretildiği ve bu işlemin 2.5 kez daha hızlı gerçekleştiği gözlenmiştir.

Özet (Çeviri)

A part-of-speech (POS) tagger is a system that uses various sources information to assign possibly unique POS to words. Automatic text tagging is an important component in higher level analysis of text corpora. Its output can also be used in many natural language processing applications. In languages like Turk ish or Finnish, with agglutinative morphology, morphological disambiguation is a very crucial process in tagging as the structures of many lexical forms are morphologically ambiguous. This thesis presents a POS tagger for Turkish text based on a full-scale two-level specification of Turkish morphology. The tag ger is augmented with a multi-word and idiomatic construct recognizer, and most importantly morphological disambiguator based on local lexical neigh borhood constraints, heuristics and limited amount of statistical information. The tagger also has additional functionality for statistics compilation and fine tuning of the morphological analyzer, such as logging erroneous morphological parses, commonly used roots, etc. Test results indicate that the tagger can tag about 97% to 99% of the texts accurately with very minimal user inter vention. Furthermore for sentences morphologically disambiguated with the tagger, an LFG parser developed for Turkish, on the average, generates 50% less ambiguous parses and parses almost 2.5 times faster.

Benzer Tezler

  1. Using multiple sources of information for constraint-based morphological disambiquation

    Değişik bilgi kaynakları kullanarak biçimbirimsel birikleştirme

    GÖKHAN TÜR

  2. Statistical modeling of agglutinative languages

    Sondan eklemeli dillerin istatistiksel modellenmesi

    DİLEK ZEYNEP HAKKANİ TÜR

    Doktora

    İngilizce

    İngilizce

    2000

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİhsan Doğramacı Bilkent Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. KEMAL OFLAZER

  3. A Statistical information extraction system for Turkish

    Türkçe için istatistiksel bir bilgi çıkarım sistemi

    GÖKHAN TÜR

    Doktora

    İngilizce

    İngilizce

    2000

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİhsan Doğramacı Bilkent Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    DOÇ. DR. KEMAL OFLAZER

  4. Experimental searches for higgs boson and reconstructin of semileptonic decays of heavy higgs

    Başlık çevirisi yok

    ASLI ERDOĞAN

    Yüksek Lisans

    İngilizce

    İngilizce

    1993

    Fizik ve Fizik MühendisliğiBoğaziçi Üniversitesi

    Fizik Ana Bilim Dalı

    PROF. DR. ENGİN ARIK

  5. İskemik kalp hastalıklarında manyetik rezonans görüntüleme: Miyokard hareketlerini sine-MR işaretleme (Tagging) yöntemi ile değerlendirmede kalitatif ve kantitatif analiz yöntemlerinin karşılaştırılması

    Magnetic resonance imaging in ischemic heart diseases: The comparison of qualitative and quantitative strain analysis in the evaluation of myocardial motion with cine-MR tagging

    İZLEM İZBUDAK ÖZNUR

    Tıpta Uzmanlık

    Türkçe

    Türkçe

    1997

    Radyoloji ve Nükleer TıpGazi Üniversitesi

    Radyodiagnostik Ana Bilim Dalı

    DOÇ. DR. E. TURGUT TALİ