A Form document image parser
Form döküman görüntüleri için bir ayrıştırıcı
- Tez No: 75854
- Danışmanlar: YRD. DOÇ. DR. VOLKAN ATALAY
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Biçim, Örüntü tanıma, Form, Pattern recognition
- Yıl: 1998
- Dil: İngilizce
- Üniversite: Orta Doğu Teknik Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Formlar birçok bilgi yönetim sistemlerinde yaygın olarak kullanılmaktadırlar. Dokümanların otomatik olarak işlenmesi sayılarının çokluğu ve formların çeşitliliği nedeniyle, geleneksel yöntemlere tercih edilmelidir. Operatör hatasını, maliyetini ve kullanıcı etkileşimini en aza indirecek bir sistemin geliştirilmesine ihtiyaç vardır. Bu tezde, metin ve metindışı elemanların yeraldığı form dokümanlarının otomatiğe yakın bir şekilde ayrıştırılması için bir sistem önerilmektedir. Bu ayrıştırıcı iki kısımdan oluşmaktadır. İlk kısımda form dokümanı tarama ve önişlemeden geçer; daha sonra ise geometrik tertip çıkarımı için çizgilerin çıkarılması, köşelerin bu lunması ve gözelerin gösterimi gerçekleştirilir. Bir sonraki kısımda ise girdinin örnek ya da model form olmasına göre içerik etiketlenmesi veya metin çıkarımı yapılır. Metin elemanları için yapılan içerik etiketlenmesi, önbaskılı ya da son radan yazılmış olarak, gözetimsiz demetleme aracılığıyla yapılır. Bunu daha sonra model formun ilişkilendirilmesi ve gösterimi takip eder.
Özet (Çeviri)
Forms are used extensively as input to many information management systems. An automatic way of processing a form should be preferred over the traditional manual methods due to high volume and numerous kinds of form documents. A system that minimizes operator error, cost and user interaction has to be developed. In this thesis, a system towards automatically parsing form documents that have textual and nontextual elements is proposed. The parser involves two parts. In the first part, the form document goes through scan and preprocessing steps; then line extraction, vertex identification and cell representation are carried out for geometric layout extraction. In the next part, depending on whether an instance or a model form is input, content labelling or text extraction is done. Content labelling among textual elements, i.e. preprinted or user filled- in, is performed based on an unsupervised clustering. This is followed by the association and representation of the model form.
Benzer Tezler
- An SGML viewer for form document images
Form dökümanlar için SGML göstericisi
ERKAN ARSLAN
Yüksek Lisans
İngilizce
1998
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolOrta Doğu Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. VOLKAN ATALAY
- The Performance evaluation of low level algorithms for document processing
Belge işleme alt düzey algoritmalarının başarım değerlendirmesi
ALİ TOYGAR ABAK
Yüksek Lisans
İngilizce
1998
Elektrik ve Elektronik MühendisliğiBoğaziçi ÜniversitesiElektrik-Elektronik Mühendisliği Ana Bilim Dalı
PROF. DR. MEHMET BÜLENT SANKUR
- A hybrid document segmentation method for Turkish newspaper
Türkçe gazeteler için karma bir bölütleme yöntemi
M. FERİDUN AKTAŞ
Yüksek Lisans
İngilizce
1998
Elektrik ve Elektronik MühendisliğiBoğaziçi ÜniversitesiElektrik-Elektronik Mühendisliği Ana Bilim Dalı
PROF. DR. MEHMET BÜLENT SANKUR
- Haber-belge fotoğrafçılığının kitle iletişim araçlarında kullanımı
Başlık çevirisi yok
GÖKHAN BİRİNCİ
Yüksek Lisans
Türkçe
1990
Sahne ve Görüntü SanatlarıDokuz Eylül ÜniversitesiSahne ve Görüntü Sanatları Ana Bilim Dalı
YRD. DOÇ. DR. OĞUZ MAKAL
- Kıbrıs-Lefkoşa'da Selimiye bölgesinde kentsel mimari öğelerin oluşumunda tarihsel ve coğrafi etmenler
Başlık çevirisi yok
HURİYE GÜRDALLI