Hierarchical multitask learning for language modeling with transformers
Hiyerarşik çoklu görev öğrenimi yaklaşımı ile dönüştürücülerde dil modelleme
- Tez No: 652353
- Danışmanlar: PROF. DR. TUNGA GÜNGÖR
- Tez Türü: Yüksek Lisans
- Konular: Mühendislik Bilimleri, Engineering Sciences
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2020
- Dil: İngilizce
- Üniversite: Boğaziçi Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Son çalışmalar kelimelerin bağlamsal gömmelerini kullanmanın alt görevler için faydalı olduğunu göstermiştir. Bu yaklaşımın başarılı bir örneği Dönüştürücülerden Çift yönlü Gizyazar Gösterimi'dir (DÇGG). DÇGG bağlamsal gömmeleri maskelenmiş dil modeli (maskelenmiş DM) ve sonraki cümle tahmini (SCT) olan iki görevi birlikte çözerek öğrenir. Bu işlem ön eğitim olarak adlandırılır. DÇGG'nin ön eğitimi aynı zamanda çoklu görev öğrenimi olarak da tasarlanabilir. Bu tezde, DÇGG'nin ön eğitimi için hiyerarşik çoklu görev öğrenimi yaklaşımları uygulanmıştır. Ön eğitim görevleri son katman yerine farklı katmanlarda çözülür ve SCT görevindeki bilgiler maskelenmiş DM görevine aktarılır. Ayrıca, iki-gram yerini değiştirme görevi ek bir ön eğitim görevi olarak kelimelerin dizilimine ait bilgileri kodlamak için önerilmiştir. Oluşturulan gömmeleri test etmek için iki farklı alt görev seçilmiştir. Bunlardan biri cümle düzeyinde gömmeler gerektiren metinsel gerektime problemidir. Diğeri ise kelime düzeyinde bağlamsal gömme gerektiren soru cevaplama problemidir. Hesaplama kısıtlamaları nedeniyle, önerilen modellerin ön eğitimi büyük veri seti yerine alt görev verileri kullanılarak yapılmıştır. Öğrenilen gömmeleri analiz etmek ve yorumlamak için tasarlanan çeşitli irdeleme problemlerinde bu gömmelerin performansları incelenmiştir. Sonuçlar, ön eğitimde görev hiyerarşisi uygulanmasının gömmelerin performansını arttırdığını göstermektedir.
Özet (Çeviri)
Recent works show that learning contextualized embeddings for words is beneficial for natural language processing (NLP) tasks. Bidirectional Encoder Representations from Transformers (BERT) is one successful example of this approach. It learns embeddings by solving two tasks, which are masked language model (masked LM) and the next sentence prediction (NSP). This procedure is known as pre-training. The pre-training of BERT can also be framed as a multitask learning problem. In this thesis, we adopt hierarchical multitask learning approaches for BERT pre-training. Pre-training tasks are solved at different layers instead of the last layer, and information from the NSP task is transferred to the masked LM task. Also, we propose a new pre-training task, bigram shift, to encode word order information. To evaluate the effectiveness of our proposed models, we choose two downstream tasks, one of which requires sentence-level embeddings (textual entailment), and the other requires contextualized embeddings of words (question answering). Due to computational restrictions, we use the downstream task data instead of a large dataset for the pre-training to see the performance of proposed models when given a restricted dataset. We test their performance on several probing tasks to analyze learned embeddings. Our results show that imposing a task hierarchy in pre-training improves the performance of embeddings.
Benzer Tezler
- Yerel görünüm ve derin modeller kullanarak hibrit bir yüz tanıma yaklaşımı
A hybrid face recognition approach using local appearance and deep models
MERT ARI
Yüksek Lisans
Türkçe
2023
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. HAZIM KEMAL EKENEL
- Hierarchical clustering attention for unsupervised object-centric representation learning
Obje odaklı temsil öğrenimi için hiyerarşik kümeleyici dikkat yöntemleri
CAN KÜÇÜKSÖZEN
Yüksek Lisans
İngilizce
2022
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolKoç ÜniversitesiBilgisayar Bilimleri ve Mühendisliği Ana Bilim Dalı
PROF. DR. YÜCEL YEMEZ
- Robust and efficient learning methods for time series processing under missing data
Eksik veri içeren zaman serilerinin işlenmesi için gürbüz ve etkin öğrenme yöntemleri
SAFA ONUR ŞAHİN
Doktora
İngilizce
2025
Elektrik ve Elektronik Mühendisliğiİhsan Doğramacı Bilkent ÜniversitesiElektrik ve Elektronik Mühendisliği Ana Bilim Dalı
PROF. DR. SÜLEYMAN SERDAR KOZAT
- Comparison of active learning based hierarchical classification approaches on twitter
Twitter alanında hiyerarşik sınıflandırma yöntemini temel alan aktif öğrenmenin karşılaştırılması
RASHİD ZAMAN
Yüksek Lisans
İngilizce
2015
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSabancı ÜniversitesiBilgisayar Bilimleri ve Mühendisliği Ana Bilim Dalı
PROF. DR. YÜCEL SAYGIN
- Multi-subject brain decoding using deep learning techniques
Derin öğrenme yöntemlerini kullanarak çok denekli beyin okuma
BURAK VELİOĞLU
Yüksek Lisans
İngilizce
2016
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolOrta Doğu Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. FATOŞ TUNAY YARMAN VURAL
YRD. DOÇ. DR. ŞEYDA ERTEKİN BOLELLİ