Machine learning based language models on nucleotide sequences of human genes
İnsan genleri nükleotit dizilerinin makine öğrenmesi ile modellenmesi
- Tez No: 831775
- Danışmanlar: DOÇ. DR. ARZUCAN ÖZGÜR TÜRKMEN
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2023
- Dil: İngilizce
- Üniversite: Boğaziçi Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bilgisayarların kullanımı bilimin değişik alanlarındaki birçok çalışmada çeşitli faydalar sağlamıştır. Bilgisayarların hızındaki ve elimizdeki verinin miktarındaki artış dikkate alındığında bu durumun daha da yaygınlaşacağı beklentisi kuvvet kazanmaktadır. Bu çalışma bilgisayarları bilimin en ilginç alanlarından birisi olan Genetik'te kullanmak üzerinedir. İnsan genlerini oluşturan nükleotit dizilerindeki yapıyı modellemek için birçok farklı tekniğin kullanıldığı bu çalışmada elde edilen modeller görülmemiş bir nükleotit dizisinin bir insan genine ait olup olmadığını tahmin edebilme özelliğini sahiptir. Ayrıca yeni nükleotit serilerini üretme görevini de yerine getirebilmektedirler. Kullanılan tüm metodlar Makine Öğrenmesi isimli bir yaklaşım tabanlı olup hedef bilgisayara her aşamada ne yapması gerektiğini tek tek izah etmek yerine veriyi kullanarak öğrenmesini sağlamak şeklinde açıklanabilir. Eskiden beri kullanılan N-gram tarzı tekniklerin yanında son zamanlarda çok popüler hale gelen Derin Öğrenme tabanlı Recurrent Neural Networks ve Transformer dil modellerinden de faydalanılmıştır. Geliştirilen sistemler klasik başarı ölçütlerinin yanında gerçek hayata daha yakın olan ve Genetik ile alakalı bazı görevlerdeki başarıları ile de değerlendirilmiştir. Sonuçlar Doğal Dil ile bazı farkları barındıran bir problemde farklı tekniklerin kıyaslanması adına ilginçtir. Ayrıca N-gram tarzı basit modellerin bazı problemleri çözmede Transformer gibi karmaşık modellerden daha iyi olmalarının mümkün olduğu görülmüş olmuştur. Son olarak modelleri ölçerken gerçek görevlerde testin çok mühim olduğu öğrenilmiştir çünkü transformer modeli perplexity dikkate alındığında N-gram'dan daha iyi iken gerçek testte daha kötü sonuç vermiştir.
Özet (Çeviri)
The use of computers for different fields of science has provided tremendous benefits. This phenomenon is expected to be more common as the speed of computers and the amount of data available for different kinds of scientific problems increase. This study focuses on genomics, one of the most exciting areas of science. We have applied several techniques to obtain a model for nucleotide sequences of genes that are found in human beings so that the model can learn the general pattern in these nucleotide sequences and predict how likely it is that an unseen sequence is a gene that belongs to human beings. They can even generate new nucleotide sequences. All of the methods used are examples of machine learning, where the programs are designed to learn from data for a specific task, rather than explicitly programming what to do at each step. Traditional approaches such as N-grams and more recent deep learning-based techniques such as recurrent neural networks and transformer architecture language models are used. In addition to the classical metrics, the strength of the methods is measured using a real-world task from the field of genomics. Finally, the results show an interesting comparison of how all these models perform on a task that is inherently different from classical natural language processing tasks, and how sometimes simple models like N-grams can be as good as, if not better than, more sophisticated techniques such as transformer for solving certain types of problems. Furthermore, the significance of evaluating obtained models on real-life tasks is seen because the transformer model was superior to the N-gram model according to perplexity, although it performed worse on real-world task.
Benzer Tezler
- SNP markırlarının burun morfolojisi ile ilgili özelliklerinin modellenmesi
Modelling of SNP markers' features related to nose morphology
ULVIYYA MUSTAFAYEVA
Doktora
Türkçe
2024
Biyolojiİstanbul Üniversitesi-CerrahpaşaFen Bilimleri Ana Bilim Dalı
DOÇ. DR. GÖNÜL FİLOĞLU TÜFEK
- Doğal dil işlemede çizgesel ve olasılık tabanlı bir otomatik öğrenme uygulaması
A machine learning application in natural language processing based on probabilistic graph models
HAYRİ VOLKAN AGUN
Yüksek Lisans
Türkçe
2008
Bilim ve TeknolojiTrakya ÜniversitesiBilgisayar Mühendisliği Bölümü
YRD. DOÇ. DR. ERDEM UÇAR
YRD. DOÇ. DR. YILMAZ KILIÇASLAN
- Hasta aciliyet seviyesinin belirlenmesi için büyük dil modeli ve makine öğrenmesi tabanlı akıllı triyaj sistemi
An intelligent triage system for hospital emergency services based on large language models and machine learning
OMAR SAEED
Yüksek Lisans
Türkçe
2026
BiyomühendislikErciyes ÜniversitesiBiyomedikal Mühendisliği Ana Bilim Dalı
PROF. DR. MEHMET EMİN YÜKSEL
- Geleneksel makine öğrenimi algoritmaları ile ön eğitimli dil modellerinin duygu analizi uygulamasındaki performanslarının incelenmesi
Examination of the performance of traditional machine learning algorithms and pretrained language models in sentiment analysis application
AYŞE KARLIDAĞ SÜZER
Yüksek Lisans
Türkçe
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolHaliç ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DOÇ. DR. ÜLVİYE HACIZADE
- Psikopatolojinin tespitinde yeni bir yaklaşım: Makine öğrenmesiyle ve derin öğrenmeyle dilin analizine dayalı psikopatolojinin tespiti
A new approach in detection of psychopathology: Detection of psychopathology based on analysis of language with machine learning and deep learning
ERKAN EYRİKAYA