Using contrastive learning and large language models on biomedical information extraction
Karşılaştırmalı öğrenme ve geniş dil modellerinin biyomedikal bilgi çıkarılmasında kullanılması
- Tez No: 971986
- Danışmanlar: PROF. ARZUCAN ÖZGÜR
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2024
- Dil: İngilizce
- Üniversite: Boğaziçi Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
İnsan bilgisinin hacmi olağanüstü bir hızla arttıkça, özel bir alanda bile mevcut çok çeşitli bilgileri tam olarak anlamak ve kullanmak giderek zorlaşmaktadır. Biyotıp alanı, her yıl yayınlanan ve türler, hastalıklar ve kimyasallar hakkında yeni anlayışlara katkıda bulunan binlerce araştırma makalesiyle buna örnek teşkil etmektedir. Bu büyüme, ilgili verilerin insan kapasitesinin ötesinde bir ölçekte çıkarılmasını ve kullanılmasını mümkün kılmak için Doğal Dil İşleme teknikleriyle birleştirilmiş etkili Bilgi Erişim sistemlerine yönelik büyük bir ihtiyaç yaratmıştır. Biyotıpta Etkili Bilgi Erişimi, birbiriyle bağlantılı birçok zorluğun çözülmesini içeren, yayınlanmış araştırmaların ayrıntılı düzeyde anlaşılmasını gerektirmektedir. Her Biyomedikal özet için varlıkları tanımak, bu varlıkları standartlaştırılmış tanımlayıcılarla normalleştirmek ve farklı varlık türleri arasındaki ilişkileri çıkarmak gerekmektedir. Bu görevlerin tamamlanması, bilginin yapılandırılmış bir temsilini kolaylaştırmakta ve karmaşık Biyomedikal bilgileri bilimsel ve klinik uygulamalar için daha erişilebilir hale getirmektedir. Biz bu çalışmada, mevcut bir normalleştirme aracı olan BioNEN [1]'nin performansını Karşılaştırmalı Öğrenme tekniklerini dahil ederek araştırıyor ve geliştiriyoruz. Varlık tanımayı geliştirmek için sözlüklerin, Karşılaştırmalı Öğrenmenin ve Büyük Dil Modellerinin (LLM'ler) entegrasyonunu araştırıyoruz ve varlıklar arasındaki ilişkileri çıkarmak için LLM'lerin kullanımını inceliyoruz. Sonuç olarak, Biyomedikal özetlerdeki varlıkları tanımlamak ve normalleştirmek ve ilişkileri etkili bir şekilde çıkarmak, böylece Biyomedikal Bilgi Erişim sistemlerinin kapasitesinin geliştirilmesini sağlamak için tasarlanmış geliştirilmiş bir aracı sizlere sunuyoruz.
Özet (Çeviri)
As the volume of human knowledge grows at an extraordinary rate, it is becoming progressively challenging to fully comprehend and utilize the vast array of information available, even within a specialized domain. The field of Biomedicine exemplifies this, with thousands of research papers published each year contributing new insights about species, diseases, and chemicals. Such growth has created an overwhelming need for effective Information Retrieval systems, coupled with Natural Language Processing techniques, to enable the extraction and use of relevant data at a scale beyond human capacity. Effective Information Retrieval in Biomedicine demands an understanding of published research at a granular level, which involves solving several interconnected challenges. For each Biomedical abstract, it is necessary to recognize entities, normalize these entities with standardized identifiers, and extract relationships between different types of entities. These tasks facilitate a structured representation of knowledge and make complex Biomedical information more accessible for scientific and clinical appli- cations. In this study, we investigate and enhance the performance of an existing normal- ization tool, BioNEN [1], by incorporating Contrastive Learning techniques. We ex- plore the integration of dictionaries, Contrastive Learning, and Large Language Models (LLMs) to improve entity recognition, and we examine the use of LLMs for extracting relationships between entities. The result is a streamlined tool designed to identify and normalize entities in Biomedical abstracts and to effectively extract relationships, thereby enabling advancement of Biomedical Information Retrieval systems
Benzer Tezler
- Multimodal medical visual question answering: Knowledge spaces and semantic segmentation for improved and explainable AI
Çok-kipli tıbbi görsel soru cevaplama: Bilgi uzayları ve anlamsal bölütleme ile gelişmiş ve açıklanabilir yapay zekâ
ZİYA ATA YAZICI
Yüksek Lisans
İngilizce
2025
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. HAZIM KEMAL EKENEL
- Ön eğitimli dil modellerinin kokan kod sınıflama performansının üçlü kayıp yöntemiyle iyileştirilmesi
Optimizing the code smell classification performance of pretrained language models using the triple loss method
ERTUĞRUL İSLAMOĞLU
Yüksek Lisans
Türkçe
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolFatih Sultan Mehmet Vakıf ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ ALİ NİZAM
- The significance and the contribution of 6+1 traits of writing to the success of the students in writing courses in English language teaching
Yazmanın 6+1 özelliğinin İngilizce öğretiminde yazılı anlatım derslerindeki öğrenci başarısına katkısı ve önemi
ÖZLEM YAZAR
Yüksek Lisans
İngilizce
2004
Eğitim ve ÖğretimGazi Üniversitesiİngiliz Dili Eğitimi Ana Bilim Dalı
YRD. DOÇ. DR. PAŞA TEVFİK CEPHE
- Lehrkonzepte zum deutschunterricht für die Türkischen kinder in Deutschland
Almanya`daki Türk çocukları için ders plan örnekleri
HÜSEYİN SÖNMEZ
Yüksek Lisans
Almanca
2000
Alman Dili ve EdebiyatıDokuz Eylül ÜniversitesiAlman Dili ve Edebiyatı Ana Bilim Dalı
YRD. DOÇ. DR. HASAN SEBÜKTEKİN
- Knowledge-based visual question answering
Bilgi tabanlı görsel soru cevaplama
ZİŞAN YALÇINKAYA
Yüksek Lisans
İngilizce
2023
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolMarmara ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ ANIL BAŞ