Doğal dil işleme ve derin öğrenme teknikleri ile metinden görüntü üretimi
Text-to-image generation using natural language processing and deep learning techniques
- Tez No: 972824
- Danışmanlar: DOÇ. DR. KALİ GÜRKAHRAMAN
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Belirtilmemiş.
- Yıl: 2025
- Dil: Türkçe
- Üniversite: Sivas Cumhuriyet Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Yapay Zekâ Tarafından Üretilen İçerik (AIGC), metin, görüntü, ses, video veya kod gibi içeriklerin yapay zekâ araçları aracılığıyla oluşturulmasını ifade eder. Bu içerikler, kullanıcılar tarafından verilen istemler (prompt) doğrultusunda üretilmekte olup eğitim, sanat ve sağlık gibi pek çok alanda kullanılmaktadır. AIGC uygulamaları arasında metinden-görüntüye üretim (text-to-image synthesis) önemli bir yere sahiptir. Bu amaçla geliştirilen üretici modeller genel hatlarıyla üç ana gruba ayrılmaktadır: Üretici Çekişmeli Ağlar (GAN), Varyasyonel Otokodlayıcılar (VAE) ve Difüzyon Modelleri. Bu çalışmanın amacı, metinden-görüntüye üretim sürecinde kullanılan veri kümelerini, uygulanan üretici model türlerini, bu modellerin mimari yapıları, kayıp fonksiyonları ve matematiksel temellerini ayrıntılı şekilde incelemektir. Bu bağlamda GAN ve Difüzyon modelleri incelenmiştir. Deneysel süreçte CUB-200-2011 (kuş) veri kümesi eğitim ve değerlendirme amacıyla kullanılmıştır. Literatürde yaygın olarak COCO gibi daha büyük veri kümeleri tercih edilse de metinden-görüntüye modellerin eğitimi yüksek hesaplama gücü ve büyük VRAM kapasitesi gerektirdiğinden dolayı, kuş veri kümesi bu çalışma için daha uygun bir tercih olarak değerlendirilmiştir. Deneylerde kullanılan modeller arasında Attentional GAN, Deep Fusion GAN, Generative Adversarial Contrastive Language–Image Pretraining (GALIP) ve mimari değişiklikler içeren yeni bir GALIP türevi yer almaktadır. Modeller, önceden eğitilmiş metin kodlayıcıların sabit tutulduğu yarı-sıfırdan (semi-scratch) bir şekilde eğitilmiştir. Model performansı, Frechet Inception Distance (FID) ve Contrastive Language–Image Pretraining Score (CLIPScore) gibi metriklerle değerlendirilmiştir. Deneysel sonuçlara göre, orijinal GALIP modeli 11.3119 FID ve 32.37 CLIPScore elde ederken, önerilen GALIP türevi 10.5895 FID ve 32.34 CLIPScore ile daha iyi bir performans göstermiştir. Bu çalışma, mevcut modellerin tasarım prensipleri ve matematiksel temellerine kapsamlı bir bakış sunarken, aynı zamanda sınırlı hesaplama kaynakları altında daha iyi sentezleme başarımı sergileyen rekabetçi bir GALIP tabanlı türevi de ortaya koymaktadır.
Özet (Çeviri)
AI-Generated Content (AIGC) refers to the creation of content such as text, images, audio, video, or code through artificial intelligence tools. These contents are produced based on prompts provided by users and are utilized in diverse domains including education, art, and healthcare. Among AIGC applications, text-to-image synthesis holds a significant position. Generative models developed for this task can be broadly categorized into three main groups: Generative Adversarial Networks (GANs), Variational Autoencoders (VAEs), and Diffusion Models. The aim of this study is to examine the datasets used in text-to-image synthesis, the generative models employed, their architectural structures, loss functions, and mathematical foundations. Within this context, both GAN and Diffusion models were analyzed. In this work, the CUB-200-2011 (birds) dataset was used for training and evaluation. Although larger datasets such as COCO are commonly used in the literature, training text-to-image models requires high computational power and large VRAM capacities. Therefore, the birds' dataset was considered a more suitable choice for this study. The models used in the experiments include Attentional GAN, Deep Fusion GAN, Generative Adversarial Contrastive Language–Image Pretraining (GALIP), and a newly proposed GALIP variant with architectural modifications. These models were trained in a semi-scratch manner, where pretrained text encoders were kept frozen. Model performance was evaluated using metrics such as Frechet Inception Distance (FID) and Contrastive Language–Image Pretraining Score (CLIPScore). Experimental results show that the original GALIP model achieved 11.3119 FID and 32.37 CLIPScore, whereas the proposed GALIP variant outperformed it with 10.5895 FID and 32.34 CLIPScore. This study presents a comprehensive analysis of existing models' design principles and mathematical foundations, while also introducing a competitive GALIP-based variant that delivers better synthesis performance under limited computational resources.
Benzer Tezler
- Çeviri dersinde yapılaşma (uygulama sorunları-yöntem önerileri)
Strukturierung im übersetzungsunterricht (probleme der praxis-vorschlage zur methodik)
A. TURGAY KURULTAY
Doktora
Türkçe
1989
Eğitim ve Öğretimİstanbul ÜniversitesiAlman Dili ve Edebiyatı Bilim Dalı
PROF.DR. ŞARA SAYIN
- Makine öğrenmesi ile veri madenciliği teknikleri kullanılarak anahtar kelime tahmini ve tezlerdeki anahtar kelimelerin doğruluk oranı tespiti
Keyword estimation and accuracy of keywords in theses using machine learning and data mining techniques
AYNUR GÜNAY
Yüksek Lisans
Türkçe
2023
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolNişantaşı ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ FATİH ŞAHİN
- A new framework for decentralized social networks: Harnessing blockchain, deep learning, and natural language processing
Merkezsiz sosyal ağlar için yeni bir çerçeve: Blok zinciri, derin öğrenme ve doğal dil işlemeyi kullanmak
AMIR AL KADAH
Yüksek Lisans
İngilizce
2024
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSakarya ÜniversitesiYazılım Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ DENİZ BALTA
- Fake news classification using machine learning and deep learning approaches
Makine öğrenimi ve derin öğrenme yaklaşımlarını kullanarak sahte haber sınıflandırması
SAJA ABDULHALEEM MAHMOOD AL-OBAIDI
Yüksek Lisans
İngilizce
2023
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolGazi ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
DR. ÖĞR. ÜYESİ TUBA ÇAĞLIKANTAR
- Sarcasm detection from text with context information using deep learning
Derin öğrenme kullanarak bağlam bilgisi ile metinden açılama tespiti
MUHAMMAD USMAN
Yüksek Lisans
İngilizce
2023
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolAltınbaş ÜniversitesiElektrik ve Bilgisayar Mühendisliği Ana Bilim Dalı
YRD. DOÇ. DR. ABDULLAH ABDU IBRAHIM