TR-webarchıve: kamu web mirasının korunması amacıyla YZ destekli hibrit arşivleme mimarisi
TR-webarchive: An AI-Supported hybrid archiving architecture for preserving public web heritage
- Tez No: 1001305
- Danışmanlar: DR. ÖĞR. ÜYESİ AHMET ANIL MÜNGEN
- Tez Türü: Yüksek Lisans
- Konular: Arşiv, Kamu Yönetimi, Archive, Public Administration
- Anahtar Kelimeler: Açık veri, Elektronik arşiv, Web arşivleme, Web madenciliği, İnsan-yapay zeka etkileşimi, Open data, Elektronic archive, Web archiving, web mining, Human-artificial intelligence interaction
- Yıl: 2026
- Dil: Türkçe
- Üniversite: Ostim Teknik Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Yazılım Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Dijital çağda kamu kurumları tarafından üretilen bilginin büyük bir kısmı web tabanlı platformlarda yayınlanmakta, ancak Web Efemera olarak adlandırılan dijital verinin geçici doğası nedeniyle bu bilgiler hızla kaybolma riskiyle karşı karşıya kalmaktadır. Türkiye'de kamu web sitelerinin sistematik olarak arşivlenmesi ve dijital belleğin korunmasına yönelik merkezi bir ulusal politikanın ve teknik altyapının henüz tam anlamıyla oluşturulmamış olması, devlet hafızasının sürekliliği açısından kritik bir eksikliktir. Bu tez ve metod önerisinin temel amacı; Türkiye'deki kamu kurumlarına ait web sitelerini düzenli olarak tarayıp kaydedecek, statik ve dinamik içerikleri bütüncül bir yaklaşımla ele alabilen hibrit bir Web Arşivleme Botu mimarisi geliştirmek ve toplanan verilerin Yapay Zeka (AI) destekli analizini sağlayan bir model sunmaktır. Tez kapsamında, mikroservis mimarisi temel alınarak Docker konteynerleri üzerinde çalışan modüler bir sistem tasarlanmıştır. Veri toplama katmanında ArchiveBox kullanılarak 1.000 adet kamu web sitesi (gov.tr, bel.tr, edu.tr) üzerinden pilot bir arşivleme uygulaması gerçekleştirilmiştir. Önerilen sistem, geleneksel yöntemlerin aksine, modern web teknolojilerinin yoğun kullanıldığı dinamik içerikleri tarayıcı otomasyonu teknikleri kullanarak aslına uygun şekilde yakalamayı başarmıştır. Arşivlenen veriler, uluslararası dijital koruma standardı olan ISO 28500 (WARC) formatında saklanmış ve PyWB arayüzü ile yeniden oynatılabilir hale getirilmiştir. Bu tez, Türkiye kamu web arşivciliği için statik depolamanın ötesine geçen, sürdürülebilir ve akıllı bir ekosistem modeli önermesiyle literatüre özgün bir katkı sağlamaktadır. Önerilen mikroservis tabanlı hibrit mimari ile dinamik içeriklerin eksiksiz yakalanması sorununa teknik bir çözüm getirilirken; analiz katmanında yerel Büyük Dil Modelleri (LLM) ve Geri Getirim Artırılmış Üretim (RAG) mimarisi entegre edilerek arşivlenen ham veri, tez kapsamında geliştirilen WARC-YZ hibrit modülü ile düşünen ve konuşan dijital arşiv'e dönüştürülmüştür. Zamanla dijital toz yığınlarına dönüşme riski taşıyan statik verileri anlamlandırarak etkileşime açan bu katman sayesinde, veri gizliliği korunarak anlamsal sorgulama yapılabilmekte ve akademik metrikler otonom olarak üretilebilmektedir. Ayrıca, otonom yapısı ve dinamik yakalama süreçleri sayesinde, dijital içeriklerin yapısal bütünlüğü korunarak ve veri kaybı en aza indirilerek saklanması sağlanmış, böylece kamu verisinin güvenilirliği güvence altına alınmıştır. TRABİS verileri ışığında yapılan ilk ulusal kapasite projeksiyonuyla desteklenen bu tez çalışması, ulusal hafızanın korunması adına Türkiye'ye özgü, uluslararası standartlarla uyumlu ve uygulanabilir, ulusal web arşivi referans mimari model sunmaktadır.
Özet (Çeviri)
In the digital age, a significant portion of the information produced by public institutions is disseminated on web-based platforms; however, due to the ephemeral nature of digital data, referred to as Web Ephemera, this information faces the imminent risk of rapid disappearance. The absence of a fully established central national policy and technical infrastructure for the systematic archiving of public websites and the preservation of digital memory in Turkey constitutes a critical deficiency regarding the continuity of state memory. The primary objective of this thesis study is to develop a hybrid web archiving bot architecture capable of regularly crawling and recording public institution websites in Turkey, handling both static and dynamic content with a holistic approach, and to present a model that enables Artificial Intelligence (AI)-supported analysis of the collected data. Within the scope of this thesis research, a modular system running on Docker containers based on a microservice architecture was designed. A pilot archiving study was conducted on 1,000 public websites (gov.tr, bel.tr, edu.tr) using ArchiveBox in the data collection layer. Contrary to traditional methods, the developed system successfully captured dynamic content, where modern web technologies are intensively used, faithfully utilizing browser automation techniques. The archived data was stored in the ISO 28500 (WARC) format, the international standard for digital preservation, and rendered replayable via the PyWB interface. The original scientific contribution of this thesis to the literature is the proposal of a sustainable and intelligent ecosystem model for Turkish public web archiving that goes beyond static storage. While providing a technical solution to the problem of completely capturing dynamic content with the developed microservice-based hybrid architecture; in the analysis layer, Large Language Models (LLM) and Retrieval-Augmented Generation (RAG) architecture—running entirely on local hardware—were integrated to transform the archived raw data into a thinking and speaking digital archive via the WARC-AI module developed within this thesis. Thanks to this layer, which opens static data that risks turning into digital dust piles to interaction by making it meaningful, semantic querying can be performed while preserving data privacy, and academic metrics can be generated autonomously. Furthermore, thanks to its autonomous structure and dynamic capture processes, the structural integrity of digital content is preserved, data loss is minimized during storage, and thus the reliability of public data is secured. Supported by the first national capacity projection made in the light of TRABİS data, this thesis presents a national web archive reference architecture model specific to Turkey, compatible with international standards, and applicable for the preservation of national memory.
Benzer Tezler
- Ovipar form (triturus cristatus karelini)'da dişi üreme sisteminin mevsimsel faaliyeti ve ovidukt histolojisi üzerinde bir araştırma
Başlık çevirisi yok
AYŞEN YAZICIOĞLU
- Söğüt (GD Bilecik) yöresindeki mesozoyik yaşlı tortul istifinin stratigrafisi ve sedimantolojik incelenmesi
Stratigraphical and sedimentological investigation of the mesozoic sedimentary units of Söğüt area (se Bilecik)
ERDOĞAN TEKİN
Yüksek Lisans
Türkçe
1987
Jeoloji MühendisliğiAnkara ÜniversitesiJeoloji Mühendisliği Ana Bilim Dalı
YRD. DOÇ. DR. BAKİ VAROL
- Ankara Üniversitesi'nde spor yapan öğrencilerin beslenme durumları ve fiziki performansları üzerinde bir araştırma
A Research on the nutritional status and physical performance of the students who were active in sports at the University of Ankara
BÜLENT ASMA
- Infravezikal obstriksiyonlu hastalarda mesane epitelindeki değişikliklerin histopatolojik incelenmesi
Başlık çevirisi yok
ALİCAN ARICAN
- Perde-çerçeve sistemlerinin statik ve deprem hesabı için bir paket program
Başlık çevirisi yok
GÜLGÜN BAHADIR
Yüksek Lisans
Türkçe
1987
İnşaat MühendisliğiÇukurova Üniversitesiİnşaat Mühendisliği Ana Bilim Dalı
DOÇ. DR. CENGİZ DÜNDAR