Veri anonimleştirme ve sentetik veri üretimi tekniklerinin karşılaştırılması
Comparative analysis of data anonymization and synthetic data generation techniques
- Tez No: 969952
- Danışmanlar: DR. ÖĞR. ÜYESİ EMİNE SEZER, PROF. DR. DENİZ KILINÇ
- Tez Türü: Yüksek Lisans
- Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
- Anahtar Kelimeler: Bilgisayar programlama, Bilgisayar yazılımları, Yapay zeka, Computer programming, Computer softwares, Artificial intelligence
- Yıl: 2025
- Dil: Türkçe
- Üniversite: Ege Üniversitesi
- Enstitü: Fen Bilimleri Enstitüsü
- Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
- Bilim Dalı: Belirtilmemiş.
- Sayfa Sayısı: Belirtilmemiş.
Özet
Bu tez çalışması, kişisel veri gizliliğini sağlamaya yönelik klasik anonimleştirme teknikleri ile sentetik veri üretim yöntemlerini çok boyutlu ölçütlerle karşılaştırmalı olarak incelemektedir. Veri paylaşımı gereken durumlarda, gizlilik ve veri kullanılabilirliği arasındaki denge kritik önem taşımaktadır. Çalışmada, K-Anonimlik, L-Çeşitlilik ve T-Yakınlık gibi temel anonimleştirme kavramları açıklanmış; ardından beş anonimleştirme algoritması (Klasik Mondrian, Mondrian, Mondrian L-Div, DataFly, Top-Down Greedy) ve üç sentetik veri modeli (Gaussian Copula, CTGAN, TVAE) kullanılarak dört veri kümesi (Adult, Cahousing, CMC, MGM) üzerinde deneysel analiz gerçekleştirilmiştir. Gerçekleştirilen analizler; bilgi kaybı (NCP), ayırt edilebilirlik (DM), eşdeğerlik sınıfı boyutu (CAVG), istatistiksel benzerlik (TV ve KS skorları), makine öğrenmesi başarımı (TSTR), işlem süresi ve bellek kullanımı gibi ölçütlerle değerlendirilmiştir. Sonuçlar, sentetik veri üretim yöntemlerinin özellikle veri kalitesi ve analiz başarımı açısından öne çıktığını; Gaussian Copula'nın düşük maliyetli ve etkili, TVAE'nin sayısal verilerde başarılı, CTGAN'ın ise yüksek doğrulukla birlikte en maliyetli yöntem olduğunu göstermektedir. Anonimleştirme algoritmaları ise gizlilik garantileri ve işlem hızı açısından avantajlıdır. Klasik Mondrian algoritması dengeli sonuçlar sunarken, L-Çeşitlilik uygulanan varyantlarda ciddi veri kayıpları gözlemlenmiştir. Bu çalışma, yöntemin seçiminde tek boyutlu değil; veri tipi, gizlilik seviyesi, analiz ihtiyacı ve sistem kaynakları gibi çoklu faktörlerin dikkate alınması gerektiğini vurgulamakta ve hem akademik hem de pratik kullanım için kapsamlı bir değerlendirme sunmaktadır.
Özet (Çeviri)
This thesis presents a comparative analysis of classical data anonymization techniques and synthetic data generation methods, both aiming to ensure personal data privacy. In scenarios where data sharing is required, maintaining a balance between privacy and data utility is of critical importance. The study introduces core anonymization concepts such as k-anonymity, l-diversity, and t-closeness, and evaluates five anonymization algorithms (Classical Mondrian, Mondrian, Mondrian L-Div, DataFly, Top-Down Greedy) and three synthetic data generation models (Gaussian Copula, CTGAN, TVAE) across four datasets (Adult, Cahousing, CMC, MGM). These methods were assessed through multidimensional metrics, including information loss (NCP), distinguishability (DM), average equivalence class size (CAVG), statistical similarity (TV and KS scores), machine learning performance (TSTR), processing time, and memory usage. The findings indicate that synthetic data generation methods outperform anonymization algorithms in terms of data quality and analytical utility. Gaussian Copula stands out with its low computational cost and effectiveness, TVAE performs well on numerical datasets, and CTGAN achieves high accuracy but is the most resource-intensive. In contrast, anonymization algorithms provide strong privacy guarantees and faster execution. Classical Mondrian delivers balanced results, while methods enforcing l-diversity lead to significant information loss. This study emphasizes that method selection should be based on multiple criteria—such as data type, privacy requirements, analytical goals, and resource constraints—rather than a single metric. It provides a comprehensive evaluation framework applicable to both academic research and real-world practices.
Benzer Tezler
- Towards differentially private data publishing for effective privacy research
Akıllı sayaç verilerinde etkıi mahremiyet araştırmaları için diferansiyel gizli gürültü ekleme
MOHAMED MEDHAT MOHAMED ALI ZEINA
Yüksek Lisans
İngilizce
2023
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSabancı ÜniversitesiBilgisayar Bilimleri ve Mühendisliği Ana Bilim Dalı
PROF. DR. ALBERT LEVİ
- Siber güvenlik testleri için yapay zeka tabanlı sentetik ağ trafiği üretim yöntemlerinin iyileştirilmesi
Improvement of artificial intelligence-based synthetic network traffic generation methods for cybersecurity testing
MAHMUT ÇAĞATAY ÇOBAN
Yüksek Lisans
Türkçe
2025
Savunma ve Savunma TeknolojileriMuğla Sıtkı Koçman ÜniversitesiYapay Zeka Ana Bilim Dalı
DR. ÖĞR. ÜYESİ ENİS KARAARSLAN
- Kişisel verilerin anonimleştirilmesinin iyileştirilmesine yönelik bir model geliştirilmesi ve e-devlet alanında uygulanması
Development of a model for improving personal data anonymization and case study in e-government
MUSTAFA AFYONLUOĞLU
Doktora
Türkçe
2019
Elektrik ve Elektronik MühendisliğiHacettepe ÜniversitesiElektrik-Elektronik Mühendisliği Ana Bilim Dalı
PROF. DR. ALİ ZİYA ALKAR
- Privacy preserving publishing of hierarchical data
Hiyerarşik verilerde mahremiyetin korunması
İSMET ÖZALP
Doktora
İngilizce
2017
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSabancı ÜniversitesiBilgisayar Bilimleri ve Mühendisliği Ana Bilim Dalı
PROF. DR. YÜCEL SAYGIN
DOÇ. DR. MEHMET ERCAN NERGİZ
- Aykırı veri yönelimli fayda temelli büyük veri anonimleştirme modeli
Outlier oriented utility based big data anonymization model
YAVUZ CANBAY
Doktora
Türkçe
2019
Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolGazi ÜniversitesiBilgisayar Mühendisliği Ana Bilim Dalı
PROF. DR. ŞEREF SAĞIROĞLU
DR. YILMAZ VURAL