Geri Dön

Veri anonimleştirme ve sentetik veri üretimi tekniklerinin karşılaştırılması

Comparative analysis of data anonymization and synthetic data generation techniques

  1. Tez No: 969952
  2. Yazar: KAAN KIVIRCIK
  3. Danışmanlar: DR. ÖĞR. ÜYESİ EMİNE SEZER, PROF. DR. DENİZ KILINÇ
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Bilgisayar programlama, Bilgisayar yazılımları, Yapay zeka, Computer programming, Computer softwares, Artificial intelligence
  7. Yıl: 2025
  8. Dil: Türkçe
  9. Üniversite: Ege Üniversitesi
  10. Enstitü: Fen Bilimleri Enstitüsü
  11. Ana Bilim Dalı: Bilgisayar Mühendisliği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Bu tez çalışması, kişisel veri gizliliğini sağlamaya yönelik klasik anonimleştirme teknikleri ile sentetik veri üretim yöntemlerini çok boyutlu ölçütlerle karşılaştırmalı olarak incelemektedir. Veri paylaşımı gereken durumlarda, gizlilik ve veri kullanılabilirliği arasındaki denge kritik önem taşımaktadır. Çalışmada, K-Anonimlik, L-Çeşitlilik ve T-Yakınlık gibi temel anonimleştirme kavramları açıklanmış; ardından beş anonimleştirme algoritması (Klasik Mondrian, Mondrian, Mondrian L-Div, DataFly, Top-Down Greedy) ve üç sentetik veri modeli (Gaussian Copula, CTGAN, TVAE) kullanılarak dört veri kümesi (Adult, Cahousing, CMC, MGM) üzerinde deneysel analiz gerçekleştirilmiştir. Gerçekleştirilen analizler; bilgi kaybı (NCP), ayırt edilebilirlik (DM), eşdeğerlik sınıfı boyutu (CAVG), istatistiksel benzerlik (TV ve KS skorları), makine öğrenmesi başarımı (TSTR), işlem süresi ve bellek kullanımı gibi ölçütlerle değerlendirilmiştir. Sonuçlar, sentetik veri üretim yöntemlerinin özellikle veri kalitesi ve analiz başarımı açısından öne çıktığını; Gaussian Copula'nın düşük maliyetli ve etkili, TVAE'nin sayısal verilerde başarılı, CTGAN'ın ise yüksek doğrulukla birlikte en maliyetli yöntem olduğunu göstermektedir. Anonimleştirme algoritmaları ise gizlilik garantileri ve işlem hızı açısından avantajlıdır. Klasik Mondrian algoritması dengeli sonuçlar sunarken, L-Çeşitlilik uygulanan varyantlarda ciddi veri kayıpları gözlemlenmiştir. Bu çalışma, yöntemin seçiminde tek boyutlu değil; veri tipi, gizlilik seviyesi, analiz ihtiyacı ve sistem kaynakları gibi çoklu faktörlerin dikkate alınması gerektiğini vurgulamakta ve hem akademik hem de pratik kullanım için kapsamlı bir değerlendirme sunmaktadır.

Özet (Çeviri)

This thesis presents a comparative analysis of classical data anonymization techniques and synthetic data generation methods, both aiming to ensure personal data privacy. In scenarios where data sharing is required, maintaining a balance between privacy and data utility is of critical importance. The study introduces core anonymization concepts such as k-anonymity, l-diversity, and t-closeness, and evaluates five anonymization algorithms (Classical Mondrian, Mondrian, Mondrian L-Div, DataFly, Top-Down Greedy) and three synthetic data generation models (Gaussian Copula, CTGAN, TVAE) across four datasets (Adult, Cahousing, CMC, MGM). These methods were assessed through multidimensional metrics, including information loss (NCP), distinguishability (DM), average equivalence class size (CAVG), statistical similarity (TV and KS scores), machine learning performance (TSTR), processing time, and memory usage. The findings indicate that synthetic data generation methods outperform anonymization algorithms in terms of data quality and analytical utility. Gaussian Copula stands out with its low computational cost and effectiveness, TVAE performs well on numerical datasets, and CTGAN achieves high accuracy but is the most resource-intensive. In contrast, anonymization algorithms provide strong privacy guarantees and faster execution. Classical Mondrian delivers balanced results, while methods enforcing l-diversity lead to significant information loss. This study emphasizes that method selection should be based on multiple criteria—such as data type, privacy requirements, analytical goals, and resource constraints—rather than a single metric. It provides a comprehensive evaluation framework applicable to both academic research and real-world practices.

Benzer Tezler

  1. Towards differentially private data publishing for effective privacy research

    Akıllı sayaç verilerinde etkıi mahremiyet araştırmaları için diferansiyel gizli gürültü ekleme

    MOHAMED MEDHAT MOHAMED ALI ZEINA

    Yüksek Lisans

    İngilizce

    İngilizce

    2023

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSabancı Üniversitesi

    Bilgisayar Bilimleri ve Mühendisliği Ana Bilim Dalı

    PROF. DR. ALBERT LEVİ

  2. Siber güvenlik testleri için yapay zeka tabanlı sentetik ağ trafiği üretim yöntemlerinin iyileştirilmesi

    Improvement of artificial intelligence-based synthetic network traffic generation methods for cybersecurity testing

    MAHMUT ÇAĞATAY ÇOBAN

    Yüksek Lisans

    Türkçe

    Türkçe

    2025

    Savunma ve Savunma TeknolojileriMuğla Sıtkı Koçman Üniversitesi

    Yapay Zeka Ana Bilim Dalı

    DR. ÖĞR. ÜYESİ ENİS KARAARSLAN

  3. Kişisel verilerin anonimleştirilmesinin iyileştirilmesine yönelik bir model geliştirilmesi ve e-devlet alanında uygulanması

    Development of a model for improving personal data anonymization and case study in e-government

    MUSTAFA AFYONLUOĞLU

    Doktora

    Türkçe

    Türkçe

    2019

    Elektrik ve Elektronik MühendisliğiHacettepe Üniversitesi

    Elektrik-Elektronik Mühendisliği Ana Bilim Dalı

    PROF. DR. ALİ ZİYA ALKAR

  4. Privacy preserving publishing of hierarchical data

    Hiyerarşik verilerde mahremiyetin korunması

    İSMET ÖZALP

    Doktora

    İngilizce

    İngilizce

    2017

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolSabancı Üniversitesi

    Bilgisayar Bilimleri ve Mühendisliği Ana Bilim Dalı

    PROF. DR. YÜCEL SAYGIN

    DOÇ. DR. MEHMET ERCAN NERGİZ

  5. Aykırı veri yönelimli fayda temelli büyük veri anonimleştirme modeli

    Outlier oriented utility based big data anonymization model

    YAVUZ CANBAY

    Doktora

    Türkçe

    Türkçe

    2019

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve KontrolGazi Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. ŞEREF SAĞIROĞLU

    DR. YILMAZ VURAL