Geri Dön

A novel approach to house price prediction using segmented bayesian optimization based ensemble models

Segmentasyon ile bayes optimizasyon tabanlı ensemble modelleri kullanarak ev fiyatları öngörüsüne yeni bir yaklaşım

  1. Tez No: 995477
  2. Yazar: ARTUN PINAR
  3. Danışmanlar: DOÇ. DR. TUNCAY ÖZCAN
  4. Tez Türü: Yüksek Lisans
  5. Konular: Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrol, Computer Engineering and Computer Science and Control
  6. Anahtar Kelimeler: Algoritmik model, Fiyat tahmini, K-ortalamalar yöntemi, Konut fiyatları, Algorithmic model, Price ferecasting, K-means method, Housing prices
  7. Yıl: 2026
  8. Dil: İngilizce
  9. Üniversite: İstanbul Teknik Üniversitesi
  10. Enstitü: Lisansüstü Eğitim Enstitüsü
  11. Ana Bilim Dalı: Büyük Veri ve İş Analitiği Ana Bilim Dalı
  12. Bilim Dalı: Belirtilmemiş.
  13. Sayfa Sayısı: Belirtilmemiş.

Özet

Konut piyasası, yalnızca temel insan barınma ihtiyacını karşılamakla kalmayıp aynı zamanda servet birikimi, yatırım planlaması ve finansal karar alma süreçlerinde kritik bir araç olarak da işlev gören çok yönlü bir sistemdir. Son on yıllarda konutlar, değerlemeleri yapısal özelliklerden ve konumdan daha geniş ekonomik koşullara ve piyasa duyarlılığına kadar çok çeşitli faktörlerden etkilenen karmaşık ekonomik varlıklara dönüşmüştür. 2008'deki ipotek krizi ve ardından gelen Covid-19 pandemisinin neden olduğu aksamalar da dahil olmak üzere küresel finansal krizler, konut fiyatlarının makroekonomik şoklara, enflasyonist baskılara ve değişen tüketici beklentilerine karşı oynaklığını ve hassasiyetini açıkça ortaya koymuştur. Bu dinamikler, ekonomik kırılganlığın ve hızlı kentleşmenin artan belirsizlik ortamı yarattığı ve alıcılar, satıcılar, yatırımcılar, finans kurumları ve politika düzenleyicileri için güvenilir, veriye dayalı mülk değerlerini tahmin etme yöntemlerini vazgeçilmez kıldığı Türkiye gibi gelişmekte olan ekonomilerde özellikle belirgindir. Bu çalışma, İstanbul gayrimenkul piyasasındaki konut fiyatlarını tahmin etmek için kapsamlı, makine öğrenimine dayalı bir çerçeve geliştirerek bu zorlukları ele almaktadır. Kullanılan veri seti, net ve brüt metrekare alanları, oda sayısı, bina yaşı, kat seviyesi, toplam kat sayısı, ısıtma türü, listeleme kategorisi ve ilçe ve mahalle düzeyinde fiyat göstergeleri gibi mülke özgü, konumsal ve mahalle düzeyinde geniş bir özellik yelpazesini içermektedir. Veri kalitesini ve analitik güvenilirliği sağlamak için kapsamlı bir ön işleme süreci uygulanmıştır. Bu süreç, girdilerin temizlenmesi ve standartlaştırılmasını, tutarsız veya eksik değerlerin çözümlenmesini ve doğal dağılım özelliklerini korurken uç değerlerin etkisini azaltan Winsorization aracılığıyla aykırı değerlerin azaltılmasını içermektedir. İlçe ve mahalle tanımlayıcıları da dahil olmak üzere kategorik özellikler, bilgi sızıntısını önleyecek şekilde hedef kodlanmış, hedef değişkenin kendisi ise varyansı sabitlemek ve model öğrenme verimliliğini artırmak için bir log1p dönüşümünden geçirilmiştir. Çalışmanın kritik bir bileşeni, ham verilerde doğrudan gözlemlenemeyen temel ilişkileri daha iyi yakalamak için tasarlanmış özelliklerin geliştirilmesiydi. Kat oranları, oda başına alan metrikleri, banyo/alan oranları ve konut komplekslerindeki mülkler için ikili göstergeler gibi özellikler, mülk yapısının ve kullanılabilirliğinin nüanslı yönlerini nicelleştirmek için tanıtıldı. Ayrıca, ilçe ve mahalle düzeyindeki ortalama fiyat tabanlı kodlamalar, modellerin bireysel mülk değerlemelerini güçlü bir şekilde etkilediği bilinen yerel pazar beklentilerini de dahil etmesini sağladı. Korelasyon tabanlı özellik seçimi ve fazlalık giderme, yalnızca en bilgilendirici öngörücüleri korumak için daha da uygulandı ve hem model verimliliği hem de yorumlanabilirliği artırıldı.Metodolojinin yenilikçi bir yönü, İstanbul'un konut piyasasının doğası gereği heterojen olduğu gerçeğini göz önünde bulundurarak, veri setinin farklı pazar segmentlerine ayrılmasıydı. Mülkler, fiyat aralıkları, yapısal özellikler ve mahalle düzeyindeki göstergelerin bir kombinasyonuna göre kümelendi ve her segmentin benzersiz pazar dinamiklerini yansıtması sağlandı. Segmente özgü modelleme, farklılaştırılmış özellik önem modellerinin belirlenmesini ve bireysel modeller ilgili gruplarının yapısal, konumsal ve ekonomik nüanslarına uyum sağlayabildiğinden, tahmin performansının iyileştirilmesini sağladı. Bu yaklaşım, lüks, orta sınıf ve daha küçük ölçekli konut segmentlerinde mülk özelliklerinin fiyatlandırmayı nasıl farklı şekilde etkilediğine dair anlamlı içgörüler de sağlar. XGBoost, LightGBM, CatBoost, Gradient Boosting ve Random Forest olmak üzere beş topluluk tabanlı regresyon algoritması, Optuna aracılığıyla Bayes hiperparametre araması kullanılarak eğitilmiş ve optimize edilmiştir. Değerlendirme, R², MAE, RMSE ve SMAPE dahil olmak üzere birden fazla tamamlayıcı metrik kullanarak hem doğruluk hem de öngörü kararlılığı açısından kapsamlı bir değerlendirme sunmuştur. Segmente özgü hiperparametre optimizasyonu, her modelin uyarlanabilirliğini daha da güçlendirirken, optimize edilmiş modellerin R² ağırlıklı bir topluluğu, öngörü güçlerini birleştirmek için oluşturulmuştur. Bu topluluk, bireysel modellerden sürekli olarak daha iyi performans göstererek, gelişmiş genelleme, heterojen mülk grupları arasında kararlılık ve aşırı uyum sağlamaya karşı gelişmiş direnç göstermiştir. Sonuç olarak, bu araştırma, dinamik kentsel pazarlarda konut fiyatı tahmini için sağlam, yorumlanabilir ve son derece uyarlanabilir bir makine öğrenimi çerçevesi sunmaktadır. Titiz ön işleme, gelişmiş özellik mühendisliği, segmente özgü modelleme ve topluluk öğrenimini bir araya getiren çalışma, yalnızca yüksek tahmin doğruluğu sağlamakla kalmıyor, aynı zamanda özellik değerlerinin belirleyicilerine ilişkin eyleme geçirilebilir içgörüler de sağlıyor. Önerilen metodoloji, pratik faydalar sunuyor. Veriye dayalı karar alma ve daha adil piyasa değerlendirmeleri sağlayarak alıcılar, satıcılar, finans kurumları ve politika yapıcılar için daha fazla olanak sağlayacaktır. Gelecekteki genişletmeler, zamansal ve makroekonomik göstergelerin, mekansal ekonometrik tekniklerin ve daha derin hiyerarşik segmentasyon stratejilerinin dahil edilmesini içerebilir; bu da çerçevenin, gayrimenkul fiyatlandırmasındaki değişen piyasa davranışlarını ve karmaşık doğrusal olmayan ilişkileri yakalama kapasitesini daha da artırabilir. Bununla birlikte, çalışmanın bulguları makine öğrenimi tabanlı değerleme modellerinin yalnızca teknik doğruluk açısından değil, aynı zamanda piyasa şeffaflığı ve bilgi asimetrisinin azaltılması açısından da önemli katkılar sunduğunu göstermektedir. Özellikle karmaşık ve hızla değişen kentsel piyasalarda, geleneksel değerleme yaklaşımlarının sınırlı kaldığı durumlarda, veri odaklı modeller karar alma süreçlerini destekleyici tamamlayıcı araçlar olarak öne çıkmaktadır. Bu bağlamda geliştirilen çerçeve, konut piyasasının yapısal karmaşıklığını nicel olarak ele alabilen esnek bir altyapı sunmakta ve farklı paydaşların risk değerlendirmesi, fiyat beklentisi oluşturma ve stratejik planlama süreçlerinde daha tutarlı ve öngörülebilir çıktılar elde etmesine olanak tanımaktadır. Çalışma, akademik literatüre yöntemsel bir katkı sağlamanın yanı sıra, Türkiye özelinde gayrimenkul piyasasının analitik olarak incelenmesine yönelik uygulanabilir ve ölçeklenebilir bir referans modeli ortaya koymaktadır. Ayrıca, çalışmada izlenen yaklaşımın ölçeklenebilir yapısı, farklı şehirler, bölgesel alt piyasalar ve değişen veri yapıları için kolaylıkla uyarlanabilir olduğunu göstermektedir. Model mimarisinin modüler olarak kurgulanmış olması, yeni değişkenlerin eklenmesine, alternatif segmentasyon stratejilerinin test edilmesine ve farklı öğrenme algoritmalarının entegrasyonuna olanak tanımaktadır. Bu esneklik, özellikle veri erişiminin zaman içinde genişlediği veya piyasa koşullarının hızla değiştiği ortamlarda modelin güncelliğini ve geçerliliğini korumasını sağlamaktadır. Dolayısıyla önerilen çerçeve, yalnızca tek seferlik bir tahmin çalışması olmanın ötesine geçerek, sürekli güncellenebilir ve karar destek sistemlerine entegre edilebilir dinamik bir değerleme altyapısı sunmaktadır.

Özet (Çeviri)

The housing market is a multifaceted system that not only satisfies the fundamental human need for shelter but also functions as a critical instrument for wealth accumulation, investment planning, and financial decision-making. Over the past decades, residential properties have evolved into complex economic assets, whose valuation is affected by a wide array of factors ranging from structural characteristics and location to broader economic conditions and market sentiment. The global financial crises, including the 2008 mortgage collapse and the subsequent disruptions caused by the Covid-19 pandemic, have vividly demonstrated the volatility and sensitivity of housing prices to macroeconomic shocks, inflationary pressures, and shifting consumer expectations. These dynamics are particularly pronounced in developing economies such as Türkiye, where economic fragility and rapid urbanization create an environment of heightened uncertainty, making reliable, data driven methods for predicting property values indispensable for buyers, sellers, investors, financial institutions, and policy regulators. This study addresses these challenges by developing a comprehensive, machine learning-based framework for predicting housing prices within the Istanbul real estate market. The dataset utilized includes a broad spectrum of property-specific, locational, and neighborhood-level attributes, such as net and gross square meter areas, number of rooms, building age, floor level, total floors, heating type, listing category, and district and neighborhood-level price indicators. To ensure data quality and analytical reliability, an extensive preprocessing pipeline was applied. This pipeline involved cleaning and standardization of entries, resolution of inconsistent or missing values, and mitigation of outliers through Winsorization, which reduces the influence of extreme values while preserving natural distributional characteristics. Categorical features, including district and neighborhood identifiers, were target-encoded in a manner designed to prevent information leakage, while the target variable itself underwent a log1p transformation to stabilize variance and enhance model learning efficiency. A critical component of the study was the development of engineered features to better capture underlying relationships that are not directly observable in raw data. Features such as floor ratios, area-per-room metrics, bathroom-to-area ratios, and binary indicators for properties within residential complexes were introduced to quantify nuanced aspects of property structure and usability. Additionally, average price-based encodings at district and neighborhood levels allowed the models to incorporate local market expectations, which are known to strongly influence individual property valuations. Correlation-based feature selection and redundancy elimination were further applied to retain only the most informative predictors, improving both model efficiency and interpretability.A novel aspect of the methodology was the segmentation of the dataset into distinct market segments, recognizing that Istanbul's housing market is inherently heterogeneous. Properties were clustered based on a combination of price ranges, structural characteristics, and neighborhood-level indicators, allowing each segment to reflect unique market dynamics. Segment-specific modeling enabled the identification of differentiated feature importance patterns and improved predictive performance, as individual models could adapt to the structural, locational, and economic nuances of their respective groups. This approach also provides meaningful insights into how property characteristics influence pricing differently across luxury, mid-range, and smaller-scale residential segments. Five ensemble-based regression algorithms—XGBoost, LightGBM, CatBoost, Gradient Boosting, and Random Forest—were trained and optimized using Bayesian hyperparameter search through Optuna. Evaluation employed multiple complementary metrics, including R², MAE, RMSE, and SMAPE, offering a comprehensive assessment of both accuracy and predictive stability. Segment-specific hyperparameter optimization further strengthened each model's adaptability, while an R²-weighted ensemble of the optimized models was constructed to combine their predictive strengths. This ensemble consistently outperformed individual models, demonstrating enhanced generalization, stability across heterogeneous property groups, and improved resistance to overfitting. In conclusion, this research presents a robust, interpretable, and highly adaptable machine learning framework for housing price prediction in dynamic urban markets. By combining rigorous preprocessing, advanced feature engineering, segment-specific modeling, and ensemble learning, the study not only delivers high predictive accuracy but also provides actionable insights into the determinants of property values. The proposed methodology offers practical benefits for buyers, sellers, financial institutions, and policymakers by enabling data-driven decision-making and fairer market assessments. Future extensions may involve incorporating temporal and macroeconomic indicators, spatial econometric techniques, and deeper hierarchical segmentation strategies, which could further enhance the framework's capacity to capture evolving market behaviors and complex nonlinear relationships in real estate pricing.

Benzer Tezler

  1. Coğrafi bilgi sistemleri entegreli makine öğrenmesine dayalı toplu taşınmaz değerleme modelinin geliştirilmesi

    Development of mass property valuation model based on geographic information systems integrated machine learning methods

    MUHAMMED OĞUZHAN METE

    Doktora

    Türkçe

    Türkçe

    2022

    Jeodezi ve Fotogrametriİstanbul Teknik Üniversitesi

    Geomatik Mühendisliği Ana Bilim Dalı

    PROF. DR. TAHSİN YOMRALIOĞLU

  2. Pre-release forecasting of imdb movie ratings using multi-view data

    Gösterime girmemiş filmlerin ımdb puanının farklı özellik kümeleri kullanılarak tahmin edilmesi

    BEYZA ÇİZMECİ

    Yüksek Lisans

    İngilizce

    İngilizce

    2018

    Bilgisayar Mühendisliği Bilimleri-Bilgisayar ve Kontrolİstanbul Teknik Üniversitesi

    Bilgisayar Mühendisliği Ana Bilim Dalı

    PROF. DR. ŞULE ÖĞÜDÜCÜ

  3. Elektrik üreticileri perspektifinden uzun dönem elektrik üretimi yatırımlarının planlanmasına yönelik bir karar destek modeli

    A decision support model for long-term investment planning of electricity generation from the perspective of generation companies

    BERNA TEKTAŞ SİVRİKAYA

    Doktora

    Türkçe

    Türkçe

    2016

    Enerjiİstanbul Teknik Üniversitesi

    İşletme Mühendisliği Ana Bilim Dalı

    PROF. DR. FERHAN ÇEBİ

  4. Makina halılarının yapısal özellikleri ile mekanik etkiler karşısındaki davranış özellikleri üzerine bir araştırma

    The physics of woven carpets

    ÖMER BERK BERKALP

    Yüksek Lisans

    Türkçe

    Türkçe

    1997

    Tekstil ve Tekstil Mühendisliğiİstanbul Teknik Üniversitesi

    Tekstil Mühendisliği Ana Bilim Dalı

    DOÇ. DR. EMEL ÖNDER

  5. Orhan Pamuk'un romanlarında geleneksel-kültürel ögeler

    Traditional-cultural elements in Orhan Pamuk?s novels

    BÜŞRA SÜRGİT

    Yüksek Lisans

    Türkçe

    Türkçe

    2010

    Türk Dili ve EdebiyatıFatih Üniversitesi

    Türk Edebiyatı Bölümü

    PROF. DR. İLHAN ÖZKEÇECİ

    PROF. DR. FATİH ANDI