Machine Learning for Housing Price Prediction in Stockholm’s Inner City: A Comparative Analysis
2025 (English)Independent thesis Basic level (degree of Bachelor), 10 credits / 15 HE credits
Student thesis
Abstract [en]
Predicting housing prices is a complex task influenced by numerous property-specific and locational factors, which can significantly impact market dynamics. To address this challenge, the work presented in this thesis evaluates and compares the predictive performance of three supervised machine learning models—Random Forest, Gradient Boosting (XGBoost), and K-Nearest Neighbors (KNN)—for apartment prices in Stockholm’s inner city. Real estate transaction data was collected exclusively from Booli, a public platform for housing market information in Sweden. The models were trained on historical sales data and evaluated on recent transactions using a time-based train-test split approach. Standard regression metrics, including Root Mean Squared Error (RMSE) and Mean Absolute Error (MAE), were used to assess model performance. The results demonstrate that tree-based models, particularly XGBoost, achieve quite accurate predictive performance compared to KNN. The findings offer insights for real estate investors, buyers, and market analysts, while contributing to the growing research on machine learning applications in the real estate domain.
Abstract [sv]
Att förutsäga bostadspriser är en utmanande uppgift som påverkas av många bostadsspecifika och geografiska faktorer, vilka kan ha en betydande påverkan på marknadsdynamiken. För att hantera denna utmaning utvärderar och jämför det arbete som presenteras i detta examensarbete den prediktiva förmågan hos tre övervakade maskininlärningsmodeller—Random Forest, Gradient Boosting (XG-Boost) och K-Nearest Neighbors (KNN)—för lägenhetspriser i Stockholms innerstad. Fastighetstransaktionsdata samlades in uteslutande från Booli, en offentlig plattform för bostadsinformation i Sverige. Modellerna tränades på historiska försäljningsdata och utvärderades på nyare transaktioner genom en kronologisk uppdelning av tränings- och testdata. Standardmetoder för regressionsanalys, inklusive Root Mean Squared Error (RMSE) och Mean Absolute Error (MAE), användes för att mäta modellernas prestanda. Resultaten visar att trädbaserade modeller, särskilt XGBoost, når relativt hög prediktiv noggrannhet jämfört med KNN. Slutsatserna ger värdefulla insikter för fastighetsinvesterare, köpare och marknadsanalytiker och bidrar till den växande forskningen om maskininlärningens tillämpningar inom fastighetssektorn.
Place, publisher, year, edition, pages
2025. , p. 12
Series
TRITA-EECS-EX ; 2025:174
Keywords [en]
Machine Learning, Housing Price Prediction, Real Estate Market, Supervised Learning, Random Forest, Gradient Boosting, XGBoost, K-Nearest Neighbors, Model Evaluation, Stockholm Housing Market, Predictive Analytics
National Category
Computer and Information Sciences
Identifiers
URN: urn:nbn:se:kth:diva-367576OAI: oai:DiVA.org:kth-367576DiVA, id: diva2:1985507
Supervisors
Examiners
2025-07-292025-07-242025-08-11Bibliographically approved