kth.sePublications KTH
Change search
CiteExportLink to record
Permanent link

Direct link
Cite
Citation style
  • apa
  • ieee
  • modern-language-association-8th-edition
  • vancouver
  • Other style
More styles
Language
  • de-DE
  • en-GB
  • en-US
  • fi-FI
  • nn-NO
  • nn-NB
  • sv-SE
  • Other locale
More languages
Output format
  • html
  • text
  • asciidoc
  • rtf
Customer Churn Prediction in a Retail Bank: Supervised Machine Learning using Comprehensive Customer Data
KTH, School of Engineering Sciences (SCI), Mathematics (Dept.), Probability, Mathematical Physics and Statistics.
KTH, School of Engineering Sciences (SCI), Mathematics (Dept.), Probability, Mathematical Physics and Statistics.
2026 (English)Independent thesis Basic level (degree of Bachelor), 10 credits / 15 HE creditsStudent thesisAlternative title
Prediktion av Kundbortfall i en Retailbank : Övervakad Maskininlärning med Omfattande Kunddata (Swedish)
Abstract [en]

Customer churn is a significant concern in retail banking, as customer losses can reduce future revenue and weaken long-term profitability. This thesis develops and evaluates supervised machine learning models for predicting customer churn within the securities segment of a Swedish retail bank, using both transaction and portfolio data.

Three models are developed and compared: Logistic Regression, XGBoost, and Balanced Random Forest. A tailored churn definition combining account deactivation and economic inactivity is proposed and feature engineering is implemented in order to take advantage of the properties of the panel data. Rolling out-of-time cross-validation is used throughout to prevent temporal data leakage.

All three models achieve strong out-of-time ROC-AUC scores above 0.90, with XGBoost performing best at 0.951, followed by Random Forest at 0.943 and Logistic Regression at 0.917. XGBoost also achieves the strongest performance in terms of Precision@k, indicating that it is particularly effective at ranking true churners among the customers with the highest risk. 

The findings suggest that the model could support targeted retention strategies by identifying the highest-risk customers, while also indicating that churn prediction may have relevance beyond the studied segment for understanding customer loyalty across the bank’s broader customer base.

Abstract [sv]

Kundbortfall är en viktig fråga för retailbanker, eftersom förlorade kunder kan minska framtida intäkter och försvaga lönsamheten på längre sikt. I denna uppsats utvecklas och utvärderas övervakade maskininlärningsmodeller för att prediktera kundbortfall inom värdepapperssegmentet hos en svensk retailbank, baserat på både transaktionsdata och portföljdata. 

Tre modeller utvecklas och jämförs: Logistic Regression, XGBoost och Balanced Random Forest. Studien föreslår en anpassad definition av kundbortfall som kombinerar avslutade konton med ekonomiskt motiverad inaktivitet. Vidare genomförs feature engineering för att utnyttja egenskaperna hos datamaterialets panelstruktur. Genomgående används rullande out-of-time korsvalidering för att minska risken för temporalt dataläckage. 

Samtliga tre modeller uppnår starka out of time ROC-AUC värden över 0,90. XGBoost presterar starkast med ett ROC-AUC värde på 0,951, följt av Random Forest på 0,943 och logistisk regression på 0,917. XGBoost uppnår även starkast resultat sett till Precision@k, vilket tyder på att modellen är särskilt effektiv på att rangordna faktiskt kundbortfall bland de kunder som bedöms ha högst risk. 

Resultaten visar att modellen kan stödja riktade kundbevarande strategier genom att identifiera kunder som löper störst risk att lämna segmentet. Samtidigt indikerar resultaten att prediktion av kundbortfall kan vara relevant även bortom det studerade segmentet, genom att bidra till en bredare förståelse av kundlojalitet inom bankens bredare kundbas.

Place, publisher, year, edition, pages
2026.
Series
TRITA-SCI-GRU ; 2026:197
Keywords [en]
Customer churn, Retail banking, Securities segment, Supervised machine learning, Churn prediction, Classification models, XGBoost, Random Forest, Logistic Regression, Panel data, Financial data, Transaction data, Feature engineering, Out-of-time cross-validation, Precision@k
Keywords [sv]
Kundbortfall, Retailbank, Värdepapperssegment, Maskininlärning, Churnprediktion, Klassificeringsmodeller, XGBoost, Random Forest, Logistisk regression, Paneldata, Finansiell data, Transaktionsdata, Variabelkonstruktion, Out-of-time korsvalidering, Precision@k
National Category
Probability Theory and Statistics
Identifiers
URN: urn:nbn:se:kth:diva-384575OAI: oai:DiVA.org:kth-384575DiVA, id: diva2:2083043
External cooperation
anonymous
Subject / course
Applied Mathematics and Industrial Economics
Educational program
Master of Science in Engineering - Industrial Engineering and Management
Supervisors
Examiners
Available from: 2026-07-01 Created: 2026-07-01 Last updated: 2026-07-01Bibliographically approved

Open Access in DiVA

fulltext(785 kB)43 downloads
File information
File name FULLTEXT01.pdfFile size 785 kBChecksum SHA-512
1c4395d0705049d73d7ac8abca6053cd4e6721cdf60f72948d30d5612d24aa78ffa1fb516af25e1ac51ceb1b0665c87b68ec4a300836bcc60ba93d3110b793c5
Type fulltextMimetype application/pdf

By organisation
Probability, Mathematical Physics and Statistics
Probability Theory and Statistics

Search outside of DiVA

GoogleGoogle Scholar
The number of downloads is the sum of all downloads of full texts. It may include eg previous versions that are now no longer available

urn-nbn

Altmetric score

urn-nbn
Total: 3057 hits
CiteExportLink to record
Permanent link

Direct link
Cite
Citation style
  • apa
  • ieee
  • modern-language-association-8th-edition
  • vancouver
  • Other style
More styles
Language
  • de-DE
  • en-GB
  • en-US
  • fi-FI
  • nn-NO
  • nn-NB
  • sv-SE
  • Other locale
More languages
Output format
  • html
  • text
  • asciidoc
  • rtf