Utvärdering av algoritmer för extraktion av real-world data till kliniska kohortstudier: En fallstudie på strokepatienter i MIMIC-IV-databasen
2026 (Swedish)Independent thesis Basic level (degree of Bachelor), 10 credits / 15 HE credits
Student thesisAlternative title
Evaluation of Algorithms for Extraction of Real-World Data for Clinical Cohort Studies : A Case Study of Stroke Patients in the MIMIC-IV Database (English)
Abstract [sv]
Detta examensarbete utvärderar balanseringsalgoritmer för kohortextraktion i kliniska observationsstudier baserade på real-world data, det vill säga data från den verkliga världen. Arbetet presenterar tre huvudsakliga klasser av balanseringsmetoder, vilka implementeras i flera algoritmiska varianter och parameterinställningar. Dessa jämförs med tidigare studier och etablerade resultat i litteraturen för att bedöma prestanda och klinisk rimlighet. I observationsdata sker ingen slumpmässig tilldelning, vilket gör att patientgrupper ofta skiljer sig i relevanta bakgrundsfaktorer. Dessa systematiska skillnader kan ge upphov till förväxlingsfaktorer och leda till att observerade utfallsskillnader feltolkas som riskeffekter. Balansering syftar därför till att skapa mer jämförbara grupper genom att minska obalans i observerade kovariater innan utfall jämförs. Varianter i Coarsened Exact Matching, propensity score-stratifiering och Nearest Neighbor Matching med caliper presenteras och jämförs. Metoderna utgår från olika angreppssätt för att skapa jämförbara grupper genom matchning, stratifiering och parning inom en toleransgräns. Algoritmerna tillämpas på strokepatienter i MIMICIV med fokus på samsjuklighet och mortalitet. Resultaten visar en tydlig avvägning: striktare matchningskriterier förbättrar kovariatbalans men exkluderar fler patienter, vilket påverkar både statistisk styrka och generaliserbarhet. Mer inkluderande balansering behåller ett större urval men lämnar viss kvarvarande obalans som kan påverka tolkningen. Samtliga metoder visar ett robust samband mellan hög samsjuklighet och ökad mortalitet efter ischemisk stroke. Studien tydliggör hur valet av balanseringsmetod formar kohorten och därmed slutsatserna i observationsbaserad klinisk forskning.
Abstract [en]
This thesis evaluates balancing algorithms for cohort extraction in clinical observational studies based on real-world data, meaning data derived from real world settings. The study presents three main classes of balancing methods, which are implemented in multiple algorithmic variants and parameter settings. These are compared with previous studies and established results in the literature to assess performance and clinical plausibility. In observational data, there is no random assignment, which means that patient groups often differ in relevant background factors. These systematic differences can give rise to confounding factors and lead to observed outcome differences being misinterpreted as treatment effects. Balancing therefore aims to create more comparable groups by reducing imbalance in observed covariates before outcomes are compared. We compare Coarsened Exact Matching, propensity score stratification, and Nearest Neighbor Matching with a caliper. The methods are based on different approaches to create comparable groups through matching, stratification, and pairing within a tolerance threshold. The algorithms are applied to stroke patients in MIMIC-IV with a focus on comorbidity and mortality. The results show a clear trade-off: stricter matching criteria improve covariate balance but exclude more patients, which affects both statistical power and generalizability. More inclusive balancing retains a larger sample but leaves some remaining imbalance that may affect interpretation. All methods show a consistent association between high comorbidity and increased mortality after ischemic stroke. The study clarifies how the choice of balancing method shapes the cohort and thereby the conclusions in observational clinical research.
Place, publisher, year, edition, pages
2026.
Series
TRITA-CBH-GRU ; 2026:033
Keywords [en]
Ischemic stroke, MIMIC-IV, observational study, propensity score, cohort, cohort balancing, real-world data, comorbidity, mortality, bias, confoundment.
Keywords [sv]
Ischemisk stroke, MIMIC-IV, observationsstudie, propensity score, kohort, kohortbalansering, real-world förväxlingsfaktorer.
National Category
Computer Sciences
Identifiers
URN: urn:nbn:se:kth:diva-376827OAI: oai:DiVA.org:kth-376827DiVA, id: diva2:2039596
Subject / course
Computer Science
Educational program
Bachelor of Science in Engineering - Computer Engineering
Supervisors
Examiners
2026-02-202026-02-182026-02-20Bibliographically approved