kth.sePublications KTH
CiteExportLink to record
Permanent link

Direct link
Cite
Citation style
  • apa
  • ieee
  • modern-language-association-8th-edition
  • vancouver
  • Other style
More styles
Language
  • de-DE
  • en-GB
  • en-US
  • fi-FI
  • nn-NO
  • nn-NB
  • sv-SE
  • Other locale
More languages
Output format
  • html
  • text
  • asciidoc
  • rtf
Deep-Learning-Based Beamforming Algorithms for Speech Separation in Multi-Talker Scenarios: Combining TCN Network and DoA Estimation for Off-line Speech Extraction
KTH, School of Electrical Engineering and Computer Science (EECS).
2026 (English)Independent thesis Advanced level (degree of Master (Two Years)), 20 credits / 30 HE creditsStudent thesisAlternative title
Djupinlärningsbaserade strålformningsalgoritmer för talseparation i scenarier med flera talare : Kombinera TCN-nätverk och DoA-uppskattning för offline-talutvinning (Swedish)
Abstract [en]

Speech separation aims to recover the clean speech signals of individual speakers from multi-speaker mixtures corrupted by noise, interference, and reverberation. Classical multichannel beamforming methods such as the minimum variance distortionless response (MVDR) beamformer and the multichannel Wiener filter (MWF) provide effective solutions under idealized conditions, but their performance depends critically on accurate estimates of spatial covariance matrices (SCM) and steering vectors. In realistic environments with overlapping speakers and strong reverberation, these conditions are rarely satisfied. As a result, traditional approaches often require prior information such as room geometry, microphone positions, or pre-calibration, which is impractical for real-world deployments. This thesis investigates data-driven estimation of the acoustic parameters needed for parametric multichannel beamforming, with a particular focus on the parametric multichannel Wiener filter (PMWF). The work explores how deep neural networks can estimate speech presence probabilities and other second-order statistics directly from the short-time Fourier transform (STFT) of multichannel microphone signals, without relying on prior knowledge of the acoustic environment. Building on these components, the thesis develops a complete framework for multi-talker speech enhancement that combines neural parameter estimation with classical spatial filtering. The system includes multi-channel speech presence probability (MC-SPP) estimation, recursive speech and noise covariance updates, source number estimation, and parameter-controlled beamforming. Experimental results show that the proposed approach outperforms conventional methods in challenging multi-speaker and reverberant conditions, providing improved target speech quality, enhanced interference suppression, and more stable behavior across diverse environments. These findings demonstrate the effectiveness of integrating model-based beamforming with data-driven parameter estimation, enabling more robust and adaptable spatial filtering systems for applications in smart devices, conferencing platforms, and human–machine interfaces.

Abstract [sv]

Talseparation syftar till att återskapa de rena talsignalerna från varje enskild talare i flertalarblandningar som är störda av brus, interferens och efterklang. Klassiska flerkanaliga beamformingmetoder såsom minimum variance distortionless response (MVDR) och multikanalig Wienerfiltrering (MWF) ger effektiva lösningar under idealiserade förhållanden, men deras prestanda är starkt beroende av noggranna skattningar av rumsliga kovariansmatriser och styrvektorer. I verkliga miljöer med överlappande talare och kraftig efterklang uppfylls dessa villkor sällan. Därför kräver traditionella metoder ofta förhandsinformation såsom rummets geometri, mikrofonernas positioner eller förkalibrering, vilket inte är praktiskt genomförbart i många användningsområden. Detta examensarbete undersöker datadrivna metoder för att estimera de akustiska parametrar som behövs för parametrisk flerkanalig beamforming, med särskilt fokus på det parametriska multikanaliga Wienerfiltret (PMWF). Arbetet studerar hur djupa neurala nätverk kan uppskatta talnärvarosannolikheter och andra sekundära ordningens statistiska parametrar direkt från den korttids-Fouriertransformerade (STFT) representationen av flerkanaliga mikrofonsignaler — utan krav på förhandskunskap om akustiska förhållanden. Med dessa komponenter som grund utvecklas ett komplett ramverk för flertalartalsförbättring som kombinerar neurala parameterskattningar med klassisk rumslig filtrering. Systemet omfattar uppskattning av flerkanalig talnärvarosannolikhet (MC- SPP), rekursiv uppdatering av tal- och bruskovariansmatriser, skattning av antal talare samt parameterstyrd beamforming. Experimentella resultat visar att det föreslagna angreppssättet överträffar konventionella metoder i utmanande flertalar- och efterklangsdominerade miljöer, med förbättrad talkvalitet, bättre undertryckning av interferens och mer stabil prestanda över varierande akustiska förhållanden. Dessa resultat visar på effektiviteten hos en integration av modellbaserad beamforming och databaserad parameterskattning, vilket möjliggör mer robusta och anpassningsbara system för talförbättring i smarta enheter, konferenssystem och människa–maskin-gränssnitt.

Place, publisher, year, edition, pages
2026. , p. 108
Series
TRITA-EECS-EX ; 2026:190
Keywords [en]
Source separation, Multichannel speech presence probability (MC-SPP), Beamforming, Supervised learning
Keywords [sv]
Källseparation, flerkanalig talpresenssannolikhet (MC-SPP), strålformning, övervakad inlärning
National Category
Electrical Engineering, Electronic Engineering, Information Engineering
Identifiers
URN: urn:nbn:se:kth:diva-386408OAI: oai:DiVA.org:kth-386408DiVA, id: diva2:2089123
External cooperation
Sigma Connectivity WSI AB
Subject / course
Embedded System Design
Educational program
Master of Science - Embedded Systems
Supervisors
Examiners
Available from: 2026-08-31 Created: 2026-07-31 Last updated: 2026-08-31Bibliographically approved

Open Access in DiVA

fulltext(46552 kB)14 downloads
File information
File name FULLTEXT01.pdfFile size 46552 kBChecksum SHA-512
9f171c6f3f1071e14529b2840222c7ee03ab7054effe0f89b3adb35903ef06aabb410b50a71a9b5df43d728de0d12665f4fe554b1a6463f609ae6b18795fa7a3
Type fulltextMimetype application/pdf

Search in DiVA

By author/editor
Wang, Ruolan
By organisation
School of Electrical Engineering and Computer Science (EECS)
Electrical Engineering, Electronic Engineering, Information Engineering

Search outside of DiVA

GoogleGoogle Scholar
The number of downloads is the sum of all downloads of full texts. It may include eg previous versions that are now no longer available

urn-nbn

Altmetric score

urn-nbn
Total: 344 hits
CiteExportLink to record
Permanent link

Direct link
Cite
Citation style
  • apa
  • ieee
  • modern-language-association-8th-edition
  • vancouver
  • Other style
More styles
Language
  • de-DE
  • en-GB
  • en-US
  • fi-FI
  • nn-NO
  • nn-NB
  • sv-SE
  • Other locale
More languages
Output format
  • html
  • text
  • asciidoc
  • rtf