kth.sePublikationer KTH
RefereraExporteraLänk till posten
Permanent länk

Direktlänk
Referera
Referensformat
  • apa
  • ieee
  • modern-language-association-8th-edition
  • vancouver
  • Annat format
Fler format
Språk
  • de-DE
  • en-GB
  • en-US
  • fi-FI
  • nn-NO
  • nn-NB
  • sv-SE
  • Annat språk
Fler språk
Utmatningsformat
  • html
  • text
  • asciidoc
  • rtf
Deep Learning-baserat system för upptäckt av falska röster
KTH, Skolan för kemi, bioteknologi och hälsa (CBH), Medicinteknik och hälsosystem, Hälsoinformatik och logistik.
2026 (Svenska)Självständigt arbete på grundnivå (kandidatexamen), 10 poäng / 15 hpStudentuppsats (Examensarbete)Alternativ titel
Deep Learning-Based System for Voice Spoofing Detection (Engelska)
Abstract [sv]

Sammanfattning

Röstbaserad autentisering används i allt större utsträckning inom finansiella system och andra säkerhetskritiska miljöer. Utvecklingen har lett till att systemen blivit mer sårbara för spoofing-attacker, särskilt sådana som bygger på syntetiskt eller manipulerat tal. Samtidigt som teknik för syntetiskt tal utvecklas, utgör attacker ett hot mot tillförlitligheten på automatiska talverifieringssystem (ASV).

Mot denna bakgrund undersöker denna studie hur effektivt olika djupinlärningsbaserade modeller kan användas för att upptäcka spoofing-attacker. Studien genomför en jämförande analys av fyra olika arkitekturer med hjälp av ASVspoof 2019 Logical Access-datasetet. De modeller som ingår i utvärderingen är ett VGG-inspirerat konvolutionellt neuralt nätverk (CNN), Long Short-Term Memory (LSTM), Gated Recurrent Unit (GRU) samt bidirektionell GRU (BiGRU). Modellerna valdes utifrån dektekteringsprestanda med hänsyn till beräkningskrav och praktisk användbarhet.  

För att bedöma modellernas prestanda används flera etablerade utvärderingsmått, däribland Equal Error Rate (EER), minimum normaliserad tandem Detection Cost Function (t-DCF), noggrannhet, precision, recall, F1-poäng och AUC. Confusion matrix analyseras också för att ge en mer detaljerad bild av modellernas felbeteende.

Resultaten visar att de rekurrenta arkitekturerna presterar bättre än den konvolutionella baslinjemodellen. BiGRU uppvisar bäst resultat, med de lägsta värdena för EER och t-DCF, samtidigt som den uppvisar hög noggrannhet och F1-poäng. Detta indikerar att modellen på ett effektivt sätt kan skilja mellan äkta och manipulerade röstprover och samtidigt upprätthålla en god balans mellan säkerhet och användbarhet. Även den CNN-baserade modellen uppvisar konkurrenskraftiga resultat, medan LSTM-modellen visar tecken på begränsad generaliseringsförmåga trots hög träningsnoggrannhet, vilket tyder på överanpassning.

Sammanfattningsvis visar studien att GRU-baserade arkitekturer, och i synnerhet BiGRU, är lämpad för robust och kostnadseffektiv spoofing-detektion i röstbaserade autentiseringssystem. De erbjuder balans mellan dektekteringsprestandan i relation till beräkningskraven, vilket gör dem effektiva för praktisk implementering.

Abstract [en]

Abstract

Voice-based authentication is increasingly used in financial systems and other security-critical environments. However, this development has made such systems more vulnerable to spoofing attacks, particularly those based on synthetic or manipulated speech. As speech synthesis technologies continue to advance, these attacks pose a significant threat to the reliability of automatic speaker verification (ASV) systems.

Against this background, this study investigates how effectively different deep learning–based models can be used to detect spoofing attacks. A comparative analysis is conducted using the ASVspoof 2019-LA-dataset. The evaluated models include a VGG-inspired Convolutional Neural Network (CNN), Long Short-Term Memory (LSTM), Gated Recurrent Unit (GRU), and Bidirectional GRU (BiGRU). The models were selected not only based on detection performance, but also with consideration of computational requirements and practical applicability.

To assess model performance, several established evaluation metrics are used, including Equal Error Rate (EER), minimum normalized tandem Detection Cost Function (t-DCF), accuracy, precision, recall, F1-score, and Area Under the Curve (AUC). Confusion matrix analysis is also performed to provide a more detailed understanding of the models’ error behavior.

Results show that recurrent architectures perform better than the convolutional baseline model. Particularly the BiGRU, achieved the strongest performance across evaluation metrics. These findings indicate that the model can effectively distinguish between genuine and spoofed speech samples while maintaining a good balance between security and usability. CNN-based models also demonstrate competitive performance, whereas the LSTM model shows signs of limited generalization despite high training accuracy, suggesting overfitting.

In conclusion, the study demonstrates that GRU-based architectures, and BiGRU in particular, are well suited for robust and cost-effective spoofing detection in voice-based authentication systems, offering a favorable trade-off between high detection performance and relatively low computational requirements.

Ort, förlag, år, upplaga, sidor
2026. , s. 76
Serie
TRITA-CBH-GRU ; 140
Nyckelord [en]
ASVspoof 2019, Anti-Spoofing, BiGRU, Convolutional Neural Networks (CNN), Deep Learning, Equal Error Rate (EER), GRU, Model Evaluation, Recurrent Neural Networks, Speaker Verification, Spoof Detection, t-DCF, Voice Biometrics
Nyckelord [sv]
ASVspoof 2019, Anti-spoofing, BiGRU, Konvolutionella neurala nätverk (CNN), Deep Learning, Equal Error Rate (EER), GRU, Modellutvärdering, Recurrent Neural Networks (RNN), Talarverifiering, Detektion av röstspoofing, t-DCF, Röstbiometri
Nationell ämneskategori
Artificiell intelligens Säkerhet, integritet och kryptologi
Identifikatorer
URN: urn:nbn:se:kth:diva-382880OAI: oai:DiVA.org:kth-382880DiVA, id: diva2:2065258
Ämne / kurs
Datateknik med ekonomi
Utbildningsprogram
Högskoleingenjörsexamen - Teknik och ekonomi
Handledare
Examinatorer
Tillgänglig från: 2026-06-03 Skapad: 2026-06-03 Senast uppdaterad: 2026-06-03Bibliografiskt granskad

Open Access i DiVA

Deep Learning-baserat system för upptäckt av falska röster(2330 kB)47 nedladdningar
Filinformation
Filnamn FULLTEXT01.pdfFilstorlek 2330 kBChecksumma SHA-512
6da0b58c0d37941333b1ad0bcbf8eaa9fc12135ecf24c7bfa236c891d4702ffbd0533d5d913c002720c27fc0e3f90a276d877390ea8247a9aadf69dac8d2e302
Typ fulltextMimetyp application/pdf

Av organisationen
Hälsoinformatik och logistik
Artificiell intelligensSäkerhet, integritet och kryptologi

Sök vidare utanför DiVA

GoogleGoogle Scholar
Antalet nedladdningar är summan av nedladdningar för alla fulltexter. Det kan inkludera t.ex tidigare versioner som nu inte längre är tillgängliga.

urn-nbn

Altmetricpoäng

urn-nbn
Totalt: 198 träffar
RefereraExporteraLänk till posten
Permanent länk

Direktlänk
Referera
Referensformat
  • apa
  • ieee
  • modern-language-association-8th-edition
  • vancouver
  • Annat format
Fler format
Språk
  • de-DE
  • en-GB
  • en-US
  • fi-FI
  • nn-NO
  • nn-NB
  • sv-SE
  • Annat språk
Fler språk
Utmatningsformat
  • html
  • text
  • asciidoc
  • rtf