kth.sePublikationer KTH
Ändra sökning
RefereraExporteraLänk till posten
Permanent länk

Direktlänk
Referera
Referensformat
  • apa
  • ieee
  • modern-language-association-8th-edition
  • vancouver
  • Annat format
Fler format
Språk
  • de-DE
  • en-GB
  • en-US
  • fi-FI
  • nn-NO
  • nn-NB
  • sv-SE
  • Annat språk
Fler språk
Utmatningsformat
  • html
  • text
  • asciidoc
  • rtf
Algorithms and Models in Nanopore DNA Sequencing: Advanced Decoding and Modeling with Hierarchical Hidden Markov Models
KTH, Skolan för elektroteknik och datavetenskap (EECS), Intelligenta system, Teknisk informationsvetenskap. (Division of Information Science and Engineering)ORCID-id: 0000-0003-1850-0946
2024 (Engelska)Doktorsavhandling, sammanläggning (Övrigt vetenskapligt)
Abstract [en]

Within less than four decades, the nanopore sequencing technology accelerated from an implausible idea scribbled on a notebook page to one of the decisive contributors to the complete sequence of the human genome. Its rapid evolution, particularly in recent years, is driven not only by its inherent innovation of the nanopores but also by synergistic advancements in complementary fields, such as GPU acceleration and deep neural networks, as well as cross-disciplinary influences from domains like speech recognition. However, during this rapid advancement, certain methods within nanopore sequencing remain relatively unexplored. This oversight has the potential to create bottlenecks in the technology's further development.

In this thesis work, we delve into these uncharted areas, seeking to fill critical gaps and branch the technology into new frontiers. Our objective is to unleash its potential, enabling further breakthroughs in genomic research and beyond.

Through our research, we have developed two novel algorithms and two innovative models tailored to address these under-explored aspects of nanopore sequencing. The two algorithms, the GMBS and the LFBS, both belonging to the MBS group, offer innovative solutions to the challenging decoding problems inherent in HHMMs. They are two distinct variations tailored to different scenarios. While the GMBS is specifically suited for decoding lengthy sequences, such as those encountered in long-read basecalling, the LFBS is optimized for parallel programming and excels in processing short-length sequences. 

The two innovative models developed in this research, each leveraging variations of HHMMs and employing an end-to-end approach, exhibit distinguished structures. The first model, a hybrid of EDHMM and DNN, showcases the effectiveness of integrating both knowledge-driven and data-driven techniques. In contrast, the second model, a custom-designed Helicase HMM, draws inspiration from pioneering studies on motor proteins found in sequencing devices. With its elaborate hierarchical state architecture boasting over five million emission states, this model offers a comprehensive feature space comparable to its predecessor. 

Abstract [sv]

Inom mindre än fyra decennier har nanopore-sekvenseringsteknologin accelererat från en otrolig idé som skissades i en antckningsbok till en avgörande teknologi som bidragit till den kompletta sekvensensieringen av det mänskliga genomet. Denna snabba utveckling, särskilt under de senaste åren, drivs inte bara av innovation kring nanoporer utan också av synergistiska framsteg inom kompletterande områden, såsom GPU-acceleration och djupa neurala nätverk, samt tvärvetenskapligt inflytande från domäner som taligenkänning. Under denna snabba utveckling har do vissa metoder inom nanopore sekvensering förblivit relativt outforskade. Detta förbiseende riskerar att skapa flaskhalsar i teknologins vidareutveckling.

I denna avhandling utforskar vi dessa outforskade områden, i syfte att fylla kritiska luckor och utveckla tekniken mot nya fronter. Vårt mål är att frigöra dess fulla potential och möjliggöra ytterligare genombrott inom genomisk forskning och därutöver.

Som del av vår forskning har vi utvecklat två nya algoritmer och två innovativa modeller anpassade för att adressera dessa underutredda aspekter av nanopore sekvensering. De två algoritmerna, GMBS och LFBS, som är instanser av det mer generella ramverket av MBS-algorithmer (\emph{eng.} marginalised beam search), erbjuder innovativa lösningar på de utmanande avkodningsproblemen som är inneboende i HHMM:er. De är två distinkta variationer anpassade för olika scenarier. Medan GMBS är speciellt lämpad för avkodning av långa sekvenser, såsom de som stöts på vid läsning av långa sekvenser, är LFBS optimerad för parallell programmering och utmärker sig i bearbetning av korta sekvenser.

De två innovativa modellerna som utvecklats i denna forskning, vilka båda utnyttjar variationer av HHMM:er och använder en ``end-to-end''-ansats, uppvisar distinkta strukturer. Den första modellen, en hybrid av EDHMM och DNN, visar effektiviteten av att integrera både kunskapsdrivna och datadrivna tekniker. I kontrast till detta, drar den andra modellen, en anpassad Helicase HMM, inspiration från pionjärstudier om motorproteiner som finns i sekvenseringsenheter. Med sin detaljerade hierarkiska tillståndsarkitektur med över fem miljoner emissivtillstånd, erbjuder denna modell en omfattande egenskapsrymd jämfört med sina föregångare.

Ort, förlag, år, upplaga, sidor
KTH Royal Institute of Technology, 2024. , s. 147
Serie
TRITA-EECS-AVL ; 2024:40
Nationell ämneskategori
Bioinformatik (beräkningsbiologi)
Forskningsämne
Elektro- och systemteknik
Identifikatorer
URN: urn:nbn:se:kth:diva-346051ISBN: 978-91-8040-914-8 (tryckt)OAI: oai:DiVA.org:kth-346051DiVA, id: diva2:1855511
Disputation
2024-05-24, F3, Lindstedtsvägen 26, Stockholm, 13:00 (Engelska)
Opponent
Handledare
Anmärkning

QC 20240502

Hybrid attendance: https://kth-se.zoom.us/j/66248893067

Tillgänglig från: 2024-05-02 Skapad: 2024-05-01 Senast uppdaterad: 2025-11-18Bibliografiskt granskad
Delarbeten
1. Marginalized Beam Search Algorithms for Hierarchical HMMs
Öppna denna publikation i ny flik eller fönster >>Marginalized Beam Search Algorithms for Hierarchical HMMs
2023 (Engelska)Övrigt (Övrigt vetenskapligt)
Nationell ämneskategori
Data- och informationsvetenskap
Identifikatorer
urn:nbn:se:kth:diva-346020 (URN)
Tillgänglig från: 2024-04-29 Skapad: 2024-04-29 Senast uppdaterad: 2024-05-01Bibliografiskt granskad
2. Lokatt: a hybrid DNA nanopore basecaller with an explicit duration hidden Markov model and a residual LSTM network
Öppna denna publikation i ny flik eller fönster >>Lokatt: a hybrid DNA nanopore basecaller with an explicit duration hidden Markov model and a residual LSTM network
2023 (Engelska)Ingår i: BMC Bioinformatics, E-ISSN 1471-2105, Vol. 24, nr 1, artikel-id 461Artikel i tidskrift (Refereegranskat) Published
Abstract [en]

BackgroundBasecalling long DNA sequences is a crucial step in nanopore-based DNA sequencing protocols. In recent years, the CTC-RNN model has become the leading basecalling model, supplanting preceding hidden Markov models (HMMs) that relied on pre-segmenting ion current measurements. However, the CTC-RNN model operates independently of prior biological and physical insights.ResultsWe present a novel basecaller named Lokatt: explicit duration Markov model and residual-LSTM network. It leverages an explicit duration HMM (EDHMM) designed to model the nanopore sequencing processes. Trained on a newly generated library with methylation-free Ecoli samples and MinION R9.4.1 chemistry, the Lokatt basecaller achieves basecalling performances with a median single read identity score of 0.930, a genome coverage ratio of 99.750%, on par with existing state-of-the-art structure when trained on the same datasets.ConclusionOur research underlines the potential of incorporating prior knowledge into the basecalling processes, particularly through integrating HMMs and recurrent neural networks. The Lokatt basecaller showcases the efficacy of a hybrid approach, emphasizing its capacity to achieve high-quality basecalling performance while accommodating the nuances of nanopore sequencing. These outcomes pave the way for advanced basecalling methodologies, with potential implications for enhancing the accuracy and efficiency of nanopore-based DNA sequencing protocols.

Ort, förlag, år, upplaga, sidor
Springer Nature, 2023
Nyckelord
Basecalling, HMM, LSTM, Nanopore sequencing
Nationell ämneskategori
Bioinformatik (beräkningsbiologi)
Identifikatorer
urn:nbn:se:kth:diva-341527 (URN)10.1186/s12859-023-05580-x (DOI)001115621100003 ()38062356 (PubMedID)2-s2.0-85178887529 (Scopus ID)
Anmärkning

QC 20231222

Tillgänglig från: 2023-12-22 Skapad: 2023-12-22 Senast uppdaterad: 2024-05-01Bibliografiskt granskad
3. Modelling the nanopore sequencing process with Helicase HMMs
Öppna denna publikation i ny flik eller fönster >>Modelling the nanopore sequencing process with Helicase HMMs
(Engelska)Manuskript (preprint) (Övrigt vetenskapligt)
Nationell ämneskategori
Bioinformatik (beräkningsbiologi)
Identifikatorer
urn:nbn:se:kth:diva-346049 (URN)
Anmärkning

QC 20240508

Tillgänglig från: 2024-05-01 Skapad: 2024-05-01 Senast uppdaterad: 2024-05-08Bibliografiskt granskad

Open Access i DiVA

kappa(6016 kB)138 nedladdningar
Filinformation
Filnamn FULLTEXT01.pdfFilstorlek 6016 kBChecksumma SHA-512
14a9a28f405b070bf55bf186b27a85bf574d6b24157ae25f9a30fc3517fa983423f48865c1691fb615efef689fa94982b7bcbeb413c652d8fce3c12ebea66d75
Typ fulltextMimetyp application/pdf

Person

Xu, Xuechun

Sök vidare i DiVA

Av författaren/redaktören
Xu, Xuechun
Av organisationen
Teknisk informationsvetenskap
Bioinformatik (beräkningsbiologi)

Sök vidare utanför DiVA

GoogleGoogle Scholar
Totalt: 138 nedladdningar
Antalet nedladdningar är summan av nedladdningar för alla fulltexter. Det kan inkludera t.ex tidigare versioner som nu inte längre är tillgängliga.

isbn
urn-nbn

Altmetricpoäng

isbn
urn-nbn
Totalt: 1862 träffar
RefereraExporteraLänk till posten
Permanent länk

Direktlänk
Referera
Referensformat
  • apa
  • ieee
  • modern-language-association-8th-edition
  • vancouver
  • Annat format
Fler format
Språk
  • de-DE
  • en-GB
  • en-US
  • fi-FI
  • nn-NO
  • nn-NB
  • sv-SE
  • Annat språk
Fler språk
Utmatningsformat
  • html
  • text
  • asciidoc
  • rtf