Spiking Reinforcement Learning for Robust Robot Control Under Varying Operating Conditions
2022 (English)Independent thesis Advanced level (degree of Master (Two Years)), 20 credits / 30 HE credits
Student thesisAlternative title
Spikande Förstärkningsinlärning för Robust Robotreglering under Varierande Driftsförhållanden (Swedish)
Abstract [en]
Over the last few years, deep reinforcement learning (RL) has gained increasing popularity for its successful application to a variety of complex control and decision-making tasks. As the demand for deep RL algorithms deployed in challenging real-world environments grows, their robustness towards uncertainty, disturbances and perturbations of the environment becomes more and more important. However, most traditional deep reinforcement learning methods are not inherently robust. Instead, many state-of-the-art deep RL algorithms have been observed to struggle with uncertainties and unforeseen changes in the environment. Spiking neural networks (SNNs) represent a new generation of neural networks that bridge the gap between neuroscience and machine learning. Unlike conventional ANNs, SNNs employ biological neuron models as computational units that communicate via sparse, event-driven sequences of electrical impulses. When deployed on dedicated neuromorphic hardware, spiking neural networks exhibit favorable properties such as high energyefficiency and low latency. Recent research further indicates that SNNs are inherently robust to noise and small input errors. This makes them promising candidates to be applied within the field of reinforcement learning. In this thesis, we propose the fully spiking deep deterministic policy gradient (FS-DDPG) algorithm, a spiking actor-critic network for continuous control that can handle high-dimensional state and action spaces. Unlike conversion-based methods, the FS-DDPG algorithm is trained directly via error backpropagation based on surrogate gradients. We show that the FS-DDPG algorithm can successfully learn control policies for different locomotion problems, each involving the control of complex multi-joint dynamics. Furthermore, we evaluate the algorithm’s robustness towards sensor noise and perturbations of the environment, and compare it to the DDPG algorithm, a non-spiking actor-critic network with comparable network architecture. While the DDPG algorithm outperforms the spiking actor-critic network on the control tasks, we find the FS-DDPG algorithm to be more robust to sensor noise and measurement errors. Moreover, both algorithms seem to respond similarly to perturbations of the environment. Our results align with previous works and indicate that spiking neural networks exhibit desirable robustness properties towards sensor noise and measurement errors. Aside from low latency and high power-efficiency on neuromorphic hardware, this might be a substantial advantage of SNNs, in particular within reinforcement learning.
Abstract [sv]
Under de senaste åren har djup förstärkningsinlärning (RL) blivit alltmer populär för sin framgångsrika tillämpning på en mängd komplexa uppgifter inom reglerteknik och beslutsfattning. När efterfrågan på djupa RL-algoritmer som används i utmanande verkliga miljöer växer, blir deras robusthet mot osäkerhet, störningar och brus i miljön allt viktigare. De flesta traditionella metoder för inlärning av djup förstärkning är dock inte i sig robusta. Istället har många toppmoderna djupa RL-algoritmer uppvisat svårigheter med hantering av osäkerheter och oförutsedda förändringar i miljön. Spikande neurala nätverk (SNN) representerar en ny generation av neurala nätverk som överbryggar klyftan mellan neurovetenskap och maskininlärning. Till skillnad från konventionella ANN använder SNN biologiska neuronmodeller som beräkningsenheter som kommunicerar via glesa, händelsedrivna sekvenser av elektriska impulser. När de distribueras på dedikerad neuromorf hårdvara, uppvisar spikande neurala nätverk gynnsamma egenskaper såsom hög energieffektivitet och låg latens. Ny forskning visar vidare att SNN:er är robusta mot brus och små inmatningsfel. Detta gör dem till lovande kandidater att tillämpas inom området förstärkningsinlärning. I den här avhandlingen föreslår vi algoritmen fully spiking deep deterministic policy gradient (FS-DDPG), ett spikande aktör-kritiskt nätverk för kontinuerlig kontroll som kan hantera högdimensionella tillstånd och handlingsutrymmen. Till skillnad från konverteringsbaserade metoder tränas FSDDPG algoritmen direkt via backpropagation baserat på surrogatgradienter. Vi visar att FS-DDPG algoritmen framgångsrikt kan lära sig kontrollregler för olika rörelseproblem, som var och en involverar styrning av komplex dynamik med flera leder. Dessutom utvärderar vi algoritmens robusthet mot sensorbrus och störningar i miljön, och jämför den med DDPG algoritmen, ett ickespikande aktör-kritiskt nätverk med jämförbar nätverksarkitektur. Samtidigt som DDPG algoritmen överträffar det spikande aktör-kritiska nätverket i de reglertekniska uppgifterna, visar vi att FS-DDPG algoritmen är mer robust mot sensorbrus och mätfel. Dessutom verkar båda algoritmerna svara på liknande sätt på störningar i miljön. Våra resultat är i linje med tidigare arbeten och indikerar att spikande neurala nätverk uppvisar önskvärda robusthetsegenskaper mot sensorbrus och mätfel. Utöver låg latens och hög energieffektivitet på neuromorf hårdvara, kan detta vara en betydande fördel med SNN, särskilt inom förstärkningsinlärning.
Place, publisher, year, edition, pages
2022. , p. 117
Series
TRITA-EECS-EX ; 2022:885
National Category
Computer and Information Sciences
Identifiers
URN: urn:nbn:se:kth:diva-325051OAI: oai:DiVA.org:kth-325051DiVA, id: diva2:1746001
Supervisors
Examiners
2023-03-282023-03-272023-03-28Bibliographically approved