Frameskipping and Exploration Strategies for Deep Q-Networks
2024 (English)Independent thesis Basic level (degree of Bachelor), 10 credits / 15 HE credits
Student thesis
Abstract [en]
This paper studies the impact of frameskipping strategies and explorationpolices on the efficiency and the performance of Deep Q-Network (DQN) agents in theArcade Learning Environment (ALE), using the game Space Invaders. Two frameskippingstrategies are examined: fixed steps and fixed episodes. In fixed steps training, agents aretrained for a set number of steps, resulting in a fixed number of experiences. In fixed episodestraining, agents are trained until a set number of episodes is completed, resulting in varyingnumbers of experiences. The findings suggest that higher frameskips shorten DQN trainingwithout performance loss when utilizing the strategy to train over fixed episodes. Conversely,higher performance is achieved by increasing frameskip when training over fixed steps. Thissuggests that the amount of episodes experienced by the DQN is of significant importance toincrease performance. In addition, two agents trained on different exploration policies ε-greedy exploration policy and Boltzmann exploration policy, are compared. The results showthat ε-greedy implementation outperformed Boltzmann exploration, which might be onaccount of the sensitivity of the Boltzmann temperature parameter τ .
Abstract [sv]
Den här rapporten undersöker påverkan av frameskipping strategieroch utforskning policyer har på effektiviteten och prestandan av agenter tränade med Djup Q-inlärning (DQN) för Arcade Learning Environment (ALE), i spelet Space Invaders. Tvåframeskipping strategier undersökes: fasta steg och fasta episoder. Fasta steg innebär attagenten tränas ett fast antal steg, vilket resulterar i en konstant mängd erfarenheter. Fastaepisoder innebär att agenten tränar ett fast antal episoder med varierande numer averfarenheter. Resultaten tyder på att högre frameskip kan användas för att efektiviseratränigen för en DQN utan att kompromissa prestandan genom att använda strategin över fastaepisoder. Och omvänt så kan högre prestanda fås genom träning över fasta steg. Detta tyderpå att mängden episoder som DQN uplever är av stor betydelse för prestandan. Dessutomimplementeras ε-girig utfrorsknings policy och Boltzmann utforsknings policy i syfte att göraen generell jämförelse mellan de två. Resultaten återspeglar att ε-girig utforsknings policypresterarade bättre än Boltzmanns utforsknings policy, antagligen på grund av känsligheten avBoltzmann temperaturparametern τ.
Place, publisher, year, edition, pages
2024. , p. 65-74
Series
TRITA-EECS-EX ; 2024:136
Keywords [en]
Frameskipping, Deep Q-Networks(DQN), Arcade Learning Environment (ALE), Space Invaders, Boltzmann, ϵ-Greedy
National Category
Electrical Engineering, Electronic Engineering, Information Engineering
Identifiers
URN: urn:nbn:se:kth:diva-357842OAI: oai:DiVA.org:kth-357842DiVA, id: diva2:1922200
Supervisors
Examiners
Projects
Kandidatexamensarbete i Elektroteknik 20242024-12-182024-12-18