Recent breakthroughs in Deep Learning and Reinforcement Learning have enabled the new field of Deep Reinforcement Learning. This study explores some of the state of the art applications of deep reinforcement learning in the field of finance and algorithmic trading. By building on previous research from Yang et al. at Columbia University, this study aims to validate their findings and explore ways to improve their proposed trading model using the Sharpe ratio in the reward function. We show that there is significant variability in the performance of their trading model and question their premise of basing their results on the best performing model iteration. Moreover, we explore how the Sharpe ratio calculated over a 21 day and 63 day rolling period can be used as a reward function. However, this did not result in any significant change in outcome which could be attributed to the high performance variability in both the original algorithm and our changed algorithm which thwarts consistent conclusions.
Nya genombrott inom djupinlärning och förstärkningsinlärning har möjliggjort forskningsområdet djup förstärkningsinlärning. Den här studien utforskar några nya appliceringsområden av djup förstärkningsinlärning inom finans och algoritmisk handel. Genom att bygga på tidigare forskning av Yang et al. från Columbia University avser den här studien att validera deras resultat och hitta sätt att förbättra deras föreslagna modell med hjälp av Sharpekvoten som belöningsfunktion. Vi visar att det är stor varians i prestandan av deras modell och ifrågasätter deras premiss av att basera sina resultat på deras bästa modellinstans. Vidare utforskar vi hur Sharpekvoten beräknad rullande över 21 dagar och 63 dagar kan användas som belöningsfunktion. Resultaten visade däremot inte på någon signifikant förändring i prestanda vilket kan förklarars av den stora variansen i modellprestandan som försvårar konsekventa slutsatser.