kth.sePublikationer KTH
Ändra sökning
RefereraExporteraLänk till posten
Permanent länk

Direktlänk
Referera
Referensformat
  • apa
  • ieee
  • modern-language-association-8th-edition
  • vancouver
  • Annat format
Fler format
Språk
  • de-DE
  • en-GB
  • en-US
  • fi-FI
  • nn-NO
  • nn-NB
  • sv-SE
  • Annat språk
Fler språk
Utmatningsformat
  • html
  • text
  • asciidoc
  • rtf
Risk-averse learning with non-stationary distributions
KTH, Skolan för elektroteknik och datavetenskap (EECS), Reglerteknik.ORCID-id: 0000-0003-1146-2473
KTH, Skolan för elektroteknik och datavetenskap (EECS), Reglerteknik.ORCID-id: 0000-0001-6464-492X
College of Electronics and Information Engineering, State Key Laboratory of Autonomous Intelligent Unmanned Systems, Tongji University, Shanghai, 200092, China.
Mechanical Engineering and Material Science, Duke University, Durham, NC 27708, USA.
Visa övriga samt affilieringar
2026 (Engelska)Ingår i: Automatica, ISSN 0005-1098, E-ISSN 1873-2836, Vol. 190, artikel-id 113060Artikel i tidskrift (Refereegranskat) Published
Abstract [en]

Considering non-stationary environments in online optimization enables decision-makers to effectively adapt to changes and improve their performance over time. In such cases, it is favorable to adopt a strategy that minimizes the negative impact of change to avoid potentially risky situations. In this paper, we investigate risk-averse online optimization where the distribution of random costs changes over time. The Conditional Value at Risk (CVaR) is employed as risk measure. Due to the difficulty of obtaining the exact CVaR gradient, we employ a zeroth-order approach that queries the cost values multiple times per iteration and estimates the CVaR gradient from these samples. In regret analysis, the varying distributions are captured by a novel variation metric based on the Wasserstein distance. Given that the distribution variation is sublinear in the iteration horizon, we show that the developed learning algorithm achieves sublinear dynamic regret with high probability for both convex and strongly convex functions. Moreover, theoretical results suggest that dynamic regret bounds decrease with increasing sampling numbers until they reach a specific limit. Finally, we provide numerical experiments of dynamic pricing in a parking lot to illustrate the efficacy of the designed algorithm.

Ort, förlag, år, upplaga, sidor
Elsevier BV , 2026. Vol. 190, artikel-id 113060
Nyckelord [en]
Dynamic regret, Online convex optimization, Risk-averse, Time-varying distribution
Nationell ämneskategori
Datavetenskap (datalogi) Sannolikhetsteori och statistik
Identifikatorer
URN: urn:nbn:se:kth:diva-382822DOI: 10.1016/j.automatica.2026.113060Scopus ID: 2-s2.0-105038838361OAI: oai:DiVA.org:kth-382822DiVA, id: diva2:2064538
Anmärkning

QC 20260602

Tillgänglig från: 2026-06-02 Skapad: 2026-06-02 Senast uppdaterad: 2026-06-02Bibliografiskt granskad

Open Access i DiVA

Fulltext saknas i DiVA

Övriga länkar

Förlagets fulltextScopus

Person

Wang, SiyiWang, ZifanJohansson, Karl Henrik

Sök vidare i DiVA

Av författaren/redaktören
Wang, SiyiWang, ZifanJohansson, Karl Henrik
Av organisationen
Reglerteknik
I samma tidskrift
Automatica
Datavetenskap (datalogi)Sannolikhetsteori och statistik

Sök vidare utanför DiVA

GoogleGoogle Scholar

doi
urn-nbn

Altmetricpoäng

doi
urn-nbn
Totalt: 11 träffar
RefereraExporteraLänk till posten
Permanent länk

Direktlänk
Referera
Referensformat
  • apa
  • ieee
  • modern-language-association-8th-edition
  • vancouver
  • Annat format
Fler format
Språk
  • de-DE
  • en-GB
  • en-US
  • fi-FI
  • nn-NO
  • nn-NB
  • sv-SE
  • Annat språk
Fler språk
Utmatningsformat
  • html
  • text
  • asciidoc
  • rtf