PulseExploreJournal ClubDebatesTrendingResearchersJournals
Instagram
HomeExploreJournal ClubTrending
Synapse
⌘+K
Synapse
October 5, 20250 citationsOpen Access

RiskPO: Risk-based Policy Optimization via Verifiable Reward for LLM Post-Training

View Full Paper
TRTao RenHuazhong Agricultural UniversityJJJinyang JiangPeking UniversityHYHui YangBeijing University of Posts and Telecommunications

Key Points

  • Risk-based policy optimization significantly improves reasoning capabilities in large language models, enhancing performance metrics.
  • Applying a Mixed Value-at-Risk objective boosts training efficiency, demonstrating notable advantages over traditional methods.
  • A bundling scheme aggregating multiple challenges promotes informative feedback, resulting in more stable training dynamics.
  • The proposed approach alleviates entropy collapse issues, indicating a shift towards more effective exploration strategies.

Abstract

Reinforcement learning with verifiable reward has recently emerged as a central paradigm for post-training large language models (LLMs); however, prevailing mean-based methods, such as Group Relative Policy Optimization (GRPO), suffer from entropy collapse and limited reasoning gains. We argue that these issues stem from overemphasizing high-probability output sequences while neglecting rare but informative reasoning paths. To address these challenges, we propose Risk-based Policy Optimization (RiskPO), which substitutes classical mean-based objectives with principled risk measures. Specifically, we introduce a Mixed Value-at-Risk objective that integrates weighted attention over multiple regions of the reward distribution, thereby amplifying gradient signals on challenging instances and preventing overconfident convergence. We further design a bundling scheme that aggregates multiple questions into bundles, thus enriching the feedback signal and yielding more stable and informative training dynamics. Theoretically, we prove that the risk-averse update alleviates entropy collapse and promotes exploration. Numerically, RiskPO achieves consistent and significant improvements in mathematical reasoning, multi-modal reasoning, and code generation benchmarks, surpassing GRPO and its variants on both Pass@1 and Pass@k metrics. Our results demonstrate that risk-based optimization provides a rigorous and effective paradigm for enhancing LLM reasoning capabilities.

Ask AI
Helpful
Bookmark
Share
View Full Paper

Cite This Study

Ren et al. (2025) studied this question.

synapsesocial.com/papers/68e25378d6d66a53c247428chttps://doi.org/10.48550/arxiv.2510.00911
Ask AI
Helpful
Bookmark
Share
View Full Paper

Also Consider

Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context:

  1. 1Risk-Sensitive RL for Alleviating Exploration Dilemmas in Large Language Models2025
  2. 2CLPO: Curriculum Learning meets Policy Optimization for LLM Reasoning2025
  3. 3Uncalibrated Reasoning: GRPO Induces Overconfidence for Stochastic Outcomes2025
  4. 4Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting2025
  5. 5TreeRPO: Tree Relative Policy Optimization2025