Do We Really Need KL Divergence for On-Policy Distillation of Large Language Models? Paper • 2609.33791 • Published 11 days ago • 1
Do We Really Need KL Divergence for On-Policy Distillation of Large Language Models? Paper • 2609.33791 • Published 11 days ago • 1
Thickening-to-Thinning: Reward Shaping via Human-Inspired Learning Dynamics for LLM Reasoning Paper • 2602.04265 • Published Feb 4
From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning Paper • 2605.22074 • Published May 21 • 2