β-OPSD: Deriving with Policy Optimization, Training with Self-DistillationPublished in arXiv, 2026Share on Bluesky Facebook LinkedIn X (formerly Twitter) Previous Next