FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience
3 Sep 2026
A reasoning model can improve from its own on-policy experience, but this inner loop is fragile: terminal verifiers provide reliable yet sparse supervision, while dense same-model guidance can reinforce false confidence or overconcentrate learning on a narrow solution mode.