Jul 23, 2026Measuring advantage collapse in VLA reinforcement learning
A work-in-progress measurement plan for locating where the learning signal disappears between reward, advantage estimation, and policy updates.
Post-TrainingReinforcement LearningVLA Models