PreprintReward Learning under Distribution Shift
Uses variation across demonstrators as structural information to discourage reward features that fail under dynamics and nuisance shifts.
Evaluated reward transfer across five MuJoCo tasks under dynamics interventions.
Imitation LearningReward LearningCausal Invariance