Topic
ArXiv preprint on reward learning from diverse demonstrations that remain stable under environment shifts.
Turning optimal-transport distances between expert and policy behavior into practical reinforcement-learning rewards.