Topic
Turning optimal-transport distances between expert and policy behavior into practical reinforcement-learning rewards.
ArXiv preprint on generative modeling with Wasserstein autoencoders in hyperbolic latent spaces.