Robust reinforcement learning
Methods and evaluation for distribution shift, rare failures, curriculum design, sim-to-real transfer, and policies deployed on physical robots.
Reinforcement learning for reliable agents
I develop reinforcement-learning methods for robust behavior under imperfect objectives and distribution shift—from deployed robotics to foundation-model post-training.
Reinforcement Learning Engineer, ANYbotics · ETH Zürich PhD
End-to-end training and evaluation for locomotion policies under terrain, sensing, and dynamics shift, centered on rare failures and sim-to-real robustness.
Physical deployment, failure-oriented evaluation, and large-scale GPU simulation.
Invariant reward learning uses variation across demonstrators to identify features that remain stable under dynamics and nuisance shifts.
Improved reward transfer across five MuJoCo tasks under dynamics interventions.
Sliced-Wasserstein occupancy matching becomes a transition-level reward for off-policy imitation learning.
Remained effective under up to 100× demonstration subsampling on Ant and Humanoid.
Research themes
I study how supervision, objectives, and training distributions determine behavior after deployment. The work connects reward and imitation learning, failure-focused robot training, and diagnostics for RL post-training.
Methods and evaluation for distribution shift, rare failures, curriculum design, sim-to-real transfer, and policies deployed on physical robots.
Reward and imitation-learning methods that address distribution matching, misspecification, and behavioral identifiability.
Diagnostics for credit assignment, reward and verifier structure, optimization dynamics, and multimodal or embodied agents.
Preprint / manuscript · Ivan Ovinnikov, Eugene Bykovets, Joachim M. Buhmann
*International Journal of Computer Assisted Radiology and Surgery* · Ivan Ovinnikov, Ami Beuret, Flavia Cavaliere, Joachim M. Buhmann
Research manuscript · Ivan Ovinnikov, Alexander Terenin, Joachim M. Buhmann
ICML 2023 Workshop on Spurious Correlations, Invariance, and Stability · Ivan Ovinnikov, Joachim M. Buhmann
Bayesian Deep Learning Workshop (NeurIPS 2018) · Ivan Ovinnikov
Background
At ANYbotics, I develop and evaluate locomotion policies for industrial quadruped robots. My ETH Zürich PhD focused on reinforcement learning from demonstrations, reward inference, and distribution shift in surgical digital twins.
I build experiments with PyTorch, JAX, GPU simulation, reproducible evaluation, and HPC workflows.