simmediumoffline-rlmetric · varies

Opinion: Towards Unified Expressive Policy Optimization for Robust Robot Learning

Description

Offline-to-online reinforcement learning (O2O-RL) has emerged as a promising paradigm for safe and efficient robotic policy deployment but suffers from two fundamental challenges: limited coverage of multimodal behaviors and distributional shifts during online adaptation. We propose UEPO, a unified generative framework inspired by large language model pretraining and fine-tuning strategies. Our contributions are threefold: (1) a multi-seed dynamics-aware diffusion policy that efficiently capture

Source

http://arxiv.org/abs/2511.10087v1