A transformer-based model that treats reinforcement learning as a sequence prediction problem, conditioning on past returns and states to generate actions.