A training process where a model is repeatedly refined by learning from its own improved outputs, similar to the Bellman update in reinforcement learning.