Group Relative Policy Optimization, a reinforcement learning algorithm for fine-tuning language models with reward signals.
Multi-step reasoning, logic puzzles, mathematical problem-solving