Concepts
GRPO
Reference entryGRPO
Group relative policy optimization trains a policy by comparing rewards among multiple responses to the same prompt, avoiding a separate learned value model.
Also known as Group relative policy optimization.
Where it sits