Concepts

GRPO

Reference entryTraining and efficiency
Reference entryGRPO

Group relative policy optimization trains a policy by comparing rewards among multiple responses to the same prompt, avoiding a separate learned value model.

Also known as Group relative policy optimization.

Where it sits