Scoring Higher, Answering Worse: Mitigating Reward Hacking in Rubric-Based RL via Protocol-Level Rubrics
Researchers proposed Protocol-level Rubrics (ProRubric), a protocol-level aggregation method for rubric-based reinforcement learning that improves appropriateness and maintains coverage. The method groups criteria into dimensions, counting only when all criteria hold, and has shown a 10.8-point increase in appropriateness without losing coverage.
Save an API key to vote.