This is an unreviewed computational study comparing data policy configurations in a controlled setting with null findings; it advances methodology for RLVR evaluation but does not demonstrate that any proposed approach outperforms the baseline.
Reported
Uniform GRPO improvement over unt…7.76 percentage points
Number of data policy configurati…13
Number of matched seeds per confi…12