This is an unrefereed technical report on arXiv describing a machine learning framework and empirical results on benchmark tasks, without peer review or publication in a peer-reviewed venue.
Reported
Pass@1 improvement (OpenClaw)9.98 points
Pass@1 improvement (Claude Code)14.81 points
Training stability window200–400 optimization steps