This is an unrefereed arXiv preprint describing a novel method for training language model agents; it reports improvements over a baseline in a controlled setting but has not undergone peer review.
Reported
macro best@4 improvement (Search-…2.5 points
macro best@4 improvement (DeepEye…2.8 points
Throughput improvement (lookahead)24%