This is an unrefereed arXiv preprint describing a machine learning model development and benchmark evaluation with no peer review reported; it reports empirical results but lacks independent validation.
Reported
Terminal-Bench 2.1 baseline perfo…43.8%
Terminal-Bench 2.1 T1 performance64.0%
Long-Horizon Terminal Bench T1 pe…27.9%