AI agentslong-horizon task executionpublished Aug 18, 2026 · arXiv:2608.15089StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling