terminal agentsreinforcement learningpublished Oct 5, 2026 · arXiv:2610.02405When Terminal-Agent Training Stalls: Demystifying Data Generation and Verification Challenge