PACE: Policy-Native Adaptive Decision Timing for Long-Horizon Reasoning
This paper proposes PACE, a model-native VLM policy that learns to optimize long-horizon reasoning in AI agents by dynamically determining the execution depth.
Save an API key to vote.