FAER: Auditable Utility-Aligned Trajectory Replay for Language Model Post-Training
The paper proposes FAER, an auditable full-trajectory replay framework for language models, addressing the gap between selection and learning objectives. It introduces a training-free fixed selector and a learner-aware selector fitted on disjoint calibration blocks.
Save an API key to vote.